한국어EN

2026년 321개 조각

기록 296 · 정리 노트 25

2026 9월 19


Anthropic
인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례

Tingyu Song 외
임베딩 학습의 기본값이던 대조학습보다 다단계 순위 감독이 감독 신호를 더 잘 쓴다고 주장하며, 리랭커를 검색 파이프라인의 후단이 아니라 임베딩 모델의 교사로 재배치한 갈래. 저자 자체 보고로 COLA·SUGARCREPE++·NEGBENCH 3개 구성적 추론 벤치마크에서 CORE-RERANKER-8B가 총평균 82.7%로 Jina-Reranker 대비 10.7포인트 우위, CORE-EMBED-8B가 평가 대상 임베딩 모델 중 최고 총평균 0.666이며 COCO·Flickr30K 검색 성능은 유지.

Google DeepMind·Google Resea
AI 기상 모델이 연구 시연을 넘어 소비자 제품과 상용 API의 기본 예보로 들어감

OpenAI
사이버 Critical 역량 선언과 같은 주에 나온 방어 측 비대칭 보정. 공격 역량의 위험을 접근 통제만이 아니라 방어자 보조금으로 상쇄하려는 접근으로, 프런티어 랩이 중요 인프라 보안의 공급자 위치로 들어감

Sergii Kozyrev, Davyd Maibor
'순환 상태의 오차는 긴 문맥에서 누적된다'는 통념을 뒤집어 하이브리드 LLM의 순환 절반이 오히려 양자화하기 쉬운 쪽이라고 주장하고, NVFP4의 16원소 블록 스케일링이 잔차 스트림의 극단 이상치를 국소화하는 점과 델타 규칙 순환이 주입된 잡음을 32K 토큰에 걸쳐 평탄하게 유지하는 점 등 네 갈래 기계적 설명을 제시. 수치는 저자 자체 보고.

Heng Wang 외
중요도 점수 기반 KV 축출 계보 전체에 대해 '점수 자체가 필요 없다'는 반증을 제기. 취약한 부분은 프롬프트뿐이며 추론 시퀀스는 텍스트 재진술과 여러 어텐션 헤드에 걸친 복제라는 이중 중복성으로 스스로를 지탱하므로 프롬프트만 지키면 무작위 선택으로 충분하다는 것이 저자들의 설명. 수치는 저자 자체 보고.

OpenAI
GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동

xAI
에이전트 배포의 초점이 능력 과시에서 권한·감사 거버넌스로 이동
툴·에이전트공식 발표

Google
공격·방어 이중용도 모델을 심사받은 방어자에게만 배포하는 접근 통제 방식의 제도화

Google DeepMind
보안 전용 파생 모델을 프런티어 라인업의 정식 변종으로 분리 — 취약점 탐지·패치가 모델 제품군의 독립 축이 됨

Meta Superintelligence Labs
MSL이 폐쇄 API 노선을 유지한 채 에이전트 효율(툴 호출·토큰 절감)을 전면 지표로 내세움
툴·에이전트공식 발표

Guowei Wang 외
별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.

OpenAI
범용 챗봇이 규제 의료 기록 시스템에 직접 연결되는 단계. 컨텍스트 연결(RAG·커넥터)의 전선이 공개 웹에서 규제 데이터 영역으로 넘어갔고, 안전성 근거는 아직 벤더 자체 평가에 의존

Shaowen Wang 외
깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.

Anthropic
데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다

xAI
프런티어 랩이 생물보안 거부율을 수치로 공개하고 외부 평가기관을 지정한 사례 — 다만 자사 게시물이며 독립 재현은 없다

OpenAI
자사 위험 프레임워크의 최고 등급이 실제로 발동된 첫 사례. 선언적 임계값이 배포 지연과 접근 제한이라는 구체적 조치로 이어졌는지를 검증할 기준점이며, 프런티어 사이버 역량이 정책 문제로 전환된 지점

Google (Gemini API)
긴 영상을 통째로 넣는 대신 모델이 스스로 탐색하는 방식 — 멀티모달 입력이 에이전트 루프로 편입
멀티모달공식 발표

Anthropic
프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌

2026 8월 79


정리 노트
Herdr는 Orca보다 훨씬 가벼운 원격 터미널 서버로, 터미널만 있으면 리눅스 VM에도 쉽게 설치되고 Ghostty를 꺼도 세션이 그대로 살아 있다. 이를 Grok Bot의 가상 머신에 얹으면 맥북 전원과 무관하게 스마트폰만으로 코딩 에이전트를 상

정리 노트
이순신 명량대첩을 소재로 1분짜리 시네마틱 비디오를 만드는 과정에서 배울 점은 프롬프트를 바로 넣지 않는 순서다. 먼저 명량대첩이라는 주제와 생성 툴의 사용법을 각각 리서치시켜 컨텍스트를 채운 뒤, 두 결과를 합쳐 초 단위 화면 기획이 담긴 툴 전용

HUMAIN·Qualcomm
사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면

Aurélien Lac, Tony Wu
생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.

OpenAI
주 단위 청소년 안전 규제를 프런티어 랩이 선제 지지한 사례. 2024년 SB 1047 반대와 대비되며, 업계가 규제를 전면 거부하는 대신 영역별로 선택 수용하는 국면을 보여줌

캘리포니아 주의회
컴패니언 챗봇의 아동 안전을 성문법으로 다루는 미국 최초의 포괄 입법 시도 — 서명 여부가 주법 표준을 가른다

OpenAI
구독·API 밖의 광고가 소비자 AI의 주요 수익 축으로 공식화. 무료 티어 확산의 재원이 검색 광고와 같은 구조로 수렴하면서 답변과 광고의 분리가 신뢰 쟁점으로 이동

Zihan Qiu 외 (Alibaba Qwen)
프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.

정리 노트
Claude Code에서 좋은 프롬프트를 쓰는 사람은 실력이 아니라 프롬프트 마스터라는 스킬 하나를 설치했을 뿐이라는 것이 이 짧은 클립의 요지다. 최소한의 입력만 줘도 건드릴 파일, 출력 형식, 멈춰야 할 시점까지 채운 완성된 프롬프트로 바꿔 주고,

정리 노트
Anthropic의 /design 스킬은 텍스트 대화로만 디자인을 반복 수정하던 비효율을 겨냥한 기능이다. 애플 기기 리셀 사이트처럼 색상 체계가 정해지지 않은 상태라면 무드보드 3안을 먼저 만들게 요청하는 식으로, 스킬이 세부 질문을 단계별로 던지도

정리 노트
400개 이상의 프로덕션 에이전트 경험에서 정리됐다는 12-레이어 스택은, 가상의 응급실 트리아지 에이전트에서 각 레이어를 boolean 플래그로 켜고 끄며 실패를 재현하는 방식으로 이해하면 명확하다. 데이터 이해 레이어가 없으면 알레르기 필드가 누락

Ming Wu, Pengyuan Zhu
그래프 단일 구조에 기대던 에이전트 장기기억을 타임라인·그래프·문서 삼중 구조와 출처 추적(provenance)·인용 잠금으로 재편한 갈래. 저자 자체 보고로 LongMemEval 95.60%·LoCoMo 93.60%이며, 8개 언어모델에 걸쳐 질의당 비용이 약 30배 차이 나는데도 정확도 편차는 3.4%포인트에 그쳐 성능을 가르는 것은 모델 선택이 아니라 기억 아키텍처라고 주장.

정리 노트
구글시트에 탑재된 Gemini는 단순 질의응답에서 2026년 4월 수식·피벗·차트 생성, 6월 한국어 지원, 8월 시트 캔버스(미니앱 생성)까지 네 단계로 발전했다. 매출·비용 데이터 4,800행을 두고 수식을 직접 짜는 대신 지표 이름과 의미만 설명

정리 노트
에어비앤비 숙소 리서치를 예제로 그래프 엔지니어링을 끝까지 구현하는 순서는 다음과 같다. 그래프를 통째로 돌리기 전에 강남구 한 지역만으로 파이프라인 하나를 엔드투엔드로 검증하고, run ID 아래 마크다운·로우·로그 세 폴더로 상태를 나눠 관리하는

정리 노트
Claude Code 요금은 토큰으로 표시되지만 실제 비용은 GPU 추론 시간이고, 토큰 단가는 모델 크기·입력/출력 방향·캐시 여부로 정해진다. 입력(프리필)은 병렬 처리되지만 출력(디코드)은 순차 생성이라 출력 단가가 약 5배 비싸고, 보이지 않는

정리 노트
미국 버지니아·조지아처럼 데이터센터 유치를 일자리와 세수로 반겼던 지역들이 실제로는 상주 인력이 100명도 안 되고 전기·수도 부담만 커지는 것을 겪으며 반대 여론으로 돌아섰다. 국가 경쟁력을 위해 데이터센터를 적기에 지어야 하는데 정작 내 동네만은

정리 노트
인간 뇌는 약 20와트로 작동하지만 AI 슈퍼컴퓨터는 2000만 와트를 쓴다는 대비에서 출발해, 그 격차의 근원을 1945년식 폰노이만 구조의 처리장치·메모리 분리로 짚는다. 딥러닝 워크로드 에너지의 80% 이상이 연산이 아니라 데이터 이동에 소모된다

정리 노트
같은 과제라도 코딩 에이전트를 하나로 쓸지 나눌지에 따라 성적이 80% 넘게 오르기도, 70%가 깎이기도 한다. Anthropic의 리서치 기능은 병렬 분할로 90% 넘게, 재무 분석 학계 실험은 80.8% 좋아졌지만, 순서대로 진행해야 하는 계획형

정리 노트
사이버보안 기업 크라우드스트라이크와 옥타가 실적 발표 후 각각 20%, 28%대 급등하며 신고가를 기록한 배경에는 옥타가 내세운 새 서사가 있다. 기존에는 직원 한 명당 계정 하나만 관리하면 됐지만, 이제 직원 한 명이 수십~수백 개의 에이전트를 만들

Alexia Jolicoeur-Martineau,
이차 스케일링 해법으로 각광받던 선형 어텐션 개조 갈래에 대해 '후속학습이 필요 없는 슬라이딩 윈도로 충분하다'는 기준선을 세운 반증 논문 — 선형 어텐션 모델은 처음부터 학습하거나 광범위한 후속학습을 거쳐야 겨우 SWA를 따라잡을 것이라고 저자들이 결론. 수치는 저자 자체 보고.

Anthropic
정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장

정리 노트
AI 엔지니어링의 핵심 스킬은 프롬프트(2022)→컨텍스트(2024)→하네스(2025년 후반)→루프→그래프 엔지니어링 순으로 옮겨왔고, 각 단계는 이전 단계의 한계에서 태어났다. 모델이 똑똑해지며 프롬프트 기교의 중요성이 줄었고, 프로덕션 투입에서 컨

Google DeepMind·싱가포르 AI 안전연구
벤치마크 오염 방지와 IP 보호를 동시에 노리는 평가 인프라 시도 — 비공개 벤치마크로 프런티어 모델을 검증하는 경로

Surge AI
리더보드가 정확성보다 서식·인상에 최적화된다는 비판. 다만 인간 데이터 판매사의 자체 분석이며 독립 검증이 아니다

Yifan Zhang 외 (Mengdi Wang·Q
DeltaNet·Mamba 계열의 상태 갱신 규칙을 '무엇을 언제 연관시키는가'라는 시간 정렬 문제로 재정식화해, 시간 정렬·가소성·망각·유계 리허설을 분리 가능한 설계 축으로 만든 프레임워크. 저자 자체 보고로 대표 변형이 언어모델링에서 경쟁력을 유지하고 가변 자릿수 덧셈에서 길이 외삽을 개선.

Google (Gemini API)
영상 생성이 단발 클립에서 이어 붙이고 제어하는 타임라인 작업으로 이동
멀티모달공식 발표

Anthropic
MCP가 소프트웨어 도구 접근을 표준화했듯 물리 장비 제어를 표준화하려는 시도. 에이전트의 작용 범위를 실험실 하드웨어로 넓히는 경계 사건이며, 표준 주도권이 다시 Anthropic에 놓임

정리 노트
Gemini의 업무 자동화 기능은 자동화 강도 순으로 다섯 단계로 정리된다. 개인 인텔리전스에서 메모리와 워크스페이스·노트북 연동을 켜면 메일 확인→정리→캘린더 등록처럼 서비스를 가로지르는 지시가 되고, 노트북은 워드·PDF·드라이브·웹페이지를 주제별

정리 노트
빅테크가 한국에 수십조 원을 투자하는 배경은 패권의 축이 석유에서 24시간 싸고 안정적인 전기로 옮겨간 일렉트로스테이트 시대라는 구도로 읽힌다. 생성형 AI 질의 1회는 검색의 약 10배인 2.9Wh를 쓰고 AI 서버 랙은 7kW에서 50kW 이상으로

정리 노트
한 채용 플랫폼의 프로덕트 디자인팀이 Claude Code를 실무에 녹인 방식은 네 가지 패턴으로 정리된다. 첫째, 사내 디자인시스템의 템플릿 프롬프트를 붙여넣고 이벤트 결제 페이지를 만들어 달라는 자연어 한 줄로 로컬에 프로토타입을 띄우며, 템플릿

정리 노트
오픈웨이트 모델은 학습으로 얻은 가중치 자체를 공개해 다른 개발사가 파인튜닝할 수 있게 한 모델이고, 프론티어 모델은 설계를 비공개한 채 완제품에 과금하는 방식이다. 중국의 키미 K3·큐원이나 미국의 엔비디아·메타가 오픈웨이트를 택한 것은 미중 갈등이

정리 노트
반도체 기업 최초로 시총 1위에 오른 엔비디아의 성장사(상장 후 약 8,000배, 3조→4조 달러 1년, 4조→5조 달러 3개월)는 자본의 흐름이 에너지·플랫폼에서 지능으로 옮겨갔음을 보여준다. 여기서 나온 프레임이 한 나라가 확보한 지능과 연산량으로

정리 노트
2026년형 Mac mini는 로컬 LLM 구동을 겨냥한 에지 노드로 재편됐고, 기본가가 599달러에서 899달러로 오른 배경에는 TSMC 2나노 웨이퍼 비용이 66% 급등해 장당 3만 달러에 이른 파운드리 경제가 있다. 핵심 프레임은 두 단계의 분리

정리 노트
샤오미 AI 큐브의 1.22TB/s 근접 메모리 대역폭은 첨단 공정이 아니라 6나노 구식 노드 칩 X-Ring O100의 웨이퍼-온-웨이퍼 하이브리드 본딩에서 나왔다. 구리 패드를 직접 융합하는 1.4마이크로미터 피치로 258만 개 본딩 포인트와 28

Zhiyuan Li 외
LLM이 뽑아낸 그래프 간선을 그대로 믿지 않고 반사실 개입으로 간선 가중치를 사후 보정한다는 갈래 — 그래프 검색의 고질적 약점으로 지목돼 온 간선 신뢰도 문제를 검색 이전 단계에서 다룬다. 저자 자체 보고로 6개 LLM에 걸쳐 Graph-of-Skills 대비 ScienceWorld 매크로 평균 72.62→80.50, ALFWorld 성공률 80.01%→86.79%이며 환경 스텝 수는 감소.

Martino M. L. Pulici, Cuong
검색 시점에 그래프를 조회하는 GraphRAG 계보와 달리 그래프를 모델 가중치로 미리 컴파일해 두는 파라메트릭 지식그래프 갈래를 열면서, 동시에 그 갈래의 병목이 저장이 아니라 어댑터 선택(라우팅)임을 못박았다 — 의미 유사도를 넘어서는 어댑터 선택 기제를 찾는 것이 남은 과제라고 저자들이 결론. 수치는 저자 자체 보고.

Anthropic
사용 실태 데이터를 벤더가 독점하는 구조에 외부 검증 통로를 낸 사례. 발표 자유 조항과 제3자 감사를 명시해 벤더 자체 보고와 구분하려는 설계

NVIDIA
공급사의 기록적 실적이 버블 논쟁의 반박 근거로

Artificial Analysis
개방과 폐쇄의 격차가 3점까지 좁혀짐

정리 노트
휴머노이드가 날아오는 공을 다루는 시연은 센싱이 어디에 있느냐로 수준을 가를 수 있다. 2024년 11월 테슬라 옵티머스의 테니스공 캐치는 사람이 카메라 화면을 보며 조작한 텔레오퍼레이션이었고, 증명된 것은 자유도가 11에서 22(손목 포함 25)로

정리 노트
정부가 보고한 독자 AI 모델 2차 성과의 핵심 주장은 에포크 AI의 주목할 만한 모델 명단에 오른 나라가 미국·중국·한국뿐이라는 것과, 아티피셜 애널리시스에서 점수가 측정되는 국내 기업이 7곳이라는 점이다. SK·LG AI연구원(7,500억 파라미터

정리 노트
Rich Sutton과 제자 Khurram Javed의 요지는 현재 AI가 가는 길이 근본적으로 틀렸다는 것이다. Bitter Lesson의 핵심은 인간 지식에 매달리지 말고 탐색과 학습처럼 계산과 함께 확장되는 방법에 집중하라는 것인데, LLM은 인

정리 노트
Hermes 기반 개인용 멀티에이전트는 소프트웨어를 자율 빌드하는 Coder, Telegram 생산성·건강 코치 LifeBot, 팀 COO 역할의 Taco Bot을 역할별로 분리한 구성이다. Coder는 Mac Studio의 로컬 Qwen 3.6 35

정리 노트
그래프 엔지니어링이 혼란스러운 이유는 컨트롤 그래프(SOP로 에이전트 신뢰성 확보), 지식 그래프(엔티티 관계 기반 검색, 무관한 개념), 루프의 그래프(여러 루프의 조율, 아직 미해결)라는 세 가지가 한 단어로 뭉뚱그려지기 때문이다. 실무에서 쓸모

Dylan Patel (SemiAnalysis)
컴퓨트 집중과 2강 체제 고착을 정면 예측 — 2026년 여름 AI 인프라 권력 담론의 기준점
인물·담론공식 발표

McKinsey
3년 연속 ROI 곡선 정체. 고성과자는 약 6%로 고정

Ollama·Anthropic
폐쇄형 클라이언트가 로컬 오픈모델 런타임을 공식 백엔드로 수용
툴·에이전트공식 발표

Sakana AI
일본 민간 AI 랩이 안보 정보분석 업무에 진입. AI와 방위의 결합이 담론을 넘어 조달로 이동한 표지

Mistral AI
xAI에 이어 Mistral도 HUMAIN과 제휴 — 걸프 자본이 서로 다른 진영의 랩을 동시에 확보하는 구도. 대부분 검토·계획 단계

NVIDIA
에이전트용 저지연 유닛이 랙에 통합

Alibaba
중국 최대 AI 인프라 자금 조달. 지분 희석을 감수한 컴퓨트 확보 경쟁

vLLM
멀티노드 모델 로딩·가중치 교체(RL 롤아웃)가 서빙 스택의 1급 문제로 승격

D. Mass. (Saylor)
출력 침해 주장이 충분하다고 판단, DMCA 청구 존속

Anthropic
온-폴리시 거짓말로 학습한 탐지기가 분포 외에서 무력, 내부 상태 기반 감시의 일반화 한계를 명시한 음성 결과

Hexagon·Schaeffler
계획에서 현장 학습으로 이행. 실제 생산 라인이 아니라 전용 훈련 시설

Stripe·OpenRouter
라우팅이 독립 인프라 카테고리로 확정

OpenAI (Bonamy·Choi)
Codex CLI·app-server·SDK·MCP 오픈소스화로 하네스가 플랫폼 계층으로 확정

Guidelight AI Standards
프런티어 랩의 통제 실무를 등급제로 채점하는 독립 감사 기구라는 새 조직 형태의 등장 — 등급은 Guidelight 자체 평가

Agentic AI Foundation·Google
MCP와 A2A가 단일 중립 재단 아래로 통합되며 에이전트 표준 거버넌스가 재단 체제로 재편

Pranav Bykampadi 외
에이전틱 시스템의 지식그래프를 '추출된 트리플의 평평한 저장소'에서 누가 사실을 소유하는지·왜 채택됐는지·어떻게 쓰여야 하는지를 기록하는 거버넌스 대상으로 재정의한 갈래. 저자 자체 보고로 SciERC에서 평면 삽입 대비 strict 트리플 F1 47%·mapped 트리플 F1 51% 개선, 120개 트리플 블라인드 검토에서 거버넌스 통과 트리플이 더 자주 출처 근거를 가졌고, MuSiQue에서 Microsoft GraphRAG 대비 exact-match 9.0포인트·token F1 11.2포인트 우위.

Stanford Digital Economy Lab
해고가 아닌 채용 감소로 나타나는 입직구 봉쇄. 저자들은 인과가 아닌 서술적 지표라고 명시

xAI
장시간 실행 에이전트에 초점. 안전 서술은 능력에 맞춰 보정했다는 수준이고 별도 모델 카드가 링크되지 않음

Modular
2023년 발표 이후 3년 만의 언어 안정화 및 완전 개방. CUDA C++ 대안 언어가 처음으로 프로덕션 계약을 제시

Spotify
주요 플랫폼이 AI 페르소나 범주를 만들어 라벨링을 넘어 추천 알고리즘에서 구조적으로 차등하는 첫 사례

Mistral AI
고객 선구매를 인프라 지분으로 전환하는 자금 조달 구조. 1GW는 2030년 목표치이며 현재 가동 용량이 아님

River AI (Igor Babuschkin)
창업 2개월 회사에 11억 달러가 투입되는 신생 랩 자본 사이클의 극단

CoreWeave
백로그 담보 부채로 GPU를 소유·임대하는 neocloud 구조의 레버리지

xAI
챗봇에서 상주형 자율 에이전트로의 제품 축 이동

Meta
Llama 4 이후 첫 오픈웨이트를 Apache 2.0으로, 4bit 20GB 미만 온디바이스 에이전트

Videau 외
N과 D의 독립 가정을 깨 예측 오차를 1.5~3배 줄이고 약 10배 적은 컴퓨트로 외삽

xAI
NCII 규제 압박 이후 출시된 이미지 모델임에도 발표문에 워터마킹·모더레이션 언급이 없음
멀티모달공식 발표

Mirendil (CEO Behnam Neyshab
신생 랩이 제품 없이 시드 자금 절반을 곧바로 컴퓨트에 투입하는 AI R&D 자동화 랩 모델의 대표 사례

Jeff Dean·Sanjay Ghemawat·Qu
구글 인프라의 상징적 인물들이 AI 과학 발견 자동화를 내건 신생 랩 물결에 합류한 대형 인물 이동
인물·담론공식 발표

Mistral AI
안전 분류기를 소형 오픈웨이트로 배포하고 정책을 프롬프트로 주입해 조직별 기준에 맞추는 설계

Alibaba Qwen
최상위 모델의 개방 약속과 실제 배포가 분리되는 관행. Kimi K3도 같은 방식이었다는 지적이 함께 제기됨 — 오픈 모델 기록 시 발표일과 가중치 공개일을 분리해야 하는 근거

Anthropic
랩이 공식 권고를 바꾼 기록. 2023년의 역할 프롬프트 관행이 공식적으로 후퇴했다

EU (AI Act 제50조)
C2PA·SynthID 같은 출처 표기가 선의에서 규제 준수 요건으로 이동. 단 2026-08-02를 적용 개시일로 인용하면 틀린다
멀티모달정부 기록

Alibaba/Qwen
최상위 모델은 자체 라이선스로 가면서 소형 모델은 Apache 2.0을 유지 — 규모별 라이선스 이원화

Alibaba
최상위 오픈웨이트가 Apache가 아닌 전용 라이선스로 회귀. Qwen3.8-Max는 이를 기반으로 한 비공개 상용판

2026 7월 38


Cohere
AI 생성물 투명성 규범에 서명한 비EU 랩. 자발적 도구이며 법적 준수 자체를 대체하지 않음

Google DeepMind
원본 토큰 예산의 10% 미만으로 확산 모델을 얻는 경로를 제시, H100 1장에서 약 1,500 tok/s

LG AI연구원
1단계 236B의 3배 이상. Apache 2.0 전환으로 상업적 제약 제거

Google DeepMind
VLA 본체는 early-access 한정, ER 2는 AI Studio로 공개

OpenClaw (Kevin Lin)
급속 릴리스 문화를 유지하던 에이전트 프로젝트가 LTS·성숙도 공시 체계로 이행
툴·에이전트공식 발표

Dwarkesh Patel
팟캐스트 진행자를 넘어 독자적 논객으로서 컴퓨트 인플레이션 담론을 촉발한 에세이
인물·담론공식 발표

시장
버블 논쟁이 가격으로 처음 표출

Moonshot AI
3조 파라미터급 오픈웨이트. 규모는 커지고 라이선스는 좁아지는 패턴의 대표 사례

Model Context Protocol
MCP가 상태 유지 세션에서 무상태 요청 단위 프로토콜로 전면 재설계. 최대 규모의 하위 호환 파괴

MCP
initialize와 Mcp-Session-Id 폐지, MRTR 도입, server/discover 신설, Tasks·MCP Apps 확장 승격

EU
이 규정 이후 고위험 2026-08-02라는 인용은 전부 틀린 것이 된다

deedy (imo-2026 커뮤니티 프로젝트)
랩 발표가 아닌 커뮤니티 주도의 감사 추적 공개 + 독립 채점 방식 실시간 올림피아드 평가가 새 검증 관행으로 등장

AMD
랙당 GPU 72, 단일 스케일업 도메인, HBM4 31TB로 대안 실리콘의 실전 진입

Simon Willison
에이전트는 길이 있으면 반드시 찾아낸다는 프레임을 2026년 여름 보안 담론에 각인
인물·담론공식 발표

미 캘리포니아 북부지법 (Concord v. Ant
가사 소송의 다툼 지점이 학습데이터에서 저작권표시 처리로 확장됨. 본안 판단은 아직 없음

업스테이지
독자 파운데이션 모델 2단계 성과

양즈린 (杨植麟, Moonshot AI)
오픈웨이트 결정이 이념이 아니라 경쟁 순위의 함수임을 당사자가 명시. 중국 오픈소스 전략의 동기를 가장 직접적으로 설명한 발언

과학기술정보통신부
2026-05-21 입법예고안이 예정일에 실제 발효됐음을 확인. 입법예고와 시행을 섞지 않기 위해 별도 항목으로 둔다

N.D. Cal.
약 40만 권·권당 3,000달러, 적격 저자 91% 이상 청구

OpenAI·Hugging Face
평가 환경을 벗어나 제3사 실제 인프라를 침해한 최초의 공개 프런티어 랩 사례 — 평가 인프라 자체가 공격 표면이라는 새 사고 유형

미 캘리포니아 북부지법 (Martínez-Olguí
약식판결(Alsup)과 최종승인(Martínez-Olguín)은 별개 사건·별개 판사다. 향후 산출물 기반 청구권은 유보

유럽위원회 (EU)
옴니버스로 고위험 의무가 연기된 것과 달리 투명성 의무는 예정대로 적용됨을 집행위가 지침으로 확인

Anthropic (Gurnee·Lindsey 외)
출력에 전혀 나타나지 않는 전략적 숙고와 평가 자각을 감사에서 검출, CoT 감시의 후계 기술 후보

xAI
코딩 제품사와의 공동 학습이라는 새 형태. 경쟁사 수치는 각사 시스템 카드에서 인용했다고 명시

최태원 (SK그룹 회장·대한상의 회장)
한국 재계 AI 담론에서 도입 대기론을 정면 반박하고 데이터 투입 경쟁 프레임을 제시

xAI
가중치가 아닌 하네스·에이전트 스캐폴딩의 공개. 라이선스는 발표문에 미명시

일본 정부 (각의)
제1기 확정 7개월 만의 개정. 일본이 어자일 거버넌스를 실제 개정 주기로 실행

BIS
걸프의 지위 격상. 단 첨단컴퓨팅 접근은 승인 주체로 한정

Latent Space (Richard MacMan
inner loop 대 outer loop 프레이밍이 산업 표준 서사로 승격

Anthropic
은밀한 사보타주와 판정 라벨 조작을 관측 — 감독자 자체가 오염될 수 있음을 보임

OpenClaw
소비자 소프트웨어 수준의 복구 안전장치가 에이전트 런타임에 도입
툴·에이전트공식 발표

Thinking Machines Lab (Mira
중앙집중 정렬 패러다임에 대한 대안 세계관을 랩 명의로 공식 표명
인물·담론공식 발표

Ollama
로컬 추론 배포 계층이 독립 상업 인프라로 자립

NYT·Daily News
쟁점이 공정이용에서 증거 보전과 은닉으로 확장

Ashwin Gerard Colaco·Nada La
흩어져 있던 컨텍스트 압축 연구를 하나의 이론틀로 정리

OpenClaw Foundation
경쟁 랩들이 공동으로 중립 에이전트 표준을 후원하는 구조
툴·에이전트공식 발표

Edwin H. Wintermute 외
능력과 거부 행동을 단일 쌍 지표로 묶어 과잉거부 문제를 생물보안 평가에 정식 편입

UN
AI 거버넌스 논의가 개별 관할권을 넘어 UN 틀로 올라간 첫 회차

2026 6월 33


Figure·BMW Group
부품이 수학적으로 완벽한 자세로 오지 않는 공정으로 난이도 상승

OpenClaw
에이전트 런타임의 권한 경계가 전방위로 부정확했음을 드러냄

Voyage AI (MongoDB)
청킹이라는 RAG 전처리 단계를 임베딩 모델 안으로 흡수하려는 시도

Shijie Xia 외
Context Rot을 검색 에이전트 맥락에서 정량화하고 근본 해결이 어렵다는 것도 함께 보임

Andrew Ng (The Batch 359)
루프 엔지니어링의 대중적 정의 확립

BMW Group
Figure의 실적 수치가 처음 BMW 명의 채널에 등재됐다. 다만 공동 발표문이며 BMW가 그 수치를 독립 감사했다는 서술은 없다

SK하이닉스
국내 메모리사가 후공정까지 AI 추적 시스템을 확대한다고 공식 보고서에 명시한 사례. OSAT 고객사가 요구할 데이터 연동 규격의 방향을 예고

Chen, Razkenari 외 (AWS 계열)
검색 지표 중심 평가가 그래프 기법의 이점을 과대평가해 왔다는 반성의 주류화

Qualcomm / Modular
CUDA 대안 스택이 독립 스타트업에서 대형 실리콘 벤더 자산으로 편입된 사건

Armin Ronacher
루프는 검증 가능하고 수명 짧은 작업엔 유효하나 유지보수 코드엔 취약하다는 대표적 비판

John Jumper
AI for science 분야의 인재 재배치

데미스 허사비스 (Google DeepMind CE
기존의 신중한 AGI 타임라인 화법에서 적극적 프레임으로 이동했음을 보여주는 2026년 대표 발언

Sajib Acharjee Dip 외 (버지니아공대
추론 예산 제어가 연구 기법에서 서빙 계층의 문제로 내려온 지점

Databricks
엔터프라이즈 관점에서 관측성과 거버넌스까지 하네스에 포함

AMD
ROCm이 1년 만에 격차를 한 자릿수 퍼센트로 좁혔음을 표준 벤치마크로 보인 자료. CUDA 독점의 실질적 균열

유럽의회
고위험 의무 적용 연기를 담은 옴니버스가 의회 단계를 통과한 날 — 연기의 절차적 근거

Moonshot AI
토큰 효율을 전면에 내세운 오픈웨이트 코딩 모델

Z.ai
오픈웨이트가 폐쇄 최상위와 일부 영역에서 경합

Epoch AI
최상위 난이도 벤치마크에서도 대규모 오류가 발견돼 검수 신뢰성 문제가 재확인됨

미 제3연방항소법원
AI 학습 공정이용에 대한 첫 연방항소심 판단 대기 중

Apple
온디바이스 AI 프레임워크가 폐쇄형 단일 모델에서 하이브리드·멀티 프로바이더 플랫폼으로 전환

Elastic
통합형 검색 엔진이 양자화로 전용 벡터DB의 성능·비용 논리를 직접 겨냥

Andrew Bo Liu 외
바이오 위험 평가가 지식 문답에서 에이전트의 실제 실험 루프 수행 능력 평가로 이동한 새 벤치마크 계열의 등장

Cohere
소형 오픈웨이트 코딩 에이전트 모델

OpenAI
공개 재무제표가 감가상각·순환거래 논쟁을 정산할 전망

de Macedo (arXiv:2606.10106)
용어 다의성을 학술적으로 문제화, 모델 순응에 의존하지 않는 통제 기제를 조건으로 제시

Addy Osmani
loop engineering 용어의 확립, 프롬프트 작성자에서 루프 설계자로의 역할 전환

Ollama
로컬 배포 스택이 llama.cpp 단일 의존에서 MLX 우선 + GGUF 호환 구조로 재편

OpenAI
2025-10 발표 제품이 8개월 만에 철수 — 에이전트 툴링 층의 불안정성
툴·에이전트공식 발표

Anthropic
산업 구조가 사모에서 공모 시장으로 이동

NVIDIA / OpenClaw (Vincent K
스킬 배포 표준이 단일 프로젝트를 넘어 벤더 주도 개방 규격으로 제안됨

Dario Amodei
같은 인물이 위험 진단(1월)에서 정책 처방으로 넘어간 지점
인물·담론공식 발표

Anthropic
10^25 학습 FLOP과 매출·R&D 기준을 충족하는 개발자에게 독립 평가자의 리뷰 공표를 요구, 랩이 스스로 강제 규제를 요청

2026 5월 32


NVIDIA
모델에 이어 하드웨어까지 오픈화

NVIDIA
Vera CPU·Groq 3 LPX·BlueField-4·Spectrum-6 통합, 에이전트 워크로드를 명시적 타깃으로

llama.cpp 커뮤니티
하드웨어 네이티브 FP4가 커뮤니티 양자화를 아직 이기지 못했다는 실측. 포맷 경쟁 미결

Anthropic
Micron·Samsung·SK hynix가 전략 투자자로 참여, 런레이트 470억 달러

Mistral AI
LLM 랩이 산업 시뮬레이션 대체 영역으로 확장. 발표 시점에 명명된 출시 모델은 없음

Guni Sharon
2023년 이후 파편화된 ToT 변형들을 고전 탐색 이론으로 묶은 정리

Jingyi Sun 외 (코펜하겐대 외)
충실성이 하나의 목표가 아니라 서로 당기는 여러 축임을 보임

Jinghan Jia·Joe Benton·Eric
Anthropic의 2025-04 불충실성 공개 이후 처음으로 훈련 단계 개입안을 낸 후속

과학기술정보통신부
입법예고 단계이며 확정 시행령이 아니다. 취약계층 범주와 공공조달 조항의 초안 형태를 보여준다

Hyundai Motor Group
단일 기업 최대 규모 계획치. Metaplant America 2028, 기아 조지아 2029

Cohere
200B급 MoE를 Apache 2.0으로 공개하면서 온프레미스 배포 문턱을 GPU 1~2장으로 낮춤

Andrej Karpathy
이 아카이브에서 가장 많이 인용되는 인물이 프런티어 랩 내부로 들어감. 이후 그의 공개 글 성격이 달라질 수 있다

Google (AI Edge)
온디바이스 런타임이 모바일 OS를 넘어 브라우저까지 같은 스택으로 덮는 단계. 수치는 벤더 자체 측정

OpenClaw (Jesse Merhi)
에이전트 런타임이 언어 레벨 가드레일로는 방어 불가능하다는 메인테이너의 공개 인정

Addy Osmani (O'Reilly Radar)
하네스가 컨텍스트 엔지니어링의 전달 수단이라는 포함관계 입장

콜로라도 주지사
미국 첫 포괄 주 AI법의 사실상 후퇴. 콜로라도를 인용할 때 반드시 확인해야 할 사건

Sam Martin·Fabien Roger
롱컨텍스트 한계가 안전 감시 성능까지 무너뜨림을 보인 실증

上海華虹宏力·화둥이공대
실제 반도체 제조사가 저자이며 데이터 반출 없는 온프레미스를 설계 전제로 명시. 사내 GPU 1~2장으로 결함 리포트 자동화가 가능하다는 뜻. 단 양산 배치 사례 없음

METR
2026-02-24에 예고한 방법론 개편의 첫 후속 결과. 2025년 연구에서 응답자들이 소요시간 영향을 평균 40%p 과대추정했다는 점을 다시 확인했다

Anthropic
행동이 아니라 이유를 학습시키면 협박률이 65%에서 19%로, 분포 외 데이터가 허니팟 대비 약 28배 효율

Naoto Iwase 외
2022년 self-consistency의 비용 구조를 다시 짠 후속

EU 이사회·의회
AI Act 고위험 의무의 실질적 연기가 결정된 시점

Google DeepMind
자동 검증 가능한 도메인에서의 실질적 진전 (Google 자체 측정)

Moonshot AI
6개월간 39억 달러 조달. 오픈웨이트 배포가 상업적으로 성립함을 보여준 사례

OpenAI
음성 모델에 reasoning effort와 병렬 도구 호출 도입, 컨텍스트 32K에서 128K로. 음성이 에이전트 실행 환경이 됨
멀티모달공식 발표

Zhang 외 (arXiv:2605.23950)
하네스 유발 분산이 모델 유발 분산의 7.80배, 9개 모델쌍 중 6개 순위 역전

Simon Willison
vibe coding 확산의 핵심 정리자가 2026년 코딩 담론의 두 축 구분 자체가 무너지고 있음을 선언
인물·담론공식 발표

Laude Institute
벤치마크가 자기 결함을 공개 시인하고 지속 검증 체계를 도입한 사례

Earthjustice
제소 예고 후 3개월 만에 터빈이 오히려 늘었음이 법적 절차로 확인

xAI (SpaceXAI)
경쟁 랩에 컴퓨트를 임대하는 구조 전환. Colossus 1 실가동 GPU 수의 최신 1차 근거이기도 함. 금액·기간 미공개

Google (Chrome)
온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다

Anthropic Fellows
규범 문서를 정렬 파인튜닝 이전 중간학습에 넣으면 일반화가 개선됨

2026 4월 30


OpenAI·Microsoft
AGI 정의가 실은 계약·거버넌스 장치였음을 드러낸 사건

DeepSeek-AI
V3.2 대비 토큰당 FLOPs 27%·KV 캐시 10%로 1M 컨텍스트를 상시 지원 대상으로 만듦

Cohere
북미·유럽 주권 AI 진영의 통합. 유럽 대표 랩이었던 Aleph Alpha의 독립 종료

DeepSeek

OpenAI
시각 이해와 컴퓨터 조작이 같은 능력임을 수치로 보여줌
멀티모달공식 발표

Google
임베딩 상용 계보가 텍스트 전용 세대를 지나 네이티브 멀티모달 세대로 공식 전환

Hexagon·Schaeffler

Alibaba
dense 27B가 397B MoE 전작을 상회하며 진짜 개방의 무게중심이 30B급으로 내려옴

Google Cloud (Cloud Next)
학습용과 추론용 실리콘을 최초로 분리, 범용 가속기 시대의 종언 신호

Moonshot AI
오픈웨이트 모델이 SWE-Bench Verified 80%대에 진입. 독립 검증 주체는 명시되지 않음

David C. Krakauer
벤치마크 간 제1주성분 설명력이 2023~24년 92%에서 추론 모델 등장 이후 64%로, 겉보기 일반성 아래의 전문화 주장

Jingbo Sun 외
Search-R1 계열의 후속. 검색 횟수 자체를 학습 대상으로 삼음

Alibaba Qwen
오픈 웨이트 옴니모달이 10시간 오디오·400초 비디오를 처리하며 프런티어를 따라잡음

Physical Intelligence
학습 데이터가 전혀 없는 양팔 로봇에서 세탁물 접기 성공, 크로스 임바디먼트 전이

Anthropic
조밀한 스크린샷·다이어그램 판독력이 computer use 성능의 병목이었음을 확인
멀티모달공식 발표

Stanford HAI
AI for science가 독립 측정 대상이 됨

Sam Altman
인물·담론공식 발표

Microsoft
클라우드 종속·토큰 과금 없는 로컬 추론을 공식 제품 라인으로 확정

LG AI연구원
LG의 첫 오픈웨이트 비전-언어 모델로, 국내 오픈웨이트 노선이 텍스트 밖으로 확장된 지점

Meta
Llama 브랜드 교체와 폐쇄 전환

Meta Superintelligence Labs
Meta의 프론티어 모델은 폐쇄, 별도 소형 모델만 개방하는 이원 전략이 확정된 지점

Anthropic·Google·Broadcom

Krishnamoorthy 외 (인도·말레이시아·이
라벨 0으로 결함 형태를 군집화해 라벨링할 대표 샘플만 고르는 워크플로의 근거. 동시에 내부 군집 지표와 실제 클래스 일치도가 따로 논다는 반례

Google (Android)
안드로이드 온디바이스 AI가 시스템 서비스(AICore)로 오픈 모델을 직접 배포하는 체계로 진화

Google
미국 진영의 진짜 개방 회귀 신호탄

Birgitta Böckeler (martinfow
AI 에이전트에서 모델을 제외한 모든 것이라는 사용자 관점 정의의 표준 문헌

AAIF·Linux Foundation
AAIF 회원사 4개월 만에 170곳, MCP SDK 월간 다운로드 1.1억 초과, DNS rebinding 시연 등 보안이 최대 화두

Dongzhe Fan 외
에이전틱 검색이 두 방식의 격차를 좁힘을 보여 2024년 GraphRAG 논쟁을 갱신

IEA
전력과 계통 접속 지연이 근시일 확장 속도를 제한하는 물리적 병목임을 공식 확인

François Chollet
test-time에 새로움에 적응하는 fluid intelligence의 등장을 이유로 든 조건부 전향

2026 3월 23


Google Cloud
Ironwood가 발표에서 실제 공급으로

차오양과기대 (Chayanon Sub-r-pa, R
결함 클래스가 새로 생기면 이미지 10장 이하로 시작해야 하는 OSAT 현실에 맞는 실험 설계. 단 절대 성능은 양산 판정이 아니라 검사 보조·트리아지 수준

Cohere
텍스트 LLM 중심 랩이 음성 인식을 완전 개방 라이선스로 공개

Sakana AI
AI 생성 논문의 심사 통과가 정식 학술 기록으로 편입. 자동 연구의 평가 기준 논쟁이 본격화

ARC Prize
정적 문제풀이에서 지시 없는 대화형 탐색·기술 습득으로 축 이동

vLLM
V1 재설계 이후 두 번째 실행 계층 재작성. 서빙 경쟁이 커널에서 스케줄러·실행 코어로 이동

Anthropic Labs (Prithvi Raja
Planner-Generator-Evaluator 3에이전트, 단일 에이전트 20분 9달러 대 풀 하네스 6시간 200달러

Cisco
인프라 샌드박스와 운영 거버넌스로 에이전트 보안 스택이 계층 분리

Hugging Face
README가 vLLM·SGLang·llama.cpp·MLX 이전을 권고, 서빙 엔진 시장이 2강과 로컬로 정리

Shiyan Liu 외
GEPA 계열 자동 프롬프트 최적화의 실패 모드를 처음으로 분리해 보임

Mistral AI
별도 모델 계열을 단일 가중치로 통합하는 흐름을 오픈웨이트에서 구현

Mistral AI
AI 생성 코드를 형식 명세에 대해 기계적으로 검증하는 방향. 평가 축을 경쟁 수학에서 실제 형식화 프로젝트 기여로 이동

Qdrant
전용 벡터DB 진영의 반격 논리. 통합형(Postgres·Elasticsearch)에 대한 직접 응수

HumanLayer
하네스 엔지니어링을 컨텍스트 엔지니어링의 부분집합으로 규정, context firewall과 back-pressure 개념

llama.cpp (ggml-org)
GGUF가 자체 K-quant를 넘어 하드웨어 네이티브 FP4 포맷을 흡수

Yann LeCun / AMI Labs
LLM 회의론이 10억 달러 규모의 대안 노선 베팅으로 자본화

Saroj Mishra 외
에이전틱 RAG의 첫 체계적 분류. 후속 연구의 기준점

Zadouri·Shah·Thakkar·Dao 외
커널 계보의 최신 세대, MLSys 2026 정식 게재

Chen Yueh-Han·Robert McCarth
CoT를 안전 감시 수단으로 쓰자는 Monitorability 제안의 전제를 직접 시험한 후속

UN

연방대법원
AI 단독 생성물의 인간 저작자 요건이 확정

삼성전자
국내 최대 수요기업의 방향성 신호. 다만 전부 2030년 목표이고 현재 배치 성과 수치는 제시되지 않음

중국 정부
오픈소스 개인 에이전트에 대한 국가 단위 사용 규제의 첫 사례

2026 2월 25


국가인공지능전략위원회 (한국)
한국 첫 법정 AI 기본계획. 다만 정부 포털 게시본에는 GPU·예산 수치가 없고 첨부 PDF에만 존재

METR
선택편향(AI 없이 일하기를 거부하는 참가자 증가)을 이유로 실험 재설계. 2025년 19% 결과를 철회하지는 않았으나 2026년 초 개발자는 더 빨라졌을 가능성이 높다고 밝히며 이를 very weak evidence로 명시

Anthropic
v3.1은 RSP가 요구하지 않아도 개발 중단 조치를 취할 자유를 명문화. 현행 v3.4

OpenAI Frontier Evals
감사 대상 문제의 최소 59.4%가 결함 테스트, 벤더가 벤치마크 하네스의 신호 오염을 인정

Anthropic
증류 분쟁이 의혹에서 정량적 고발로. 소송이 아니라 탐지 공개와 산업 공동 대응을 택한 것이 법적 수단의 한계를 반영

OpenAI
자본지출 사이클의 첫 공식적 속도조절 신호

Agility Robotics·Toyota Moto
휴머노이드 구독형 상업 모델. 원문은 배치 예정 표현

인도 정부
정상회의 계보가 서구 밖으로 이동

Birgitta Böckeler (martinfow
guides/sensors 곱하기 computational/inferential 프레임의 최초 제시

Peter Steinberger
개인 프로젝트에서 재단 거버넌스로의 이행이 프론티어 랩 채용과 동시에 발생

NAACP·SELC·Earthjustice
컴퓨트 확장이 환경 규제를 우회한 형태로 진행됐음을 보여줌. 주 경계를 넘겨 설치해 멤피스 인허가를 회피한 구조

Dario Amodei (Dwarkesh)
스케일링 종료와 AGI 임박이 같은 주장의 양면이라는 논리 구조

Anthropic
사상 최대 규모 민간 라운드

Google DeepMind
ARC-AGI-2 사실상 포화. 발표문은 AGI를 논하지 않고 과학·연구·공학 가속으로 프레이밍

OpenAI (Ryan Lopopolo)
약 100만 줄 규모 내부 제품을 전량 Codex 작성으로, 5개월간 엔지니어 3~7명이 약 1,500 PR 머지

Andrej Karpathy
vibe coding의 후계 용어를 본인이 직접 제시하며 담론을 품질 포기에서 감독 책임으로 이동

OpenClaw
에이전트 스킬 배포에 앱스토어형 사전 심사를 도입한 초기 사례

Anthropic
평가와 실배포를 구분하되 그 자각이 언어화되지 않음을 관측, ASL-4 자동 벤치마크는 포화로 신호 상실

Mitchell Hashimoto
용어의 대중화 기점, AI 도입 6단계 중 5단계가 Engineer the Harness

Donald Ye 외
CoT 충실성 논쟁에 메커니즘 층위 증거를 더함

영국 ICO
데이터보호 규제기관이 모델 설계 자체를 심사 대상으로 삼은 사례

Xi Wang 외
budget forcing(s1) 계열의 추론 예산 제어를 통계적 보증 틀로 형식화

xAI
사상 최대 규모 합병. 같은 자료에 xAI 9월 분기 매출 1억 700만 달러·순손실 14억 6,000만 달러가 기재되어 밸류에이션과 실적의 격차가 큼. 이후 사명이 SpaceXAI로 표기

Yoshua Bengio
AI 위험 논의에 IPCC형 국제 합의 문서라는 형식을 도입. 각국 규제 논의의 공통 사실 기반
인물·담론공식 발표

Alibaba/Qwen
초기 융합 멀티모달 학습을 Apache 2.0 대형 MoE에 적용. Plus는 비공개로 남겨 개방/폐쇄 병행

2026 1월 41


커뮤니티 (Steinberger)
개인용 자율 에이전트의 권한·감사 문제가 사회적 사건으로 비화

OpenClaw / depthfirst(Mav Le
로컬 에이전트는 안전하다는 전제를 무너뜨린 첫 대형 사고. 이후 origin 검증이 기본 요구사항

METR
방법론 변경만으로 수치가 움직인다는 것을 발행 기관이 스스로 보여준 사례. 최상위 모델 50% 시간지평 약 5.3시간은 이 개정판 기준이며 이전 판과 직접 비교할 수 없다

Moonshot AI
K2 계열이 텍스트에서 네이티브 멀티모달로 전환한 지점이자 오픈웨이트 에이전트 스웜의 등장
멀티모달공식 발표

OpenClaw
2개월 새 3번째 개명. 프로젝트 정체성을 개인 브랜드에서 분리하는 전환점
툴·에이전트공식 발표

LMArena
텍스트 LLM 아레나에서 다중 모달리티 평가 플랫폼으로 정체성을 공식 확장

류블랴나대 (Fučka, Zavrtanik, Sko
신제품 라인 초기, 정상 이미지조차 없는 구간을 커버하는 유일한 형태. 단 반도체·PCB 전용 결과는 없어 사내 파일럿 확인이 필요

Cisco (Amy Chang, Vineeth Sa
스킬 마켓플레이스를 검증되지 않은 공급망으로 규정한 첫 대규모 실측

xAI
NCII 규제 압박 한복판에서 영상 생성 API를 상용화. 발표문에 콘텐츠 안전·모더레이션 언급이 없음
멀티모달공식 발표

Figure
실시간성과 지능을 주파수 대역으로 분리, 상체 제어에서 전신 제어로 전환

Peter Steinberger
오픈소스 에이전트가 모델 제공사 브랜드에 올라타는 관행에 상표법이 제동을 건 사례

유럽위원회 (EU)
AI Act가 아닌 DSA로 생성형 AI를 규율한 첫 사례

Anthropic·MCP
텍스트와 구조화 데이터만 오가던 프로토콜이 화면까지 포함

미국 35개 주·준주 법무장관
미국 주 법집행이 단일 AI 제품에 대해 결집한 최대 규모 공동 조치

METR
자기 지표가 과도 일반화되어 인용되는 것을 발행 기관이 직접 제동한 사례

대한민국
다만 사실조사·과태료는 최소 1년 이상 계도기간을 운영하므로 2026년부터 처벌이라는 서술은 부정확

Anthropic
원칙 나열에서 이유를 이해시키는 문서로 전환, 4대 우선순위와 hard constraints 명시

PyTorch 재단
수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호

Voyage AI (MongoDB)
상용 임베딩에 MoE 를 적용하고 크기가 다른 모델 간 임베딩 호환을 표준화. 비교 수치는 벤더 자체 측정

World Economic Forum (McKins
AI 단독 도입은 성과가 안 난다는 것을 220개 사이트 규모로 집계한 준-표준 근거. 반면 후공정 사이트 부재는 이 벤치마크를 OSAT에 직접 적용하기 어렵다는 신호

과학기술정보통신부
국내 최대 규모 국책 AI 사업의 첫 탈락

중국 세관
미국이 열자 중국이 닫는 양방향 통제 구도

xAI
사후 대응이며 범위가 제한적. AP는 조치 발표 다음 날에도 무료 사용자에게 편집 도구가 남아 있었다고 확인 — 발표와 실제 적용의 시차

캘리포니아 주법무장관
spicy mode를 마케팅에 활용한 점이 쟁점. 미국 주정부가 프런티어 랩을 직접 수사한 사례

Pietro Ferrazzi 외
에이전틱 RAG가 항상 낫지는 않다는 실증. 설계 선택의 근거가 되는 반증형 결과

Nikhil Verma
컨텍스트 관리 주체가 파이프라인에서 에이전트 자신으로 옮겨가는 흐름

Uygar Kurt
어떤 양자화를 쓸 것인가를 체감이 아니라 측정으로 옮긴 첫 통합 레퍼런스

MiniMax
Zhipu 상장 하루 뒤 연쇄 상장. 중국 LLM 기업의 상장 창구가 열렸음을 확인

Elias Lumer 외
캐시 상품화 이후 처음으로 3사를 같은 조건에서 비교한 실측

Zhipu AI (智谱)
순수 LLM 기업의 첫 공개시장 진입. 중국 랩의 자금조달이 VC에서 공모시장으로 이동한 분기점

Z.ai (구 Zhipu AI)
오픈웨이트 배포가 상장 가능한 비즈니스 모델로 승인됨

Siemens
MES 문서·SOP 질의 용도로 후공정에서도 검토 대상이나, 공개된 성과가 전부 비반도체이고 측정 주체가 벤더

xAI
AI 스타트업 단일 라운드 최대급. 밸류에이션은 발표문에 미공개

Hyundai·Boston Dynamics (CES
완성차 그룹의 수직통합 모델 제시 (계획치)

Philipp Schmid
하네스를 운영체제로 보는 정의 갈래의 1차 출처

Yi Yu 외
무엇을 기억하고 버릴지를 사람이 정하지 않고 학습으로 정한 사례

Yann LeCun
노선 대립이 실제 자본·조직 분화로 귀결된 사례. V-JEPA 기반 월드모델이 독립 자금을 확보

Dario Amodei
Machines of Loving Grace의 낙관을 철회하지 않으면서 위험 서술을 대폭 확장. 같은 저자의 두 텍스트가 낙관·위험 양쪽 인용에 모두 쓰이는 상황을 만듦
인물·담론공식 발표

음악출판사(Concord 등)
가사·음악 영역의 학습데이터 분쟁

IBM (Raffi Khatchadourian)
도메인은 금융이지만 감사 재현 요구는 품질 감사와 동일 구조. 정확도 높은 모델을 고르면 재현성이 따라온다는 통념을 4,705회 실행으로 반증

2026년 1


Amkor Technology
2위 OSAT의 공개 수준도 동일. 후공정 AI는 적용 사례가 없는 것이 아니라 정량 공개가 없는 것이며, 이 격차가 내부 도입 정당화를 어렵게 만드는 실제 원인