2026년 321개 조각
기록 296 · 정리 노트 25
2026 9월 19개
Anthropic
인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례
추론 모델·AGI 논쟁공식 발표
Tingyu Song 외
임베딩 학습의 기본값이던 대조학습보다 다단계 순위 감독이 감독 신호를 더 잘 쓴다고 주장하며, 리랭커를 검색 파이프라인의 후단이 아니라 임베딩 모델의 교사로 재배치한 갈래. 저자 자체 보고로 COLA·SUGARCREPE++·NEGBENCH 3개 구성적 추론 벤치마크에서 CORE-RERANKER-8B가 총평균 82.7%로 Jina-Reranker 대비 10.7포인트 우위, CORE-EMBED-8B가 평가 대상 임베딩 모델 중 최고 총평균 0.666이며 COCO·Flickr30K 검색 성능은 유지.
OpenAI
사이버 Critical 역량 선언과 같은 주에 나온 방어 측 비대칭 보정. 공격 역량의 위험을 접근 통제만이 아니라 방어자 보조금으로 상쇄하려는 접근으로, 프런티어 랩이 중요 인프라 보안의 공급자 위치로 들어감
물리 세계·현실 영향공식 발표
Sergii Kozyrev, Davyd Maibor
'순환 상태의 오차는 긴 문맥에서 누적된다'는 통념을 뒤집어 하이브리드 LLM의 순환 절반이 오히려 양자화하기 쉬운 쪽이라고 주장하고, NVFP4의 16원소 블록 스케일링이 잔차 스트림의 극단 이상치를 국소화하는 점과 델타 규칙 순환이 주입된 잡음을 32K 토큰에 걸쳐 평탄하게 유지하는 점 등 네 갈래 기계적 설명을 제시. 수치는 저자 자체 보고.
Heng Wang 외
중요도 점수 기반 KV 축출 계보 전체에 대해 '점수 자체가 필요 없다'는 반증을 제기. 취약한 부분은 프롬프트뿐이며 추론 시퀀스는 텍스트 재진술과 여러 어텐션 헤드에 걸친 복제라는 이중 중복성으로 스스로를 지탱하므로 프롬프트만 지키면 무작위 선택으로 충분하다는 것이 저자들의 설명. 수치는 저자 자체 보고.
OpenAI
GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동
추론 모델·AGI 논쟁공식 발표
Guowei Wang 외
별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.
OpenAI
범용 챗봇이 규제 의료 기록 시스템에 직접 연결되는 단계. 컨텍스트 연결(RAG·커넥터)의 전선이 공개 웹에서 규제 데이터 영역으로 넘어갔고, 안전성 근거는 아직 벤더 자체 평가에 의존
물리 세계·현실 영향공식 발표
Shaowen Wang 외
깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.
Anthropic
데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다
안전·정렬·해석가능성공식 발표
OpenAI
자사 위험 프레임워크의 최고 등급이 실제로 발동된 첫 사례. 선언적 임계값이 배포 지연과 접근 제한이라는 구체적 조치로 이어졌는지를 검증할 기준점이며, 프런티어 사이버 역량이 정책 문제로 전환된 지점
안전·정렬·해석가능성공식 발표
Anthropic
프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌
추론 모델·AGI 논쟁공식 발표
2026 8월 79개
정리 노트
Herdr는 Orca보다 훨씬 가벼운 원격 터미널 서버로, 터미널만 있으면 리눅스 VM에도 쉽게 설치되고 Ghostty를 꺼도 세션이 그대로 살아 있다. 이를 Grok Bot의 가상 머신에 얹으면 맥북 전원과 무관하게 스마트폰만으로 코딩 에이전트를 상
정리 노트
이순신 명량대첩을 소재로 1분짜리 시네마틱 비디오를 만드는 과정에서 배울 점은 프롬프트를 바로 넣지 않는 순서다. 먼저 명량대첩이라는 주제와 생성 툴의 사용법을 각각 리서치시켜 컨텍스트를 채운 뒤, 두 결과를 합쳐 초 단위 화면 기획이 담긴 툴 전용
멀티모달노트
HUMAIN·Qualcomm
사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면
온디바이스·로컬 추론공식 발표
Aurélien Lac, Tony Wu
생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.
OpenAI
주 단위 청소년 안전 규제를 프런티어 랩이 선제 지지한 사례. 2024년 SB 1047 반대와 대비되며, 업계가 규제를 전면 거부하는 대신 영역별로 선택 수용하는 국면을 보여줌
규제·법·거버넌스공식 발표
OpenAI
구독·API 밖의 광고가 소비자 AI의 주요 수익 축으로 공식화. 무료 티어 확산의 재원이 검색 광고와 같은 구조로 수렴하면서 답변과 광고의 분리가 신뢰 쟁점으로 이동
컴퓨트 경제·지정학공식 발표
Zihan Qiu 외 (Alibaba Qwen)
프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.
정리 노트
Claude Code에서 좋은 프롬프트를 쓰는 사람은 실력이 아니라 프롬프트 마스터라는 스킬 하나를 설치했을 뿐이라는 것이 이 짧은 클립의 요지다. 최소한의 입력만 줘도 건드릴 파일, 출력 형식, 멈춰야 할 시점까지 채운 완성된 프롬프트로 바꿔 주고,
정리 노트
Anthropic의 /design 스킬은 텍스트 대화로만 디자인을 반복 수정하던 비효율을 겨냥한 기능이다. 애플 기기 리셀 사이트처럼 색상 체계가 정해지지 않은 상태라면 무드보드 3안을 먼저 만들게 요청하는 식으로, 스킬이 세부 질문을 단계별로 던지도
정리 노트
400개 이상의 프로덕션 에이전트 경험에서 정리됐다는 12-레이어 스택은, 가상의 응급실 트리아지 에이전트에서 각 레이어를 boolean 플래그로 켜고 끄며 실패를 재현하는 방식으로 이해하면 명확하다. 데이터 이해 레이어가 없으면 알레르기 필드가 누락
Ming Wu, Pengyuan Zhu
그래프 단일 구조에 기대던 에이전트 장기기억을 타임라인·그래프·문서 삼중 구조와 출처 추적(provenance)·인용 잠금으로 재편한 갈래. 저자 자체 보고로 LongMemEval 95.60%·LoCoMo 93.60%이며, 8개 언어모델에 걸쳐 질의당 비용이 약 30배 차이 나는데도 정확도 편차는 3.4%포인트에 그쳐 성능을 가르는 것은 모델 선택이 아니라 기억 아키텍처라고 주장.
정리 노트
구글시트에 탑재된 Gemini는 단순 질의응답에서 2026년 4월 수식·피벗·차트 생성, 6월 한국어 지원, 8월 시트 캔버스(미니앱 생성)까지 네 단계로 발전했다. 매출·비용 데이터 4,800행을 두고 수식을 직접 짜는 대신 지표 이름과 의미만 설명
툴·에이전트노트
정리 노트
에어비앤비 숙소 리서치를 예제로 그래프 엔지니어링을 끝까지 구현하는 순서는 다음과 같다. 그래프를 통째로 돌리기 전에 강남구 한 지역만으로 파이프라인 하나를 엔드투엔드로 검증하고, run ID 아래 마크다운·로우·로그 세 폴더로 상태를 나눠 관리하는
정리 노트
Claude Code 요금은 토큰으로 표시되지만 실제 비용은 GPU 추론 시간이고, 토큰 단가는 모델 크기·입력/출력 방향·캐시 여부로 정해진다. 입력(프리필)은 병렬 처리되지만 출력(디코드)은 순차 생성이라 출력 단가가 약 5배 비싸고, 보이지 않는
정리 노트
미국 버지니아·조지아처럼 데이터센터 유치를 일자리와 세수로 반겼던 지역들이 실제로는 상주 인력이 100명도 안 되고 전기·수도 부담만 커지는 것을 겪으며 반대 여론으로 돌아섰다. 국가 경쟁력을 위해 데이터센터를 적기에 지어야 하는데 정작 내 동네만은
정리 노트
인간 뇌는 약 20와트로 작동하지만 AI 슈퍼컴퓨터는 2000만 와트를 쓴다는 대비에서 출발해, 그 격차의 근원을 1945년식 폰노이만 구조의 처리장치·메모리 분리로 짚는다. 딥러닝 워크로드 에너지의 80% 이상이 연산이 아니라 데이터 이동에 소모된다
정리 노트
같은 과제라도 코딩 에이전트를 하나로 쓸지 나눌지에 따라 성적이 80% 넘게 오르기도, 70%가 깎이기도 한다. Anthropic의 리서치 기능은 병렬 분할로 90% 넘게, 재무 분석 학계 실험은 80.8% 좋아졌지만, 순서대로 진행해야 하는 계획형
정리 노트
사이버보안 기업 크라우드스트라이크와 옥타가 실적 발표 후 각각 20%, 28%대 급등하며 신고가를 기록한 배경에는 옥타가 내세운 새 서사가 있다. 기존에는 직원 한 명당 계정 하나만 관리하면 됐지만, 이제 직원 한 명이 수십~수백 개의 에이전트를 만들
툴·에이전트노트
Alexia Jolicoeur-Martineau,
이차 스케일링 해법으로 각광받던 선형 어텐션 개조 갈래에 대해 '후속학습이 필요 없는 슬라이딩 윈도로 충분하다'는 기준선을 세운 반증 논문 — 선형 어텐션 모델은 처음부터 학습하거나 광범위한 후속학습을 거쳐야 겨우 SWA를 따라잡을 것이라고 저자들이 결론. 수치는 저자 자체 보고.
Anthropic
정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장
안전·정렬·해석가능성공식 발표
정리 노트
AI 엔지니어링의 핵심 스킬은 프롬프트(2022)→컨텍스트(2024)→하네스(2025년 후반)→루프→그래프 엔지니어링 순으로 옮겨왔고, 각 단계는 이전 단계의 한계에서 태어났다. 모델이 똑똑해지며 프롬프트 기교의 중요성이 줄었고, 프로덕션 투입에서 컨
Google DeepMind·싱가포르 AI 안전연구
벤치마크 오염 방지와 IP 보호를 동시에 노리는 평가 인프라 시도 — 비공개 벤치마크로 프런티어 모델을 검증하는 경로
평가·벤치마크공식 발표
Yifan Zhang 외 (Mengdi Wang·Q
DeltaNet·Mamba 계열의 상태 갱신 규칙을 '무엇을 언제 연관시키는가'라는 시간 정렬 문제로 재정식화해, 시간 정렬·가소성·망각·유계 리허설을 분리 가능한 설계 축으로 만든 프레임워크. 저자 자체 보고로 대표 변형이 언어모델링에서 경쟁력을 유지하고 가변 자릿수 덧셈에서 길이 외삽을 개선.
Anthropic
MCP가 소프트웨어 도구 접근을 표준화했듯 물리 장비 제어를 표준화하려는 시도. 에이전트의 작용 범위를 실험실 하드웨어로 넓히는 경계 사건이며, 표준 주도권이 다시 Anthropic에 놓임
MCP·Skills 표준화공식 발표
정리 노트
Gemini의 업무 자동화 기능은 자동화 강도 순으로 다섯 단계로 정리된다. 개인 인텔리전스에서 메모리와 워크스페이스·노트북 연동을 켜면 메일 확인→정리→캘린더 등록처럼 서비스를 가로지르는 지시가 되고, 노트북은 워드·PDF·드라이브·웹페이지를 주제별
툴·에이전트노트
정리 노트
빅테크가 한국에 수십조 원을 투자하는 배경은 패권의 축이 석유에서 24시간 싸고 안정적인 전기로 옮겨간 일렉트로스테이트 시대라는 구도로 읽힌다. 생성형 AI 질의 1회는 검색의 약 10배인 2.9Wh를 쓰고 AI 서버 랙은 7kW에서 50kW 이상으로
정리 노트
한 채용 플랫폼의 프로덕트 디자인팀이 Claude Code를 실무에 녹인 방식은 네 가지 패턴으로 정리된다. 첫째, 사내 디자인시스템의 템플릿 프롬프트를 붙여넣고 이벤트 결제 페이지를 만들어 달라는 자연어 한 줄로 로컬에 프로토타입을 띄우며, 템플릿
툴·에이전트노트
정리 노트
오픈웨이트 모델은 학습으로 얻은 가중치 자체를 공개해 다른 개발사가 파인튜닝할 수 있게 한 모델이고, 프론티어 모델은 설계를 비공개한 채 완제품에 과금하는 방식이다. 중국의 키미 K3·큐원이나 미국의 엔비디아·메타가 오픈웨이트를 택한 것은 미중 갈등이
정리 노트
반도체 기업 최초로 시총 1위에 오른 엔비디아의 성장사(상장 후 약 8,000배, 3조→4조 달러 1년, 4조→5조 달러 3개월)는 자본의 흐름이 에너지·플랫폼에서 지능으로 옮겨갔음을 보여준다. 여기서 나온 프레임이 한 나라가 확보한 지능과 연산량으로
정리 노트
2026년형 Mac mini는 로컬 LLM 구동을 겨냥한 에지 노드로 재편됐고, 기본가가 599달러에서 899달러로 오른 배경에는 TSMC 2나노 웨이퍼 비용이 66% 급등해 장당 3만 달러에 이른 파운드리 경제가 있다. 핵심 프레임은 두 단계의 분리
정리 노트
샤오미 AI 큐브의 1.22TB/s 근접 메모리 대역폭은 첨단 공정이 아니라 6나노 구식 노드 칩 X-Ring O100의 웨이퍼-온-웨이퍼 하이브리드 본딩에서 나왔다. 구리 패드를 직접 융합하는 1.4마이크로미터 피치로 258만 개 본딩 포인트와 28
Zhiyuan Li 외
LLM이 뽑아낸 그래프 간선을 그대로 믿지 않고 반사실 개입으로 간선 가중치를 사후 보정한다는 갈래 — 그래프 검색의 고질적 약점으로 지목돼 온 간선 신뢰도 문제를 검색 이전 단계에서 다룬다. 저자 자체 보고로 6개 LLM에 걸쳐 Graph-of-Skills 대비 ScienceWorld 매크로 평균 72.62→80.50, ALFWorld 성공률 80.01%→86.79%이며 환경 스텝 수는 감소.
Martino M. L. Pulici, Cuong
검색 시점에 그래프를 조회하는 GraphRAG 계보와 달리 그래프를 모델 가중치로 미리 컴파일해 두는 파라메트릭 지식그래프 갈래를 열면서, 동시에 그 갈래의 병목이 저장이 아니라 어댑터 선택(라우팅)임을 못박았다 — 의미 유사도를 넘어서는 어댑터 선택 기제를 찾는 것이 남은 과제라고 저자들이 결론. 수치는 저자 자체 보고.
Anthropic
사용 실태 데이터를 벤더가 독점하는 구조에 외부 검증 통로를 낸 사례. 발표 자유 조항과 제3자 감사를 명시해 벤더 자체 보고와 구분하려는 설계
물리 세계·현실 영향공식 발표
정리 노트
휴머노이드가 날아오는 공을 다루는 시연은 센싱이 어디에 있느냐로 수준을 가를 수 있다. 2024년 11월 테슬라 옵티머스의 테니스공 캐치는 사람이 카메라 화면을 보며 조작한 텔레오퍼레이션이었고, 증명된 것은 자유도가 11에서 22(손목 포함 25)로
정리 노트
정부가 보고한 독자 AI 모델 2차 성과의 핵심 주장은 에포크 AI의 주목할 만한 모델 명단에 오른 나라가 미국·중국·한국뿐이라는 것과, 아티피셜 애널리시스에서 점수가 측정되는 국내 기업이 7곳이라는 점이다. SK·LG AI연구원(7,500억 파라미터
정리 노트
Rich Sutton과 제자 Khurram Javed의 요지는 현재 AI가 가는 길이 근본적으로 틀렸다는 것이다. Bitter Lesson의 핵심은 인간 지식에 매달리지 말고 탐색과 학습처럼 계산과 함께 확장되는 방법에 집중하라는 것인데, LLM은 인
인물·담론노트
정리 노트
Hermes 기반 개인용 멀티에이전트는 소프트웨어를 자율 빌드하는 Coder, Telegram 생산성·건강 코치 LifeBot, 팀 COO 역할의 Taco Bot을 역할별로 분리한 구성이다. Coder는 Mac Studio의 로컬 Qwen 3.6 35
정리 노트
그래프 엔지니어링이 혼란스러운 이유는 컨트롤 그래프(SOP로 에이전트 신뢰성 확보), 지식 그래프(엔티티 관계 기반 검색, 무관한 개념), 루프의 그래프(여러 루프의 조율, 아직 미해결)라는 세 가지가 한 단어로 뭉뚱그려지기 때문이다. 실무에서 쓸모
Mistral AI
xAI에 이어 Mistral도 HUMAIN과 제휴 — 걸프 자본이 서로 다른 진영의 랩을 동시에 확보하는 구도. 대부분 검토·계획 단계
컴퓨트 경제·지정학공식 발표
Hexagon·Schaeffler
계획에서 현장 학습으로 이행. 실제 생산 라인이 아니라 전용 훈련 시설
Guidelight AI Standards
프런티어 랩의 통제 실무를 등급제로 채점하는 독립 감사 기구라는 새 조직 형태의 등장 — 등급은 Guidelight 자체 평가
안전·정렬·해석가능성공식 발표
Agentic AI Foundation·Google
MCP와 A2A가 단일 중립 재단 아래로 통합되며 에이전트 표준 거버넌스가 재단 체제로 재편
Pranav Bykampadi 외
에이전틱 시스템의 지식그래프를 '추출된 트리플의 평평한 저장소'에서 누가 사실을 소유하는지·왜 채택됐는지·어떻게 쓰여야 하는지를 기록하는 거버넌스 대상으로 재정의한 갈래. 저자 자체 보고로 SciERC에서 평면 삽입 대비 strict 트리플 F1 47%·mapped 트리플 F1 51% 개선, 120개 트리플 블라인드 검토에서 거버넌스 통과 트리플이 더 자주 출처 근거를 가졌고, MuSiQue에서 Microsoft GraphRAG 대비 exact-match 9.0포인트·token F1 11.2포인트 우위.
River AI (Igor Babuschkin)
창업 2개월 회사에 11억 달러가 투입되는 신생 랩 자본 사이클의 극단
Mirendil (CEO Behnam Neyshab
신생 랩이 제품 없이 시드 자금 절반을 곧바로 컴퓨트에 투입하는 AI R&D 자동화 랩 모델의 대표 사례
Alibaba Qwen
최상위 모델의 개방 약속과 실제 배포가 분리되는 관행. Kimi K3도 같은 방식이었다는 지적이 함께 제기됨 — 오픈 모델 기록 시 발표일과 가중치 공개일을 분리해야 하는 근거
오픈웨이트 계보보도
2026 7월 38개
Google DeepMind
원본 토큰 예산의 10% 미만으로 확산 모델을 얻는 경로를 제시, H100 1장에서 약 1,500 tok/s
MCP
initialize와 Mcp-Session-Id 폐지, MRTR 도입, server/discover 신설, Tasks·MCP Apps 확장 승격
MCP·Skills 표준화공식 발표
deedy (imo-2026 커뮤니티 프로젝트)
랩 발표가 아닌 커뮤니티 주도의 감사 추적 공개 + 독립 채점 방식 실시간 올림피아드 평가가 새 검증 관행으로 등장
평가·벤치마크공식 발표
미 캘리포니아 북부지법 (Concord v. Ant
가사 소송의 다툼 지점이 학습데이터에서 저작권표시 처리로 확장됨. 본안 판단은 아직 없음
OpenAI·Hugging Face
평가 환경을 벗어나 제3사 실제 인프라를 침해한 최초의 공개 프런티어 랩 사례 — 평가 인프라 자체가 공격 표면이라는 새 사고 유형
안전·정렬·해석가능성공식 발표
미 캘리포니아 북부지법 (Martínez-Olguí
약식판결(Alsup)과 최종승인(Martínez-Olguín)은 별개 사건·별개 판사다. 향후 산출물 기반 청구권은 유보
Anthropic (Gurnee·Lindsey 외)
출력에 전혀 나타나지 않는 전략적 숙고와 평가 자각을 감사에서 검출, CoT 감시의 후계 기술 후보
Ashwin Gerard Colaco·Nada La
흩어져 있던 컨텍스트 압축 연구를 하나의 이론틀로 정리
2026 6월 33개
Shijie Xia 외
Context Rot을 검색 에이전트 맥락에서 정량화하고 근본 해결이 어렵다는 것도 함께 보임
SK하이닉스
국내 메모리사가 후공정까지 AI 추적 시스템을 확대한다고 공식 보고서에 명시한 사례. OSAT 고객사가 요구할 데이터 연동 규격의 방향을 예고
Chen, Razkenari 외 (AWS 계열)
검색 지표 중심 평가가 그래프 기법의 이점을 과대평가해 왔다는 반성의 주류화
Sajib Acharjee Dip 외 (버지니아공대
추론 예산 제어가 연구 기법에서 서빙 계층의 문제로 내려온 지점
Apple
온디바이스 AI 프레임워크가 폐쇄형 단일 모델에서 하이브리드·멀티 프로바이더 플랫폼으로 전환
de Macedo (arXiv:2606.10106)
용어 다의성을 학술적으로 문제화, 모델 순응에 의존하지 않는 통제 기제를 조건으로 제시
2026 5월 32개
Guni Sharon
2023년 이후 파편화된 ToT 변형들을 고전 탐색 이론으로 묶은 정리
Jingyi Sun 외 (코펜하겐대 외)
충실성이 하나의 목표가 아니라 서로 당기는 여러 축임을 보임
Jinghan Jia·Joe Benton·Eric
Anthropic의 2025-04 불충실성 공개 이후 처음으로 훈련 단계 개입안을 낸 후속
Hyundai Motor Group
단일 기업 최대 규모 계획치. Metaplant America 2028, 기아 조지아 2029
上海華虹宏力·화둥이공대
실제 반도체 제조사가 저자이며 데이터 반출 없는 온프레미스를 설계 전제로 명시. 사내 GPU 1~2장으로 결함 리포트 자동화가 가능하다는 뜻. 단 양산 배치 사례 없음
METR
2026-02-24에 예고한 방법론 개편의 첫 후속 결과. 2025년 연구에서 응답자들이 소요시간 영향을 평균 40%p 과대추정했다는 점을 다시 확인했다
물리 세계·현실 영향공식 발표
Naoto Iwase 외
2022년 self-consistency의 비용 구조를 다시 짠 후속
Zhang 외 (arXiv:2605.23950)
하네스 유발 분산이 모델 유발 분산의 7.80배, 9개 모델쌍 중 6개 순위 역전
Google (Chrome)
온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다
온디바이스·로컬 추론공식 발표
2026 4월 30개
David C. Krakauer
벤치마크 간 제1주성분 설명력이 2023~24년 92%에서 추론 모델 등장 이후 64%로, 겉보기 일반성 아래의 전문화 주장
Krishnamoorthy 외 (인도·말레이시아·이
라벨 0으로 결함 형태를 군집화해 라벨링할 대표 샘플만 고르는 워크플로의 근거. 동시에 내부 군집 지표와 실제 클래스 일치도가 따로 논다는 반례
AAIF·Linux Foundation
AAIF 회원사 4개월 만에 170곳, MCP SDK 월간 다운로드 1.1억 초과, DNS rebinding 시연 등 보안이 최대 화두
MCP·Skills 표준화공식 발표
Dongzhe Fan 외
에이전틱 검색이 두 방식의 격차를 좁힘을 보여 2024년 GraphRAG 논쟁을 갱신
François Chollet
test-time에 새로움에 적응하는 fluid intelligence의 등장을 이유로 든 조건부 전향
2026 3월 23개
차오양과기대 (Chayanon Sub-r-pa, R
결함 클래스가 새로 생기면 이미지 10장 이하로 시작해야 하는 OSAT 현실에 맞는 실험 설계. 단 절대 성능은 양산 판정이 아니라 검사 보조·트리아지 수준
물리 세계·현실 영향공식 발표
Anthropic Labs (Prithvi Raja
Planner-Generator-Evaluator 3에이전트, 단일 에이전트 20분 9달러 대 풀 하네스 6시간 200달러
루프·하네스 엔지니어링공식 발표
Saroj Mishra 외
에이전틱 RAG의 첫 체계적 분류. 후속 연구의 기준점
Chen Yueh-Han·Robert McCarth
CoT를 안전 감시 수단으로 쓰자는 Monitorability 제안의 전제를 직접 시험한 후속
2026 2월 25개
METR
선택편향(AI 없이 일하기를 거부하는 참가자 증가)을 이유로 실험 재설계. 2025년 19% 결과를 철회하지는 않았으나 2026년 초 개발자는 더 빨라졌을 가능성이 높다고 밝히며 이를 very weak evidence로 명시
물리 세계·현실 영향공식 발표
Birgitta Böckeler (martinfow
guides/sensors 곱하기 computational/inferential 프레임의 최초 제시
루프·하네스 엔지니어링공식 발표
NAACP·SELC·Earthjustice
컴퓨트 확장이 환경 규제를 우회한 형태로 진행됐음을 보여줌. 주 경계를 넘겨 설치해 멤피스 인허가를 회피한 구조
컴퓨트 경제·지정학공식 발표
OpenAI (Ryan Lopopolo)
약 100만 줄 규모 내부 제품을 전량 Codex 작성으로, 5개월간 엔지니어 3~7명이 약 1,500 PR 머지
루프·하네스 엔지니어링공식 발표
Donald Ye 외
CoT 충실성 논쟁에 메커니즘 층위 증거를 더함
xAI
사상 최대 규모 합병. 같은 자료에 xAI 9월 분기 매출 1억 700만 달러·순손실 14억 6,000만 달러가 기재되어 밸류에이션과 실적의 격차가 큼. 이후 사명이 SpaceXAI로 표기
컴퓨트 경제·지정학공식 발표
2026 1월 41개
커뮤니티 (Steinberger)
개인용 자율 에이전트의 권한·감사 문제가 사회적 사건으로 비화
OpenClaw / depthfirst(Mav Le
로컬 에이전트는 안전하다는 전제를 무너뜨린 첫 대형 사고. 이후 origin 검증이 기본 요구사항
METR
방법론 변경만으로 수치가 움직인다는 것을 발행 기관이 스스로 보여준 사례. 최상위 모델 50% 시간지평 약 5.3시간은 이 개정판 기준이며 이전 판과 직접 비교할 수 없다
평가·벤치마크공식 발표
류블랴나대 (Fučka, Zavrtanik, Sko
신제품 라인 초기, 정상 이미지조차 없는 구간을 커버하는 유일한 형태. 단 반도체·PCB 전용 결과는 없어 사내 파일럿 확인이 필요
PyTorch 재단
수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호
AI 인프라 소프트웨어공식 발표
World Economic Forum (McKins
AI 단독 도입은 성과가 안 난다는 것을 220개 사이트 규모로 집계한 준-표준 근거. 반면 후공정 사이트 부재는 이 벤치마크를 OSAT에 직접 적용하기 어렵다는 신호
물리 세계·현실 영향공식 발표
xAI
사후 대응이며 범위가 제한적. AP는 조치 발표 다음 날에도 무료 사용자에게 편집 도구가 남아 있었다고 확인 — 발표와 실제 적용의 시차
Pietro Ferrazzi 외
에이전틱 RAG가 항상 낫지는 않다는 실증. 설계 선택의 근거가 되는 반증형 결과
Dario Amodei
Machines of Loving Grace의 낙관을 철회하지 않으면서 위험 서술을 대폭 확장. 같은 저자의 두 텍스트가 낙관·위험 양쪽 인용에 모두 쓰이는 상황을 만듦
인물·담론공식 발표
IBM (Raffi Khatchadourian)
도메인은 금융이지만 감사 재현 요구는 품질 감사와 동일 구조. 정확도 높은 모델을 고르면 재현성이 따라온다는 통념을 4,705회 실행으로 반증
2026년 1개
Amkor Technology
2위 OSAT의 공개 수준도 동일. 후공정 AI는 적용 사례가 없는 것이 아니라 정량 공개가 없는 것이며, 이 격차가 내부 도입 정당화를 어렵게 만드는 실제 원인
물리 세계·현실 영향공식 발표