한국어EN

2024년 180개 조각

기록 180 · 정리 노트 0

2024 12월 18


Geoffrey Hinton
정성적 경고를 수치로 전환. 이후 p(doom) 논쟁에서 가장 널리 인용되는 기준값

DeepSeek-AI
저정밀 사전학습을 프론티어 스케일에 안착

대한민국 국회

xAI
칩 공급사가 직접 투자자로 들어온 구조

François Chollet / ARC Prize
능력과 비용을 함께 보고하는 관행을 만듦

OpenAI (Guan·Wallace·Barak 외
안전 규범을 CoT로 명시 추론하게 학습, 추론모델 정렬의 기본 레시피

Brian J Chan 외 (국립정치대·중앙연구원)
롱컨텍스트 시대에 RAG 자체를 생략하는 갈래

Google
Google 첫 추론 모델, 사고 과정을 사용자에게 노출하는 노선

Anthropic
워크플로와 에이전트를 구분하고 프레임워크보다 API 직접 호출에서 시작하라 권고, 2년간 열광의 정리
툴·에이전트공식 발표

Anthropic·Redwood Research
명시적 학습 없이도 학습 중일 때만 순응하고 선호를 은닉하는 현상을 관측

Xu 외 (TheAgentCompany)
용어가 대중화 이전 평가 커뮤니티에서 먼저 쓰였음이 전문에서 확인

Ilya Sutskever
스케일링 회의론이 비평가가 아니라 스케일링 패러다임 창시자 중 한 명에게서 나옴. peak data가 업계 표준 용어가 됨

Meta (Pagnoni 외)
엔트로피 기반 동적 패치로 고정 어휘 없이 바이트를 직접 처리, 토크나이저 제거 노선의 최초 대규모 스케일링

Keller Jordan
Newton-Schulz 직교화로 AdamW 대비 학습 속도 기록을 경신

BIS
메모리가 처음으로 통제 축이 됨

OpenAI
더 오래 생각하는 값을 사용자가 지불한다는 inference-scaling의 상업화

Nous Research
예비 보고서 수준의 주장이 재현 가능한 논문·코드로 전환

DeepSeek
MIT 라이선스와 극단적 비용 효율로 중국 진영이 가장 개방적인 위치를 점유

2024 11월 12


Alibaba Qwen
o1 이후 최초의 오픈 추론 모델

Microsoft Research (Edge, Tr
GraphRAG 원저자들이 스스로 비용 문제를 인정하고 지연 그래프 구축으로 방향을 튼 사건

Anthropic
N개 모델 곱하기 M개 데이터소스의 조합 폭발을 단일 개방 표준으로 대체

AI2
선호 학습에서 검증 가능 보상으로의 전환점

Ai2
보상 모델을 검증 함수로 대체하는 접근을 명명, 파이프라인 전 단계 공개

Ilya Sutskever (Reuters)
사전학습 스케일링 회의론의 최초 공개 발언

Gary Marcus
스케일링 한계 논쟁이 비평가 진영에서 업계 내부 보도로 넘어간 전환점

The Information
스케일링 벽 논쟁 점화

Tanishq Kumar 외 (하버드)
FP8/FP4가 되는가를 스케일링 법칙 수준에서 답한 검증 연구. 정밀도를 공짜 최적화가 아니라 용량 교환으로 재정의

Epoch AI (Elliot Glazer 외)
오염 불가능한 홀드아웃 설계

Adam Fourney 외 (Microsoft Re
오케스트레이터-워커 패턴의 구현 레퍼런스

xAI
경쟁사 API 호환을 채택해 전환 비용을 낮추는 전략

2024 10월 20


Physical Intelligence

Anthropic (Benton 외)
모델이 인간의 감독·평가·의사결정을 방해하는 능력을 별도 위험 범주로 정식화

OSI
Llama·Gemma·Qwen 대부분이 오픈소스가 아니라는 판정 근거를 확립

Noam Brown
사전학습 스케일링에서 추론 시점 스케일링으로 축을 이동. 이후 추론 모델 담론의 근거 문장

Google DeepMind
생성물 출처표시가 연구 단계를 넘어 대규모 배포된 첫 사례

Anthropic
전용 API 없이 스크린샷·좌표로 GUI를 조작하는 첫 프론티어 모델

Anthropic
능력 임계값 체계 개편

Preferred Networks / Preferr
일본 국책자금이 실제 100B급 국산 모델 산출로 이어진 첫 확인 사례

Anthropic
프롬프트 엔지니어링 기법이 제품 기능으로 흡수된 지점

Xi Jiang, Jian Li, Chengjie
범용 멀티모달 LLM에 결함 판정을 직접 맡기는 구상의 상한선. 74.9%는 최종검사 판정으로 쓸 수 없는 수준

일본 NEDO·경제산업성
국가가 GPU 사용료를 직접 보조해 국산 기반모델을 다수 병렬 육성하는 방식. 승자 선택이 아닌 분산 배팅형 산업정책

일본 산업기술종합연구소 (産総研)
일본의 국가 AI 계산자원을 한 세대 위로 올린 축. 민간 스타트업·대학이 공용으로 쓰는 국가 컴퓨트 모델

Wanchao Liang 외 (Meta)
Megatron-LM 대안으로 PyTorch 네이티브 학습 프레임워크가 성립한 시점. FSDP2·torch.compile·FP8이 한 스택으로 묶임

HKU (Guo, Xia, Huang 외)
Microsoft GraphRAG 고비용 인덱싱에 대한 오픈소스 진영의 대표적 경량 대안

Iman Mirzadeh 외 (Apple)
수학 추론이 형식적 추론이 아닐 수 있다는 증거

BIS
제3국 데이터센터 사업자에게 사전승인 경로를 부여

gusye1234 (오픈소스 커뮤니티)
공식 구현이 무겁다는 커뮤니티 불만이 해킹 가능한 초경량 재구현으로 표출

OpenAI
음성이 개발자 프리미티브(speech-to-speech WebSocket)로
멀티모달공식 발표

OpenAI
3사 중 마지막으로 프리픽스 캐시를 상품화

Dario Amodei
AGI 대신 powerful AI, 데이터센터 속 천재들의 나라라는 어휘를 정착시킴. 안전 담론 진영에서 나온 최초의 본격 낙관론 문서
인물·담론공식 발표

2024 9월 11


캘리포니아 주지사
프런티어 모델 규제 입법의 첫 좌절

Sam Altman
a few thousand days가 2024~25년 타임라인 논쟁의 단일 최다 인용구. 모호한 단위 자체가 논쟁 대상이 됨
인물·담론공식 발표

Anthropic
청크 앞에 LLM 생성 설명 50~100토큰을 붙여 검색 실패율 35% 감소, BM25 결합 49%, 리랭킹까지 67%

Voyage AI
상용 임베딩 API 경쟁이 OpenAI 기준선을 명시적으로 겨냥한 국면

Zayne Sprague 외 (텍사스대 오스틴 외)
CoT의 적용 범위를 실증적으로 좁힌 반박

Alexandre Défossez 외 (Kyutai
파이프라인형 음성 대화를 단일 모델로 대체한 계보

하정우 (네이버 퓨처AI센터장)
한국에서 소버린 AI가 기업 마케팅어에서 국가 정책어로 넘어가는 전환점. 이 인물이 9개월 뒤 정부 AI 정책 총괄이 됨

OpenAI
최초의 상용 추론 모델, AIME 2024에서 GPT-4o 12%에서 o1 74%로

Ant Group (Liang, Sun 외)
중국 빅테크가 GraphRAG 계보를 전문 도메인(금융·의료)용으로 산업화한 사례

Michael Günther 외 (Jina AI)
청킹으로 문맥이 끊기는 문제를 임베딩 순서 변경으로 해결

xAI
자체 발표 기준 업계 최단 구축. 단 초기 계통 연결은 8MW에 불과해 임시 가스터빈에 의존했고 11월에야 150MW로 승압

2024 8월 14


Cerebras
웨이퍼 스케일 SRAM으로 GPU HBM 대역폭 한계를 우회, 추론 전용 칩 카테고리 대중화

Nous Research
데이터센터 인터커넥트 없이 인터넷 대역폭으로 학습한다는 노선의 출발점

Epoch AI
2030년까지 유효 토큰 400조에서 2경, 전력이 먼저 구속하고 다음이 칩 생산능력이라는 순서 제시

Peng, Zhu 외 (베이징대·앤트그룹 등)
난립하던 변종들을 하나의 분류 체계로 묶어 그래프 기반 RAG를 독립 연구 분야로 공식화

Nous Research
커뮤니티가 405B를 실제로 파인튜닝한 첫 사례

Anthropic
캐시 경제성이 가격표로 노출되어 이후 에이전트 경제성의 핵심 변수가 됨

OpenAI
에이전트 코딩 평가의 기준 데이터셋. 원본 벤치마크의 상당수가 부적격이었음을 드러냄

Sakana AI
연구 자동화 담론을 논문 1편 15달러라는 구체 수치로 전환

xAI
이미지 생성은 자체 모델이 아니라 외부 모델(Black Forest Labs FLUX.1) 연동으로 시작

미 캘리포니아 북부지법 (Orrick 판사)
이미지 생성 모델 학습에 대한 첫 실질 심리 진입

LG AI연구원
한국 대기업 최초의 자체 LLM 오픈 공개. 다만 연구 목적 한정 라이선스로 한국형 개방 전략의 보수성도 함께 드러냄

Snell 외
test-time compute가 파라미터 확대보다 효율적일 수 있음을 실증

DeepSeek
프리픽스 캐시의 상품화, 서빙 내부 최적화가 API 가격표로 노출

EU
발효는 적용이 아니다. 적용은 단계별로 나뉜다

2024 7월 13


Meta (Llama 3 팀)
대규모 학습 내결함성 문제를 처음으로 정량 공개한 1차 자료. 체크포인팅·자동 복구가 필수임을 산업 전체에 확정

Andrej Karpathy
벤치마크 점수와 실사용 신뢰도의 괴리를 부를 이름을 만듦. Salesforce가 정식 연구 의제로 채택해 SIMPLE 벤치마크를 만들었고 Sundar Pichai는 AJI로 변주

Google DeepMind
형식언어 기반 자기학습이 올림피아드 수준에 도달. DeepMind는 Lean·Mathlib 없이는 불가능했다고 명시

Shumailov 외 (Nature)

Meta
프런티어급 가중치가 처음 공개되고 출력물을 이용한 학습이 라이선스로 허용

Zhuowan Li 외 (Google DeepMin
롱컨텍스트 vs RAG 논쟁을 비용·성능 트레이드오프로 정리

Andrej Karpathy
프런티어 랩 연구자가 교육을 독립 사업으로 선언한 사례
인물·담론공식 발표

EU 관보

Jay Shah 외 (Colfax·Together
커널이 특정 세대 실리콘에 맞춰 재작성되어야 함을 보인 사례. FP8 어텐션의 정확도 우려를 정량적으로 반박

Microsoft Research
연구 기법이 널리 복제 가능한 구현체로 확산된 시점

Liang Wenfeng (梁文锋)
중국 랩의 오픈웨이트 전략을 비용 절감이 아니라 생태계·독창성 논리로 정식화. 원문이 중국어라 인용부호 없이 요지만 기록

EleutherAI
평가 인프라가 소수 오픈소스 구현에 집중되는 구조를 형성

켐니츠 공대·Voxar Labs(UFPE)
다이싱은 후공정 첫 공정. 소량 결함 이미지에 합성 증강만으로 23%p 향상은 신규 결함 클래스 초기 데이터 부족 구간에 직접 대응

2024 6월 19


Google
초장문 컨텍스트가 대기자 명단을 벗어나 일반 개발자 선택지가 됨

Manuel Faysse 외 (Illuin Tech
OCR·파싱 파이프라인을 생략한 시각 문서 검색 계보

Hugging Face
LLM 분류기로 교육적 가치를 점수화한 부분집합이 원본보다 나은 모델을 만들어 model-based filtering을 표준화

Moonshot AI·Tsinghua (Qin 외)
실서비스 기반의 KV 캐시 계층형 관리

Ziyan Jiang 외 (워털루대)
RAG와 롱컨텍스트를 대립이 아닌 역할 재배분으로 다룸

Ilya Sutskever, Daniel Gross
제품 출시 없이 초지능만 직행한다는 조직 형태 자체가 하나의 주장. 상업화 압력과 안전을 분리할 수 있는가라는 논쟁을 촉발
인물·담론공식 발표

NVIDIA
데이터 생성 파이프라인 자체가 제품이 됨

Shunyu Yao 외 (Sierra)
단발 툴 호출이 아닌 다회차 정책 준수를 측정

Krista Opsahl-Ong 외 (스탠퍼드·UC
DSPy 옵티마이저의 이론적 기반

SB Intuitions (소프트뱅크)
일본 대기업이 자국어 사전학습 모델을 공개 배포한 초기 사례이자 통신사 자본이 국산 LLM에 들어온 신호

Stanford 외
학계·중소기업의 진입 장벽 하락

Maxime Labonne
재학습 없이 안전 정렬을 되돌릴 수 있음을 공개 증명, 오픈웨이트 안전 논쟁의 기술적 근거

Xu 외
증류가 API 호출조차 필요 없는 수준으로 저렴해짐

Pearce & Song
두 법칙의 충돌이 비임베딩 파라미터 카운팅과 소규모 분석에서 비롯됨을 규명

Mert Yuksekgonul 외 (스탠퍼드)
자동미분 은유를 텍스트 시스템 전반으로 확장

Apple
OS 수준 온디바이스 LLM 통합의 첫 대규모 사례

Epoch AI
데이터 고갈 담론의 정량적 기준점

Sander Schulhoff 외 (메릴랜드대 외)
흩어져 있던 기법 계보를 단일 분류체계로 고정. v1 제목은 Survey of Prompting Techniques

Leopold Aschenbrenner
AGI 타임라인 논쟁을 정책·안보 의제로 밀어올림. 예측 자체보다 AGI 국유화 프레임을 도입한 효과가 컸고 동시에 가장 집중적으로 반박된 문서
인물·담론공식 발표

2024 5월 19


Anthropic
주요 모델 제공자 전반에서 도구 호출이 기본 기능으로 표준화
툴·에이전트공식 발표

Joonhyung Lee 외 (NAVER Cloud
FP8 학습 서사에 대한 정면 반박. 된다는 보고와 재현이 안 된다는 보고가 공존함을 문서화

xAI
밸류에이션은 발표문에 미공개

Bernal Jiménez Gutiérrez 외 (
GraphRAG 계보의 다중 홉 검색 갈래

Meng 외
direct alignment 계열의 마지막 단순화

기업 20곳
각 랩의 안전 프레임워크 공개 관행의 기원

대한민국·영국
한국이 공동주최한 국제 AI 거버넌스 이정표

EU 이사회
AI Act 입법 절차가 끝난 날. 이후 일정은 전부 발효·적용일 문제이며 입법 여부의 문제가 아니다

Anthropic
SAE를 프로덕션급 모델에 최초 적용하고 특징 조종을 시연, 해석가능성이 관찰에서 개입으로

Berkeley 외
VLA 오픈소스화의 시작

콜로라도 주지사
미국 첫 포괄 주 AI법으로 널리 인용되나 이후 폐지·재제정됨

Google DeepMind
RSP·PF와 함께 3대 위험 평가 프레임워크 체제 성립

OpenAI
음성 응답 최소 232ms·평균 320ms로 캐스케이드 구조의 지연과 정보손실을 구조적으로 제거
멀티모달공식 발표

Luke Merrick 외 (Snowflake)
데이터 웨어하우스 벤더가 임베딩 모델을 직접 만들기 시작한 신호

DeepMind·Isomorphic (Nature)
단백질을 넘어 핵산·저분자·이온 복합체로 확장

OpenAI
모델 행동 규범을 공개 문서로 고정, 이후 업계 표준 포맷이 됨

DeepSeek-AI
KV를 저차원 latent로 압축하는 MQA·GQA와 다른 제3의 노선

Princeton (John Yang 외)
에이전트 전용 인터페이스 설계라는 개념을 제시하고 SWE-bench pass@1 12.5%를 오픈소스로 달성

Hugh Zhang 외 (Scale AI)
벤치마크 오염을 통제 실험으로 측정. 단 프런티어 모델은 과적합 징후가 적다고 보고

2024 4월 16


GitHub
이슈에서 계획, 코드, 검증으로 이어지는 흐름으로 자동완성에서 태스크 단위 에이전트로 제품 전환
툴·에이전트공식 발표

Darren Edge 외 (Microsoft Res
국소 검색으로는 답할 수 없는 전역 요약 질의를 다룸

Jacob Pfau 외 (NYU)
CoT 성능 향상이 반드시 추론 내용 때문은 아님을 보인 반박

Microsoft Research
폰에 배포 가능한 소형 모델 노선을 데이터 큐레이션으로 정당화

Hugging Face
오픈 웹 코퍼스의 규모 상한을 갱신

일본 총무성·경제산업성
EU AI Act의 하드로에 대비되는 소프트로 단일 문서 선택. 이후 AI추진법의 골격이 됨

Meta
8B가 이전 세대 70B급 성능을 내며 로컬 실용선을 끌어올림

xAI
자체 벤치마크를 만들어 함께 공개한 사례. 발표문은 곧 얼리 테스터에 제공한다고만 밝혀 실제 일반 출시 여부는 미확인
멀티모달공식 발표

Internet of Bugs (Carl Brown
에이전트 데모의 재현성·검증 문제를 업계 의제로 만듦

Cohere
리랭커가 별도 파운데이션 모델 제품군으로 상업화된 시점. RAG에서 2단 구조가 기본 아키텍처로 정착

Tianbao Xie 외 (홍콩대·Salesforc
컴퓨터 사용 에이전트의 사실상 표준 벤치마크

Neo4j
그래프 DB 벤더가 GraphRAG를 상품 카테고리로 채택한 초기 사례 — 학계 용어의 상용 스택 편입 시점

OpenAI
1년 만에 접힌 첫 대규모 도구 생태계, 느슨한 마켓플레이스보다 스키마 기반 함수 호출이 살아남는다는 신호
툴·에이전트공식 발표

Cheng-Ping Hsieh 외 (NVIDIA)
광고된 컨텍스트 길이와 실효 길이의 격차를 표준화된 방식으로 노출

Cheetham & Seshadri
생성된 후보와 검증된 물질의 간극이라는 이 분야의 핵심 쟁점을 확립

Gerstgrasser 외
실데이터를 대체하면 붕괴하나 누적하면 오차 상한이 유한함을 증명, 모델 붕괴 담론을 재정의

2024 3월 12


xAI
컨텍스트를 이전 대비 16배로 확대

NTT
파라미터 규모 경쟁을 따라가지 않고 경량·자국어 특화로 방향을 잡은 일본 통신사 노선의 시작점

Sakana AI
사전학습 없이 기존 오픈웨이트를 조합해 비영어 능력을 얻는 경로 제시 — 컴퓨트 열위 국가의 전략 원형

NVIDIA
랙 하나를 하나의 거대 GPU로 다루는 패러다임

xAI
당시 최대 규모의 Apache 2.0 오픈웨이트 MoE. 단 대화용 파인튜닝이 없는 raw 체크포인트로 실사용성은 제한적

일본 문화청 문화심의회 저작권분과회
일본은 AI 학습이 자유롭다고 국제적으로 인용되는 조항의 실제 한계선을 정부가 문서로 그은 사건. 작풍 모방 목적 파인튜닝은 면책되지 않는다

유럽의회

Hong 외
정렬 파이프라인의 추가 단순화

Cognition
SWE-bench 13.86%로 기존 SOTA 1.96%를 7배 이상 갱신했다고 발표
툴·에이전트공식 발표

인도 정부 (Union Cabinet)
국가가 GPU를 직접 조달·배분하는 컴퓨트 공공재 모델의 초기 사례. 이후 한국·일본 계획의 참조점

IEEE Spectrum (Dina Genkina)
프롬프트 엔지니어 직무 쇠퇴 서사의 초기 편집 매체 기록

Microsoft Research India (Ag
긴 프롬프트가 decode를 멈춰세우는 문제를 해소, vLLM 대비 서빙 용량 2.6~5.6배

2024 2월 14


Jake Bruce 외 (Google DeepMin
월드 모델 계보의 기점. 저자들은 이 규모에서 foundation world model로 볼 수 있다고 주장

Ahmadian 외
RL 단순화 계열의 대표

양즈린 (杨植麟, Moonshot AI)
롱컨텍스트를 AGI 경로의 핵심 축으로 선언한 중국 랩 창업자의 첫 체계적 진술. 2024년 중국 LLM 경쟁이 긴 문맥 경쟁으로 재편되는 언어를 제공

Google
빅테크의 소형 오픈웨이트 참전이나 Apache가 아니라는 비판

OpenAI
비디오 생성 모델은 곧 월드 시뮬레이터라는 담론을 촉발
멀티모달공식 발표

Google DeepMind
컨텍스트 길이가 자릿수 단위로 도약하며 RAG는 죽었다 논쟁을 촉발

Xuezhi Wang 외 (Google DeepMi
CoT가 프롬프트가 아닌 디코딩 문제일 수 있음을 제시

Microsoft Research
벡터 유사도 검색 밖의 구조화 인덱스 계보

UCL·NYU·Anthropic (Khan 외)
debate 기반 감독이 비전문가 심판의 정확도를 실제로 높인다는 첫 경험적 근거

Rick Battle 외 (VMware)
사람이 프롬프트를 손으로 다듬는 방식의 한계를 실증. 프롬프트 엔지니어링 쇠퇴 서사의 실증 근거

Pei Zhou 외 (USC·Google DeepM
프롬프트 기법 선택 자체를 모델에 위임

DeepSeek
가치함수 없는 그룹 상대 정책 최적화가 이후 추론 모델 RL의 사실상 표준이 됨

Zach Nussbaum 외 (Nomic AI)
학습 데이터까지 공개한 첫 경쟁력 있는 임베딩 모델. 재현 가능성을 임베딩 경쟁의 축으로 추가

Ethayarajh 외
보편적으로 우월한 손실 함수는 없고 설정에 맞는 귀납 편향이 최선이라는 결론

2024 1월 11


AI2
데이터와 도구를 함께 공개해 데이터 과학을 재현 가능하게 만듦

Parth Sarthi 외 (스탠퍼드)
청크 단위 검색의 대안으로 계층 요약 인덱스 제시

Shi-Qi Yan 외 (중국과기대·UCLA)
검색 실패를 전제로 한 방어적 RAG 설계

OpenAI
MRL식 절단이 상용 API 기본 기능이 됨

Qdrant
Rust 기반 고성능 단일 목적 엔진 노선의 자본 확보

UCSD·PKU (Zhong 외)
prefill과 decode를 별도 GPU 풀로 나눠 지연 지표를 독립 튜닝

LMSYS
멀티턴·에이전트처럼 프롬프트가 겹치는 워크로드를 위한 캐시 계층을 런타임 수준으로

Trieu H. Trinh 외 (Google Dee
형식 검증 가능한 보상이 추론 학습을 이끈 초기 사례. 인간이 읽을 수 있는 증명 생성

Pinecone
벡터DB 비용 구조를 상주형에서 사용량 기반으로 전환

Anthropic
백도어가 표준 안전 학습을 견디고, 적대적 학습은 제거 대신 은닉을 강화함을 보임

ISO/IEC JTC 1/SC 42
검사 AI가 안전 인터록에 물릴 때 어느 유형인지 규정하는 것이 감사 대응의 출발점. 단 Technical Report이며 인증 근거가 되는 규범 표준이 아님

2024년 1


ASE Holdings
세계 1위 OSAT의 공개 범위가 곧 업계 상한선. FDC·RMS·이력추적이 AI의 전제 인프라로 먼저 깔려 있다는 순서가 중요 — 검사 모델보다 데이터 파이프라인이 먼저