한국어EN
축 ⑯

평가·벤치마크

기록 53 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.


Anthropic
인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례

OpenAI
GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동

xAI
프런티어 랩이 생물보안 거부율을 수치로 공개하고 외부 평가기관을 지정한 사례 — 다만 자사 게시물이며 독립 재현은 없다

Anthropic
프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌

Anthropic
정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장

Google DeepMind·싱가포르 AI 안전연구
벤치마크 오염 방지와 IP 보호를 동시에 노리는 평가 인프라 시도 — 비공개 벤치마크로 프런티어 모델을 검증하는 경로

Surge AI
리더보드가 정확성보다 서식·인상에 최적화된다는 비판. 다만 인간 데이터 판매사의 자체 분석이며 독립 검증이 아니다

Artificial Analysis
개방과 폐쇄의 격차가 3점까지 좁혀짐

Guidelight AI Standards
프런티어 랩의 통제 실무를 등급제로 채점하는 독립 감사 기구라는 새 조직 형태의 등장 — 등급은 Guidelight 자체 평가

deedy (imo-2026 커뮤니티 프로젝트)
랩 발표가 아닌 커뮤니티 주도의 감사 추적 공개 + 독립 채점 방식 실시간 올림피아드 평가가 새 검증 관행으로 등장

OpenAI·Hugging Face
평가 환경을 벗어나 제3사 실제 인프라를 침해한 최초의 공개 프런티어 랩 사례 — 평가 인프라 자체가 공격 표면이라는 새 사고 유형

Edwin H. Wintermute 외
능력과 거부 행동을 단일 쌍 지표로 묶어 과잉거부 문제를 생물보안 평가에 정식 편입

AMD
ROCm이 1년 만에 격차를 한 자릿수 퍼센트로 좁혔음을 표준 벤치마크로 보인 자료. CUDA 독점의 실질적 균열

Epoch AI
최상위 난이도 벤치마크에서도 대규모 오류가 발견돼 검수 신뢰성 문제가 재확인됨

Elastic
통합형 검색 엔진이 양자화로 전용 벡터DB의 성능·비용 논리를 직접 겨냥

Andrew Bo Liu 외
바이오 위험 평가가 지식 문답에서 에이전트의 실제 실험 루프 수행 능력 평가로 이동한 새 벤치마크 계열의 등장

Laude Institute
벤치마크가 자기 결함을 공개 시인하고 지속 검증 체계를 도입한 사례

David C. Krakauer
벤치마크 간 제1주성분 설명력이 2023~24년 92%에서 추론 모델 등장 이후 64%로, 겉보기 일반성 아래의 전문화 주장

Dongzhe Fan 외
에이전틱 검색이 두 방식의 격차를 좁힘을 보여 2024년 GraphRAG 논쟁을 갱신

ARC Prize
정적 문제풀이에서 지시 없는 대화형 탐색·기술 습득으로 축 이동

OpenAI Frontier Evals
감사 대상 문제의 최소 59.4%가 결함 테스트, 벤더가 벤치마크 하네스의 신호 오염을 인정

METR
방법론 변경만으로 수치가 움직인다는 것을 발행 기관이 스스로 보여준 사례. 최상위 모델 50% 시간지평 약 5.3시간은 이 개정판 기준이며 이전 판과 직접 비교할 수 없다

LMArena
텍스트 LLM 아레나에서 다중 모달리티 평가 플랫폼으로 정체성을 공식 확장

METR
자기 지표가 과도 일반화되어 인용되는 것을 발행 기관이 직접 제동한 사례

Uygar Kurt
어떤 양자화를 쓸 것인가를 체감이 아니라 측정으로 옮긴 첫 통합 레퍼런스

Terminal-Bench 팀
에이전트 CLI 평가에 클라우드 컨테이너 실행과 RL/SFT 롤아웃 인터페이스를 붙인 평가 인프라

Andon Labs
자판기 사업을 1년간 운영시키는 장기 일관성 평가. 단발 과제로 못 보는 코히런스를 측정

OpenAI
정답 채점형에서 벗어나 경제적 가치가 있는 실제 업무로 평가 대상을 옮긴 설계

Meta
정적 정보검색 평가에서 동적·비동기 환경의 에이전트 견고성 측정으로 전환

Scale AI
SWE-bench 계열의 오염·포화에 대응한 후속 설계. 티어 분리로 유출을 구조적으로 막으려는 시도

FutureHouse
프런티어 벤치마크의 정답 자체가 틀릴 수 있음을 공개 반증-대응으로 드러낸 사례

Xiang, Wu 외 (홍콩이공대 등)
그래프가 언제 도움이 되는가를 벤치마크로 검증하는 국면 전환점 — 2026년 회의론의 방법론적 선행

Shivalika Singh 외 (Cohere La
리더보드 과적합 구조를 실증. 아레나 순위를 능력의 직접 지표로 읽으면 안 되는 이유

Meta / LMArena
리더보드 제출 버전과 공개 배포판의 불일치 문제가 공론화

ARC Prize
점수와 비용을 함께 리더보드 지표로 승격

Epoch AI
벤치마크 독립성 문제의 1차 자료

TechCrunch
벤치마크 제작 자금의 이해상충이 공론화

François Chollet / ARC Prize
능력과 비용을 함께 보고하는 관행을 만듦

Epoch AI (Elliot Glazer 외)
오염 불가능한 홀드아웃 설계

OpenAI
에이전트 코딩 평가의 기준 데이터셋. 원본 벤치마크의 상당수가 부적격이었음을 드러냄

EleutherAI
평가 인프라가 소수 오픈소스 구현에 집중되는 구조를 형성

Hugh Zhang 외 (Scale AI)
벤치마크 오염을 통제 실험으로 측정. 단 프런티어 모델은 과적합 징후가 적다고 보고

David Rein 외
검색으로 못 푸는 난이도를 설계 원리로 삼아 확장가능 감독 연구와 연결

Carlos E. Jimenez, John Yang
이후 코딩 에이전트 개발의 사실상 목표함수가 됨

Clémentine Fourrier 외 (Huggi
벤치마크 수치의 비교불가능성을 공개적으로 확인한 사건

Lianmin Zheng 외 (LMSYS)
자동 평가·합성 보상의 근거가 되어 후속학습 파이프라인에 직접 유입

LMSYS
정답 있는 벤치마크에서 인간 선호 기반 평가로 축을 이동

Percy Liang 외 (스탠퍼드 CRFM)
모델 간 비교 가능성 자체를 만든 작업

Aarohi Srivastava 외 (450명·13
커뮤니티 크라우드소싱형 벤치마크. 규모에 따라 성능은 개선되나 절대 수준은 낮다는 결론

Dan Hendrycks 외
사전학습 모델의 지식 폭을 재는 사실상의 표준이 되어 이후 5년간 모델 발표의 필수 지표

François Chollet
이후 AGI 논쟁의 측정 기준을 제공

Alex Wang 외
벤치마크 포화에서 교체로 이어지는 사이클의 첫 사례

Alex Wang 외 (NYU 외)
단일 과제가 아닌 다중 과제 묶음으로 언어이해를 정의. 이후 모든 LLM 리더보드의 원형