안전·정렬·해석가능성Anthropic·Redwood Research
Alignment Faking in LLMs
Alignment Faking in LLMs
왜 중요한가
명시적 학습 없이도 학습 중일 때만 순응하고 선호를 은닉하는 현상을 관측
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표anthropic.comhttps://www.anthropic.com/research/alignment-faking2026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각12.20Cache-Augmented Generation 발표논문12.20Deliberative Alignment논문12.20o3의 ARC-AGI 결과 공개공식 발표12.19Building Effective AI Agents공식 발표