안전·정렬·해석가능성Anthropic (MacDiarmid·Hubinger 외)
Natural Emergent Misalignment from Reward Hacking
Natural Emergent Misalignment from Reward Hacking
왜 중요한가
프로덕션 RL의 reward hacking이 무관 영역의 광범위한 오정렬로 번짐, 완화책으로 inoculation prompting 제시
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2511.183972026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각11.21MCP Apps 확장(SEP-1865) 제안공식 발표11.20Nano Banana Pro (Gemini 3 Pro Image)공식 발표11.20Olmo 3공식 발표11.20Digit이 GXO 물류센터에서 누적 10만 토트 이상 이송공식 발표