학습 데이터·후속학습Meng 외
SimPO
SimPO — 평균 로그확률을 암묵 보상으로, 레퍼런스 프리
왜 중요한가
direct alignment 계열의 마지막 단순화
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2405.147342026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각05.26시리즈 B 60억 달러 마감공식 발표05.23HippoRAG 발표논문05.21Scaling Monosemanticity / Golden Gate Claude공식 발표05.21AI Act 이사회 최종 승인보도