DPO 보상모델과 PPO 없이 선호쌍으로 직접 최적화해 오픈소스 정렬을 대중화
홈 › 타임라인 › 2023년 › E0231 안전·정렬·해석가능성Stanford (Rafailov 외)2023년 5월 29일 DPO DPO 왜 중요한가보상모델과 PPO 없이 선호쌍으로 직접 최적화해 오픈소스 정렬을 대중화 출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2305.182902026년 8월 24일에 더한 조각 · 그 주 보기 같은 주에 나온 조각06.01AWQ논문06.01RefinedWeb논문같은 축의 가까운 조각07.05Superalignment 팀 출범공식 발표09.19Responsible Scaling Policy v1.0 (ASL 체계)공식 발표12.14Weak-to-strong generalization공식 발표01.10Sleeper Agents논문 RAP(Reasoning via Planning) AWQ