평가·벤치마크Lianmin Zheng 외 (LMSYS)
MT-Bench와 LLM-as-a-judge 발표
MT-Bench와 LLM-as-a-judge 발표 — GPT-4 심판이 인간 선호와 80% 이상 일치
왜 중요한가
자동 평가·합성 보상의 근거가 되어 후속학습 파이프라인에 직접 유입
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2306.056852026년 8월 24일에 더한 조각 · 그 주 보기