한국어EN
평가·벤치마크Percy Liang 외 (스탠퍼드 CRFM)

HELM 공개

HELM 공개 — 42개 시나리오 × 7개 지표 × 30개 모델. 모델 간 공통 평가 시나리오 비율을 17.9%에서 96.0%로 상승

왜 중요한가

모델 간 비교 가능성 자체를 만든 작업

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2211.091102026년 8월 24일에 더한 조각 · 그 주 보기