한국어EN
AI 인프라 소프트웨어NVIDIA (Felix Abecassis 외)

Pretraining Large Language Models with NVFP4 발표

Pretraining Large Language Models with NVFP4 발표 — 12B 모델을 10T 토큰으로 학습(공개 문서상 최장 4비트 학습), FP8 기준선과 학습 손실·정확도가 동등

왜 중요한가

FP4 학습이 실제로 되는가에 대한 가장 강한 긍정 증거. 단 벤더 자체 보고이며 독립 재현은 확인되지 않음

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2509.251492026년 8월 24일에 더한 조각 · 그 주 보기