AI 인프라 소프트웨어Jay Shah 외 (Colfax·Together AI·Meta·NVIDIA·프린스턴)
FlashAttention-3 발표
FlashAttention-3 발표 — Hopper 특화 비동기화로 H100에서 FP16 1.5~2.0배(최대 740 TFLOPs/s), FP8은 약 1.2 PFLOPs/s
왜 중요한가
커널이 특정 세대 실리콘에 맞춰 재작성되어야 함을 보인 사례. FP8 어텐션의 정확도 우려를 정량적으로 반박
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2407.086082026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각07.12규정 (EU) 2024/1689 관보 게재정부 기록