축 ⑱
AI 인프라 소프트웨어
기록 53 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.
Guowei Wang 외
별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.
Anthropic
데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다
안전·정렬·해석가능성공식 발표
Zihan Qiu 외 (Alibaba Qwen)
프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.
PyTorch 재단
수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호
AI 인프라 소프트웨어공식 발표
PyTorch (Meta)
2022년 Google Pathways가 제시한 단일 컨트롤러 모델이 PyTorch 코어 계보로 들어온 지점. TorchTitan 은 Monarch 안의 액터가 되고 torchforge 는 Monarch 위에 세워진다
AI 인프라 소프트웨어공식 발표
PyTorch (Meta)
Triton이 CUDA를 한 단계 추상화했듯 Helion은 Triton을 한 단계 더 추상화한다. 커널 작성 계보의 다음 층
AI 인프라 소프트웨어공식 발표
PyTorch 재단
멀티 GPU 커널을 프레임워크 API 수준에서 직접 쓰게 하는 방향. NCCL 계열 집합통신 위에 사용자 커널 경로가 하나 더 생겼다
AI 인프라 소프트웨어공식 발표
NVIDIA (Felix Abecassis 외)
FP4 학습이 실제로 되는가에 대한 가장 강한 긍정 증거. 단 벤더 자체 보고이며 독립 재현은 확인되지 않음
Tanishq Kumar 외 (하버드)
FP8/FP4가 되는가를 스케일링 법칙 수준에서 답한 검증 연구. 정밀도를 공짜 최적화가 아니라 용량 교환으로 재정의
Wanchao Liang 외 (Meta)
Megatron-LM 대안으로 PyTorch 네이티브 학습 프레임워크가 성립한 시점. FSDP2·torch.compile·FP8이 한 스택으로 묶임
Meta (Llama 3 팀)
대규모 학습 내결함성 문제를 처음으로 정량 공개한 1차 자료. 체크포인팅·자동 복구가 필수임을 산업 전체에 확정
Jay Shah 외 (Colfax·Together
커널이 특정 세대 실리콘에 맞춰 재작성되어야 함을 보인 사례. FP8 어텐션의 정확도 우려를 정량적으로 반박
Joonhyung Lee 외 (NAVER Cloud
FP8 학습 서사에 대한 정면 반박. 된다는 보고와 재현이 안 된다는 보고가 공존함을 문서화
Tri Dao (프린스턴)
긴 컨텍스트 학습의 실질적 비용을 반감. 32K~128K 컨텍스트 모델이 경제적으로 가능해진 전제
Paulius Micikevicius 외 (NVID
3사 공동 제안으로 FP8이 사실상 표준 형식이 됨. 형식 파편화를 막은 규격 합의
Reza Yazdani Aminabadi 외 (Mi
학습 인프라 팀이 추론까지 내려온 사건. vLLM 이전 세대의 대형 모델 서빙 표준
Paul Barham, Jeff Dean 외 (Go
PaLM 급 학습을 가능케 한 오케스트레이션 계층이자 JAX/TPU 스택의 실행 기반
Samyam Rajbhandari 외 (Micros
GPU 메모리 벽을 스토리지 계층까지 확장해 우회. 메모리가 아니라 대역폭이 제약이라는 프레이밍 확립
Chris Lattner 외 (Google)
XLA·TVM·Triton·Mojo가 공유하는 공통 기반. 가속기마다 컴파일러를 새로 짜던 관행을 끝냄
Dhiraj Kalamkar 외 (Intel)
FP16의 스케일링 부담을 없앤 형식. 이후 TPU·Ampere·Hopper 세대의 사실상 기본 학습 정밀도
JAX 개발팀
grad/jit/vmap 변환 조합과 XLA 컴파일로 TPU 대규모 학습의 표준 경로를 형성. 저장소는 구글 공식 제품이 아닌 연구 프로젝트로 명시
AI 인프라 소프트웨어공식 발표
Paulius Micikevicius 외 (NVID
혼합정밀 학습의 원형. FP16→BF16→FP8→FP4로 이어지는 정밀도 축소 계보 전체가 이 두 기법의 변주