한국어EN
축 ⑱

AI 인프라 소프트웨어

기록 53 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.


Guowei Wang 외
별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.

Anthropic
데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다

Zihan Qiu 외 (Alibaba Qwen)
프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.

Modular
2023년 발표 이후 3년 만의 언어 안정화 및 완전 개방. CUDA C++ 대안 언어가 처음으로 프로덕션 계약을 제시

Qualcomm / Modular
CUDA 대안 스택이 독립 스타트업에서 대형 실리콘 벤더 자산으로 편입된 사건

AMD
ROCm이 1년 만에 격차를 한 자릿수 퍼센트로 좁혔음을 표준 벤치마크로 보인 자료. CUDA 독점의 실질적 균열

PyTorch 재단
수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호

vLLM 프로젝트
텍스트 전용이던 오픈소스 서빙 인프라가 비자기회귀·멀티모달 생성까지 포괄하는 확장 신호

NVIDIA
통신-연산 융합을 커널 수준에서 지원해 대규모 분산 학습·추론의 통신 병목 해소 방식을 바꾼 릴리스

PyTorch (Meta)
2022년 Google Pathways가 제시한 단일 컨트롤러 모델이 PyTorch 코어 계보로 들어온 지점. TorchTitan 은 Monarch 안의 액터가 되고 torchforge 는 Monarch 위에 세워진다

PyTorch (Meta)
Triton이 CUDA를 한 단계 추상화했듯 Helion은 Triton을 한 단계 더 추상화한다. 커널 작성 계보의 다음 층

PyTorch 재단
멀티 GPU 커널을 프레임워크 API 수준에서 직접 쓰게 하는 방향. NCCL 계열 집합통신 위에 사용자 커널 경로가 하나 더 생겼다

NVIDIA (Felix Abecassis 외)
FP4 학습이 실제로 되는가에 대한 가장 강한 긍정 증거. 단 벤더 자체 보고이며 독립 재현은 확인되지 않음

PyTorch 재단
C++ 확장 ABI 안정화와 컴파일 가능한 제어 흐름으로 컴파일러 중심 스택 이행을 보여주는 릴리스

PyTorch (Tristan Rice, Howar
체크포인트 기반 복구 패러다임을 대체하는 시도. 스텝을 분산 트랜잭션으로 취급

AMD
ROCm 성숙도를 표준 벤치마크로 검증 가능하게 만든 첫 1차 자료. CUDA 대안 논의가 주장에서 측정으로 이동

Tanishq Kumar 외 (하버드)
FP8/FP4가 되는가를 스케일링 법칙 수준에서 답한 검증 연구. 정밀도를 공짜 최적화가 아니라 용량 교환으로 재정의

Wanchao Liang 외 (Meta)
Megatron-LM 대안으로 PyTorch 네이티브 학습 프레임워크가 성립한 시점. FSDP2·torch.compile·FP8이 한 스택으로 묶임

Meta (Llama 3 팀)
대규모 학습 내결함성 문제를 처음으로 정량 공개한 1차 자료. 체크포인팅·자동 복구가 필수임을 산업 전체에 확정

Jay Shah 외 (Colfax·Together
커널이 특정 세대 실리콘에 맞춰 재작성되어야 함을 보인 사례. FP8 어텐션의 정확도 우려를 정량적으로 반박

Joonhyung Lee 외 (NAVER Cloud
FP8 학습 서사에 대한 정면 반박. 된다는 보고와 재현이 안 된다는 보고가 공존함을 문서화

Houwen Peng 외 (Microsoft)
FP8 학습이 대형 모델에서 실제로 성립함을 보인 초기 실증

Modular
Python 문법을 유지하면서 시스템 수준 성능을 노린 CUDA 대안 시도. 컴파일러 경쟁이 언어 계층까지 확장

Tri Dao (프린스턴)
긴 컨텍스트 학습의 실질적 비용을 반감. 32K~128K 컨텍스트 모델이 경제적으로 가능해진 전제

Guanhua Wang 외 (Microsoft)
저대역폭 클러스터에서도 ZeRO가 성립하게 만든 개선

Yanli Zhao 외 (Meta)
DeepSpeed 없이도 표준 프레임워크로 대형 학습이 가능해진 분기점

PyTorch Foundation
컴파일 기반 최적화가 프레임워크 기본값으로 편입

Paulius Micikevicius 외 (NVID
3사 공동 제안으로 FP8이 사실상 표준 형식이 됨. 형식 파편화를 막은 규격 합의

Reza Yazdani Aminabadi 외 (Mi
학습 인프라 팀이 추론까지 내려온 사건. vLLM 이전 세대의 대형 모델 서빙 표준

Tri Dao, Daniel Y. Fu 외 (스탠퍼
롱컨텍스트 경로의 실질적 개통

Paul Barham, Jeff Dean 외 (Go
PaLM 급 학습을 가능케 한 오케스트레이션 계층이자 JAX/TPU 스택의 실행 기반

NVIDIA
FP8 학습을 하드웨어 지원 기능으로 만든 전환점. 소프트웨어와 실리콘이 한 몸으로 묶인 첫 사례

Lianmin Zheng 외 (UC 버클리)
병렬화 전략 탐색을 자동화. 수작업 3D 병렬 튜닝을 컴파일 문제로 재정의

PyTorch (Meta)
FSDP1의 재설계. FP8 학습·부분 동결·컴파일러 최적화가 가능해진 전제

OpenAI
커널 작성을 소수 전문가에서 일반 연구자로 개방

Samyam Rajbhandari 외 (Micros
GPU 메모리 벽을 스토리지 계층까지 확장해 우회. 메모리가 아니라 대역폭이 제약이라는 프레이밍 확립

Jie Ren 외 (Microsoft·UC 머시드)
대형 모델 학습의 하드웨어 진입 장벽을 낮춘 계보의 시작

Chris Lattner 외 (Google)
XLA·TVM·Triton·Mojo가 공유하는 공통 기반. 가속기마다 컴파일러를 새로 짜던 관행을 끝냄

Microsoft Research
모델 병렬화 코드 재작성 없이 초대형 학습을 가능케 한 계층

Adam Paszke, Sam Gross, Soum
정적 그래프 프레임워크 중심의 연구 관행을 뒤집음

Samyam Rajbhandari 외 (Micros
100B급 학습의 메모리 장벽을 제거

Mohammad Shoeybi 외 (NVIDIA)
대규모 모델 병렬화의 표준 구현

Dhiraj Kalamkar 외 (Intel)
FP16의 스케일링 부담을 없앤 형식. 이후 TPU·Ampere·Hopper 세대의 사실상 기본 학습 정밀도

NVIDIA
노드 내부를 하나의 큰 GPU로 만든 계층. 텐서 병렬화가 실용적이 된 물리적 전제

Alexander Sergeev 외 (Uber)
분산 학습을 연구 인프라에서 일반 도구로 내린 전환점

Tianqi Chen 외 (워싱턴대)
벤더 커널 라이브러리 독점에 대한 첫 실질적 컴파일러 대안. 자동 스케줄링 개념을 업계에 이식

JAX 개발팀
grad/jit/vmap 변환 조합과 XLA 컴파일로 TPU 대규모 학습의 표준 경로를 형성. 저장소는 구글 공식 제품이 아닌 연구 프로젝트로 명시

NVIDIA
커널을 조립 가능한 부품으로 분해. FlashAttention·Transformer Engine·현대 어텐션 커널 다수가 이 위에 구현됨

Paulius Micikevicius 외 (NVID
혼합정밀 학습의 원형. FP16→BF16→FP8→FP4로 이어지는 정밀도 축소 계보 전체가 이 두 기법의 변주

Google (TensorFlow)
ML 컴파일러 경쟁의 출발점. TPU를 실용화한 계층이자 JAX 전체의 기반

NVIDIA
all-reduce를 하드웨어 토폴로지에 맞춰 최적화한 표준 계층. 모든 데이터 병렬·ZeRO·FSDP 학습이 이 위에서 돈다

Sharan Chetlur 외 (NVIDIA)
프레임워크가 커널을 직접 짜지 않아도 되게 만든 첫 계층

NVIDIA
GPU 범용 연산의 진입장벽을 낮춰 이후 딥러닝 전체가 올라탄 소프트웨어 기반