한국어EN
축 ⑲

온디바이스·로컬 추론

기록 24 · 정리 노트 2 · 관련 축으로 붙은 사건도 함께 보여요.


HUMAIN·Qualcomm
사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면

정리 노트
2026년형 Mac mini는 로컬 LLM 구동을 겨냥한 에지 노드로 재편됐고, 기본가가 599달러에서 899달러로 오른 배경에는 TSMC 2나노 웨이퍼 비용이 66% 급등해 장당 3만 달러에 이른 파운드리 경제가 있다. 핵심 프레임은 두 단계의 분리

정리 노트
샤오미 AI 큐브의 1.22TB/s 근접 메모리 대역폭은 첨단 공정이 아니라 6나노 구식 노드 칩 X-Ring O100의 웨이퍼-온-웨이퍼 하이브리드 본딩에서 나왔다. 구리 패드를 직접 융합하는 1.4마이크로미터 피치로 258만 개 본딩 포인트와 28

Ollama
로컬 추론 배포 계층이 독립 상업 인프라로 자립

Apple
온디바이스 AI 프레임워크가 폐쇄형 단일 모델에서 하이브리드·멀티 프로바이더 플랫폼으로 전환

Ollama
로컬 배포 스택이 llama.cpp 단일 의존에서 MLX 우선 + GGUF 호환 구조로 재편

llama.cpp 커뮤니티
하드웨어 네이티브 FP4가 커뮤니티 양자화를 아직 이기지 못했다는 실측. 포맷 경쟁 미결

Google (AI Edge)
온디바이스 런타임이 모바일 OS를 넘어 브라우저까지 같은 스택으로 덮는 단계. 수치는 벤더 자체 측정

Google (Chrome)
온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다

Microsoft
클라우드 종속·토큰 과금 없는 로컬 추론을 공식 제품 라인으로 확정

Google (Android)
안드로이드 온디바이스 AI가 시스템 서비스(AICore)로 오픈 모델을 직접 배포하는 체계로 진화

llama.cpp (ggml-org)
GGUF가 자체 K-quant를 넘어 하드웨어 네이티브 FP4 포맷을 흡수

Uygar Kurt
어떤 양자화를 쓸 것인가를 체감이 아니라 측정으로 옮긴 첫 통합 레퍼런스

Liquid AI
7월 릴리스의 후속 문서. 온디바이스 계열이 기술보고서 수준의 공개 문서를 갖춘 사례다

Apple
소비자용 실리콘 세대 교체를 로컬 LLM 추론 성능으로 직접 내세우기 시작한 자료

llama.cpp 커뮤니티
GGUF가 벤더 FP4 규격을 순차 흡수하는 경로가 정해진 지점

Ollama
로컬 배포 도구가 하이브리드 실행으로 확장. 로컬 실행의 정의가 흐려지기 시작한 지점

Arm
온디바이스 추론의 병목을 전용 NPU가 아니라 CPU 확장명령(SME2)으로 푸는 노선. 프레임워크 통합을 함께 발표해 실리콘이 아니라 소프트웨어 경로로 배포된다. 수치는 벤더 자체 주장

Liquid AI
온디바이스를 사후 양자화의 결과가 아니라 설계 목표로 두고 하드웨어-인-더-루프로 아키텍처를 탐색한 상용 계열. 수치는 벤더 자체 측정이며 독립 검증이 아니다

Google
온디바이스급 소형 모델이 멀티모달과 벤치마크 경쟁력을 동시에 갖추기 시작한 이정표

Apple
OS 수준 온디바이스 LLM 통합의 첫 대규모 사례

Microsoft Research
폰에 배포 가능한 소형 모델 노선을 데이터 큐레이션으로 정당화

ggml 프로젝트
로컬 LLM 배포의 사실상 표준 포맷

Georgi Gerganov
전용 하드웨어 없는 사용자층에서 확산. CPU만으로 실행 가능했던 점이 결정적

Elias Frantar 외 (IST Austria
양자화를 사후 처리로 표준화

Tim Dettmers 외
소비자용 GPU 서버에서 대형 모델 실행을 가능하게 함