추론 인프라·서빙NVIDIA
TensorRT-LLM 공개
TensorRT-LLM 공개
왜 중요한가
in-flight batching과 paged attention, FP8을 벤더 스택에 통합
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표developer.nvidia.comhttps://developer.nvidia.com/blog/optimizing-inference-on-llms-with-tensorrt-llm-now-publicly-available/2026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각10.17Self-RAG 발표논문