멀티모달Alexandre Défossez 외 (Kyutai)
Moshi 발표
Moshi 발표 — VAD·ASR·TTS 파이프라인을 없앤 전이중 음성-음성 모델. 이론 지연 160ms, 실측 200ms. 오디오 토큰 전에 시간정렬 텍스트 토큰을 생성하는 Inner Monologue
왜 중요한가
파이프라인형 음성 대화를 단일 모델로 대체한 계보
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2410.000372026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.19Contextual Retrieval공식 발표09.18To CoT or not to CoT? 발표논문09.18voyage-3 공개공식 발표09.16소버린 AI를 그 나라의 문화를 더 잘 이해하는 AI로 규정하고, 이것이 네이버 어젠다가 아니라 정부 어젠다…보도