한국어EN
멀티모달Alexandre Défossez 외 (Kyutai)

Moshi 발표

Moshi 발표 — VAD·ASR·TTS 파이프라인을 없앤 전이중 음성-음성 모델. 이론 지연 160ms, 실측 200ms. 오디오 토큰 전에 시간정렬 텍스트 토큰을 생성하는 Inner Monologue

왜 중요한가

파이프라인형 음성 대화를 단일 모델로 대체한 계보

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2410.000372026년 8월 24일에 더한 조각 · 그 주 보기