Mimi 串流音訊編解碼器
Mimi 是一種神經音訊編解碼器,可即時將語音壓縮為微小的離散標記流,因此 AI 模型可以以非常低的延遲進行聆聽和說話。
概述
It is the audio backbone behind Kyutai's Moshi voice model.
深入探討
Mimi 是法國實驗室 Kyutai 於 2024 年發布的神經編解碼器,可將 24 kHz 音訊轉換為離散令牌流,速度約為 1.1 kbps,每秒僅處理 12.5 個令牌。它使用帶有殘差向量量化 (RVQ) 的編碼器-解碼器,將標記拆分為從自監督語音模型 (WavLM) 中提取的“語義”第一級以及多個捕獲語音紋理的“聲學”級別。至關重要的是,它是完全串流和因果關係的:它在音訊到達時發出令牌,而不是等待完整的剪輯,大約有 80 毫秒的延遲。這使得語言模型可以將語音視為文字標記,從而使 Moshi 能夠以全雙工方式進行對話,同時保持重建的音訊清晰和自然。
技術洞察
Mimi 的技巧是 split-RVQ 方案。第一個碼本經過蒸餾損失訓練,以匹配 WavLM 的嵌入,迫使其攜帶語音“含義”,而並行聲學碼本則重建波形細節。 Transformer 在瓶頸內運行,解碼器上的對抗性 (GAN) 損失可提高輸出品質。因果卷積使所有內容保持串流傳輸,因此延遲保持在 80 毫秒左右。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
Mimi 串流音訊編解碼器的未來
預計 Mimi 等編解碼器將成為音訊和大型語言模型之間的標準接口,將即時語音助理的回應時間推向 100 毫秒以下。研究正在推動代幣率進一步降低,同時保留說話者的身份、情感和音樂。由於 Kyutai 開源了 Mimi 和 Moshi,因此很可能催生許多開放式語音轉語音系統、裝置上助理和超低頻寬語音通訊工具。
現實世界的實施
為 Kyutai 的 Moshi 全雙工語音助理提供支持,使其可以同時聽和說
將語音標記串流傳輸到語言模型中以進行即時語音到語音翻譯
在網路條件較差或壅塞的情況下進行超低位元率語音通話 (~1.1 kbps)
為產生語音和文字到語音管道對音訊進行標記,以像文字一樣對聲音進行推理
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Mimi Streaming Audio Codec?
Mimi 是一種神經音訊編解碼器,可即時將語音壓縮為微小的離散標記流,因此 AI 模型可以以非常低的延遲進行聆聽和說話。它是 Kyutai 的 Moshi 語音模型背後的音訊支柱。
哪個實驗室發表了 Mimi 和 Moshi 語音模型?
Mimi 和 Moshi 由法國研究實驗室 Kyutai 於 2024 年發布,並將兩者開源。
Mimi 每秒大約發出多少個代幣用於語音?
Mimi 將 24 kHz 音訊壓縮至每秒約 12.5 個令牌,速率約 1.1 kbps。
Mimi 中的第一個(「語意」)密碼本捕獲了什麼?
第一個 RVQ 等級透過 WavLM 的蒸餾進行訓練,以承載語意/語音內容,而後續等級則添加聲學細節。
為什麼咪咪被描述為“串流媒體”或“因果”?
Mimi 因果地處理音訊並增量輸出令牌,提供適合即時對話的約 80 毫秒延遲。
Mimi 使用哪種量化技術來編碼音訊?
Mimi 使用殘差向量量化,堆疊多個碼本,因此每個碼本都為前一個碼本添加了更精細的細節。