Mimi ストリーミング オーディオ コーデック
Mimi は、音声をリアルタイムで離散トークンの小さなストリームに圧縮するニューラル オーディオ コーデックであり、AI モデルは非常に低い遅延で聞き、話すことができます。
概要
It is the audio backbone behind Kyutai's Moshi voice model.
ディープダイブ
2024年にフランスの研究所KyutaiによってリリースされたMimiは、24 kHzのオーディオを約1.1 kbps、1秒あたりわずか12.5トークンの離散トークンのストリームに変換するニューラルコーデックです。これは、残差ベクトル量子化 (RVQ) を備えたエンコーダー/デコーダーを使用し、トークンを自己教師あり音声モデル (WavLM) から抽出された「セマンティック」の最初のレベルと、音声テクスチャをキャプチャするいくつかの「音響」レベルに分割します。重要なのは、完全なストリーミングであり、因果関係があることです。約 80 ミリ秒の遅延で、完全なクリップを待つのではなく、オーディオが到着するとトークンを発行します。これにより、言語モデルは音声をテキスト トークンのように扱うことができ、Moshi が再構築された音声をわかりやすく自然に保ちながら全二重で会話できるようになります。
技術的な洞察
ミミのトリックはスプリット RVQ スキームです。最初のコードブックは、WavLM からの埋め込みと一致するように蒸留損失を使用してトレーニングされ、音声的な「意味」を強制的に伝える一方、並列音響コードブックは波形の詳細を再構築します。 Transformer はボトルネック内で動作し、デコーダーでの敵対的 (GAN) 損失により出力品質が向上します。因果的畳み込みによりすべてがストリーミングされ続けるため、レイテンシーは 80 ミリ秒近くに留まります。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
Mimi ストリーミング オーディオ コーデックの将来
Mimi のようなコーデックがオーディオと大規模な言語モデルの間の標準インターフェイスとなり、リアルタイム音声アシスタントの応答時間が 100 ミリ秒未満になることが期待されます。研究により、話者のアイデンティティ、感情、音楽を維持しながら、トークンレートがさらに低くなりました。 Kyyutai は Mimi と Moshi をオープンソース化しているため、多くのオープン音声合成システム、オンデバイス アシスタント、および超低帯域幅の音声コミュニケーション ツールが誕生する可能性があります。
現実世界の実装
聞きながら同時に話せるように、Kyutai の Moshi 全二重音声アシスタントを強化
音声トークンを言語モデルにストリーミングしてリアルタイムの音声認識翻訳を行う
ネットワーク状態が劣悪または混雑している場合の超低ビットレート音声通話 (~1.1 kbps)
音声を生成する音声のトークン化と、テキストのような音声を推論するテキスト読み上げパイプライン
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ニューラルオーディオコーデック
よくある質問
What is Mimi Streaming Audio Codec?
Mimi は、音声をリアルタイムで離散トークンの小さなストリームに圧縮するニューラル オーディオ コーデックであり、AI モデルは非常に低い遅延で聞き、話すことができます。これは、Kyutai の Moshi 音声モデルの背後にあるオーディオ バックボーンです。
Mimi と Moshi の音声モデルをリリースしたのはどこのラボですか?
Mimi と Moshi は、両方をオープンソース化したフランスの研究機関 Kyutai によって 2024 年にリリースされました。
ミミはスピーチのために毎秒およそ何個のトークンを放出しますか?
Mimi は、24 kHz オーディオを約 1.1 kbps で 1 秒あたりわずか約 12.5 トークンまで圧縮します。
Mimi の最初の (「セマンティック」) コードブックは何をキャプチャしますか?
最初の RVQ レベルは、WavLM からの蒸留を介して意味論的/音声論的なコンテンツを伝えるようにトレーニングされ、その後のレベルでは音響の詳細が追加されます。
なぜミミは「ストリーミング」または「因果関係」と表現されているのでしょうか?
Mimi は音声を因果的に処理し、トークンを段階的に出力するため、ライブ会話に適した約 80 ミリ秒の遅延が得られます。
Mimi はオーディオのエンコードにどの量子化技術を使用しますか?
Mimi は残差ベクトル量子化を使用し、複数のコードブックを積み重ねて、それぞれが前のコードブックにさらに細かい詳細を追加します。