オーディオAIガイド

Moshi 全二重スピーチ

Moshi は、Kyutai が開発したオープンソースのリアルタイム音声 AI で、厳密に順番を変えるのではなく、話したり聞いたりを同時に (全二重) 行います。

2分の読書最終更新日

概要

これにより、従来の音声アシスタントに見られる不自然な遅延や堅苦しいターン操作がなくなります。

ディープダイブ

2024 年にフランスの研究機関 Kyutai によってリリースされた Moshi は、自然で低遅延の会話を実現するために構築された音声合成の基礎モデルです。音声からテキストへ、次に言語モデル、そしてテキストから音声へと連鎖するパイプライン アシスタントとは異なり、Moshi はオーディオを直接かつ継続的に処理します。その重要なアイデアは全二重です。ユーザーと自分自身の 2 つのオーディオ ストリームを同時にモデル化するので、話しながら聞き、割り込みを処理し、「うーん」と相槌を打ち、人間と同じように自然にオーバーラップすることができます。遅延は約 160 ~ 200 ミリ秒に達し、一般的なアシスタントの遅延をはるかに下回ります。内部では、7B パラメーターのテキストおよびオーディオ言語モデル (Helium) と、音声をモデルが生成できる個別のトークンに圧縮するニューラル オーディオ コーデックである Mimi を組み合わせています。九体は重みとコードをオープンに公開した。

技術的な洞察

Moshi のトリックは、Mimi コーデックで、連続オーディオを、蒸留されたセマンティック トークンを含む 12.5 Hz の離散トークンの低ビットレート ストリームに変換します。言語モデルは、独自の音声トークンとユーザーの並行した時間調整されたストリームを予測するため、「聞く」ために生成を停止する必要はありません。 「インナー・モノローグ」手法は音声の前にテキストを予測し、モシが実際に言うことの言語品質と一貫性を向上させます。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

Moshi 全二重スピーチの未来

全二重モデリングは自然音声 AI のテンプレートとなり、業界全体のシステムに影響を与えています。小型のオンデバイス バージョン、多言語サポート、待ち時間の短縮、エージェント、カスタマー サービス、アクセシビリティ ツールへの統合が期待されます。 Moshi はオープンであるため、研究者は自由に調査して改善することができます。事実の信頼性、重複する発話の安全性、感情的なニュアンスなどの点で課題が残っているが、厳密な順番交代から流動的で中断可能な会話への移行はおそらく永続的である。

現実世界の実装

ハンズフリーの音声コンパニオンにより、文章の途中で中断でき、200 ミリ秒以内に応答します。

独自のブラック ボックスを使用せずに、リアルタイムの全二重音声対話を研究するためのオープンな研究ベースライン。

アクセシビリティ アシスタントは、迅速かつ自然なやり取りを必要とするユーザーと流動的に会話します。

発信者が話している間にバックチャネルして反応する、中断可能な顧客サービス音声ボットのプロトタイプを作成します。

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

音声のテキスト正規化

よくある質問

モシ・フルデュプレックス・スピーチとは何ですか?

Moshi は、Kyutai が開発したオープンソースのリアルタイム音声 AI で、厳密に順番を変えるのではなく、話したり聞いたりを同時に (全二重) 行います。これにより、従来の音声アシスタントの厄介なラグや厳格な順番が取り除かれます。

Moshi の文脈において「全二重」とは何を意味しますか?

全二重とは、モデルが受信音声と送信音声を同時に処理することを意味するため、話しながら聞いたり、中断を自然に処理したりできます。

モシを解放した組織はどこですか?

Moshi は、2024 年にフランスの AI 研究機関である Kyutai によって開発され、オープンソース化されました。

MoshiシステムのMimiとは何ですか?

Mimi は、モデルが生成できる離散トークンの低ビットレート ストリームに連続音声を圧縮するニューラル オーディオ コーデックです。

Moshi は従来の音声アシスタント パイプラインとどう違うのですか?

従来のアシスタントは、音声からテキストへの変換、言語モデル、およびテキストから音声への変換を連鎖させます。 Moshi は、音声を継続的に処理する単一の音声合成モデルです。

Moshi はおよそどのくらいの会話遅延を目標としていますか?

Moshi は、一般的な音声アシスタントよりもはるかに低い 160 ~ 200 ミリ秒程度の遅延を実現し、自然なオーバーラップと中断を可能にします。