オーディオAIガイド

VALL-E およびコーデック言語モデル

VALL-E は、テキスト読み上げをオーディオ コーデック トークン上の言語モデリングの問題として再構成し、わずか 3 秒のサンプルからの音声クローン作成を可能にしました。

2分の読書最終更新日

概要

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

ディープダイブ

2023 年初頭に Microsoft によって発表された VALL-E は、音声合成を言語モデリングのように扱います。スペクトログラムを予測する代わりに、ニューラル コーデック (EnCodec) の離散音響トークンを予測するため、生成は音声語彙に対する次のトークンの予測になります。目に見えない話者とターゲット テキストを 3 秒間録音すると、VALL-E はその話者の声を継続し、音色や音響環境さえも保存します。これは、一般的な TTS データセットよりもはるかに多い約 60,000 時間の音声でトレーニングされたため、強力なゼロショット クローン作成が可能になりました。コーデック トークンは (RVQ 経由で) 階層化されているため、VALL-E は 2 つの段階を使用します。自己回帰モデルはプロンプトに基づいて条件付けされた最初の粗いトークン ストリームを予測し、非自己回帰モデルは残りの詳細トークンを埋めます。このコーデック LM レシピは、VALL-E 2 や多くの音声基盤モデルなどの後継モデルに影響を与えました。

技術的な洞察

秘訣は、階層コーデック トークンを介したハイブリッド デコードです。自己回帰ステージでは、最も重要な最初のコードブック トークンを一度に 1 つずつ予測し、韻律とコンテンツをキャプチャします。細かい音響ディテールを追加する残りのコードブックは、最初のストリームとスピーカー プロンプトに基づいて条件付けされた非自己回帰モデルによって並行して予測されます。この分割により、すべてのトークンを順番に生成するコストを回避しながら高品質が維持され、コーデックを使用することで音声とテキストを同じ変換機構でモデル化できるようになります。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

VALL-E とコーデック言語モデルの将来

コーデック言語モデルは音声を大規模な言語モデルと統合し、1 つのモデルで聞き、推論し、話す統一システムを目指しています。安定性の向上とアーティファクトの減少、リアルタイムのストリーミング生成、感情とスタイルのより厳密な制御が期待できます。 VALL-E をアクセシビリティや吹き替えに役立つ強力なクローン作成と同じように、ディープフェイクや同意に関する懸念も引き起こしているため、透かし入れ、音声検証の保護手段、ポリシー ガードレールがこれらのシステムの導入方法の中心部分になりつつあります。

現実世界の実装

パーソナライズされたアシスタントや失われた音声を復元するアクセシビリティ ツールのために、数秒間の音声から音声のクローンを作成します。

元の話者の音色を維持しながら、ビデオをローカライズして他の言語に吹き替える

録音の音響環境を維持しながら、表現力豊かで文脈にマッチしたナレーションを生成する

音声を理解して生成するマルチモーダル アシスタントの音声バックボーンとして機能します。

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

大規模言語モデルの創発的な能力

よくある質問

What is VALL-E and Codec Language Models?

VALL-E は、テキスト読み上げをオーディオ コーデック トークン上の言語モデリングの問題として再構成し、わずか 3 秒のサンプルからの音声クローン作成を可能にしました。これは、同じネクストトークン予測を利用したテキスト LLM が、非常に自然で表現力豊かな音声を生成できることを示しました。

VALL-E を以前のテキスト読み上げシステムと区別する中心的なアイデアは何ですか?

VALL-E は、TTS を個別のオーディオ コーデック トークンに対する次のトークン予測として再構成し、音声生成を言語モデルのように扱います。

VALL-E が新しい話者の声を複製するには、どれくらいのリファレンス オーディオが必要ですか?

VALL-E は、目に見えない話者の約 3 秒のサンプルからゼロショット音声のクローン作成を実行できます。

VALL-E はオーディオ トークンの生成にどのニューラル コーデックを使用しますか?

VALL-E は Meta の EnCodec に基づいて構築されており、その離散音響トークンを予測して音声を合成します。

VALL-E が自己回帰ステージと非自己回帰ステージの両方を使用するのはなぜですか?

コーデック トークンは RVQ によって階層化されます。 VALL-E は、効率を高めるために、最初の粗いストリームを自己回帰的に予測し、残りの詳細トークンを並行して予測します。

強力なゼロショット クローン作成を可能にするために、VALL-E はおよそどのくらいの音声データに基づいてトレーニングされましたか?

VALL-E は、一般的な TTS データセットよりもはるかに多い約 60,000 時間の音声でトレーニングされたため、ゼロショットの一般化が促進されました。