オーディオAIガイド

ウェーブネット

DeepMind が 2016 年に導入した WaveNet は、生のオーディオを一度に 1 サンプルずつ生成し、驚くほど自然な音声と音楽を生成する画期的なニューラル ネットワークです。

2分の読書最終更新日

概要

It set the modern standard for high-fidelity text-to-speech.

ディープダイブ

WaveNet は自己回帰生成モデルです。通常、1 秒あたり 16,000 または 24,000 サンプルで、その前のすべてのサンプルに基づいて条件付けされた各オーディオ サンプルを予測します。その核となるイノベーションは、拡張された因果畳み込みのスタックです。因果的とは、モデルが生成順序を維持しながら時間的にのみ遡ることを意味します。拡張とは、各層が指数関数的に増加するサンプルをスキップすることを意味するため、控えめなスタックで莫大なコストをかけずに数千のサンプル (広い受容野) をカバーできます。 WaveNet は、言語特徴またはメル スペクトログラムに基づいて、それ以前の連結ボコーダーやパラメトリック ボコーダーよりもはるかに自然な音声を生成し、人間の録音とのギャップを大幅に縮め、Google Assistant の初期バージョンを強化します。

技術的な洞察

拡張畳み込みが重要なトリックです。1、2、4、8 などの拡張率を使用すると、わずか数十層の深さのネットワークで何千もの過去のサンプルに対応し、波形の詳細と長い韻律構造の両方をキャプチャできます。出力は、各サンプルの値をカテゴリ分布としてモデル化し (元々はμ法則圧伸による 256 レベル)、ゲート アクティベーション ユニットと残差およびスキップ接続により、この非常に深いスタックのトレーニングが安定します。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

WaveNet の未来

オリジナルの WaveNet は、サンプリングが順次行われるため低速でした。後継者はこの問題を修正しました。Parallel WaveNet と WaveRNN によりリアルタイム合成が可能になり、その後、WaveGlow や HiFi-GAN などのフローベースおよび GAN​​ ベースのボコーダーと拡散ボコーダーによって、品質と速度がさらに向上しました。 WaveNet の自己回帰、拡張畳み込みのアイデアはこれらのシステムに生き続けており、オーディオを超えたアーキテクチャに影響を与え、生成モデリングにおけるその伝統を確固たるものとしています。

現実世界の実装

Google アシスタントおよび Google Cloud Text-to-Speech 用の自然な音声の生成

Tacotron 2 のような TTS パイプラインでメル スペクトログラムを波形に変換するニューラル ボコーダーとして機能します。

生のオーディオからリアルなピアノとインストゥルメンタル音楽を合成

アクセシビリティツールとオーディオブックのナレーションのための音声合成

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

音声ディープフェイク検出

よくある質問

What is WaveNet?

DeepMind が 2016 年に導入した WaveNet は、生のオーディオを一度に 1 サンプルずつ生成し、驚くほど自然な音声と音楽を生成する画期的なニューラル ネットワークです。これは、高忠実度のテキスト読み上げの現代の標準を設定します。

WaveNet はどのようにしてオーディオを生成しますか?

WaveNet は自己回帰的です。つまり、各オーディオ サンプルをその前のサンプルに基づいて予測します。

WaveNet における重要な畳み込みイノベーションは何ですか?

拡張因果畳み込みにより、ネットワークは時間を遡るだけで、何千もの過去のサンプルを効率的にカバーできるようになります。

拡張が WaveNet に役立つのはなぜですか?

膨張率を指数関数的に増加させると、比較的少ない層で数千のサンプルにわたって広い受容野が得られます。

オリジナルの WaveNet の実質的な大きな欠点は何でしたか?

各サンプルは前のサンプルに依存するため、生成は順次に行われ、したがって時間がかかり、これが Parallel WaveNet やその他の後継製品の動機となっていました。

テキスト読み上げパイプラインにおいて、WaveNet は多くの場合何として機能しますか?

WaveNet は、メル スペクトログラム (Tacotron 2 などから) を取得して、最終的な自然なサウンドの波形を生成できます。