オーディオAIガイド

ニューラルボコーダー

ニューラル ボコーダーは、コンパクトな音響表現 (通常はメル スペクトログラム) を実際の可聴波形に変換するモデルです。

2分の読書最終更新日

概要

It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.

ディープダイブ

従来の音声合成では信号処理ボコーダーが使用されており、多くの場合、ブーンとした音やロボットのような音に聞こえました。ニューラル ボコーダーは、何時間もの実際の録音でトレーニングすることで、スペクトログラムから生のオーディオ サンプルを再構築する方法を学習します。 WaveNet (DeepMind、2016) は画期的で、1 秒あたり 16,000 以上のサンプルで一度に 1 サンプルずつ音声を予測し、驚くほど自然な音声を生成しますが、非常にゆっくりと生成されました。その後のモデルでは、その自己回帰のボトルネックを速度と引き換えにしました。WaveGlow はフローベースの生成を使用し、Parallel WaveGAN と MelGAN は敵対的生成ネットワークを使用し、HiFi-GAN はリアルタイムよりもはるかに高速に高忠実度の 22kHz オーディオを生成することで人気の標準になりました。現在、ボコーダーはほとんどの場合、2 ステージのパイプラインの後半であり、メル スペクトログラムを生成する Tacotron 2 や FastSpeech などの音響モデルと組み合わせられています。

技術的な洞察

メルスペクトログラムはオーディオの位相情報を破棄し、時間の経過とともに周波数帯域全体にエネルギーがどのように分布するかのみを保持します。ボコーダーの大変な仕事は、その入力に一致する振幅スペクトルを持つ、もっともらしいコヒーレントな波形を発明することです。 HiFi-GAN などの GAN ベースのボコーダーは、さまざまなスケールと周期で信号を検査する複数のディスクリミネーターを使用し、ジェネレーターを押し上げて、高調波や子音の鋭いトランジェントなどの現実的な細かいディテールを生成します。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

ニューラルボコーダーの未来

ボコーダーは小型化と高速化が進んでおり、クラウド接続なしでも電話や組み込みデバイス上で実行できるようになりました。また、再トレーニングすることなく、あらゆる話者、言語、歌声、さらには音声以外の音に一般化するユニバーサルボコーダーへの取り組みも進められています。並行傾向により、ボコーダーが直接エンドツーエンド システムとニューラル コーデックに組み込まれ、個別の音響ステージと波形ステージの間の境界線が曖昧になり、中間スペクトログラムを通過することによって導入されるアーティファクトが軽減されます。

現実世界の実装

スクリーン リーダーやナビゲーション アプリなどのテキスト読み上げアシスタントで最終的な音声を生成する

ダビングおよびオーディオブックのナレーション ツールで自然な響きのクローン音声を生成する

AI音楽とバーチャルボーカリストソフトで歌声を再構築

サーバーの往復を行わずに、スマート スピーカーおよびアクセシビリティ デバイスのデバイス音声出力の電源をオンにします。

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

HiFi-GAN および GAN​​ ボコーダー

よくある質問

What is Neural Vocoders?

ニューラル ボコーダーは、コンパクトな音響表現 (通常はメル スペクトログラム) を実際の可聴波形に変換するモデルです。これは、現代のテキスト読み上げ機能と人間の自然な音声を複製する音声を提供する最終段階です。

ニューラルボコーダーの主な仕事は何ですか?

ニューラル ボコーダーは、コンパクトな音響特徴 (通常はメル スペクトログラム) を取得し、実際に聞こえる生のオーディオ波形を合成します。

ニューラル ボコーダーを自然なサウンドにする画期的な 2016 年モデルはどれですか?

2016 年に DeepMind が開発した WaveNet は、オーディオ サンプルごとに生成し、驚くほど自然な音声を生成し、ニューラル ボコーダー時代の幕開けとなりました。

元の WaveNet ではオーディオの生成が遅かったのはなぜですか?

WaveNet は自己回帰的です。各オーディオ サンプルは前のオーディオ サンプルに依存するため、1 秒あたり数万のサンプルを生成するには計算コストがかかりました。

メルスペクトログラムが特に破棄してボコーダーのタスクを困難にする情報は何ですか?

メル スペクトログラムは振幅 (周波数帯域ごとのエネルギー) を維持しますが、位相を落とすため、ボコーダーは位相が妥当なコヒーレント波形を再構築する必要があります。

HiFi-GAN のような GAN ベースのボコーダーはどのようにリアリズムを向上させますか?

HiFi-GAN は、さまざまな時間スケールと周期性を検査する複数の弁別器を使用し、ジェネレーターを押して現実的な高調波と過渡現象を生成します。