HiFi-GAN および GAN ボコーダー
HiFi-GAN は、メル スペクトログラムをほぼ瞬時に生のオーディオ波形に変換し、リアルタイムよりもはるかに速くスタジオ品質の音声を生成する敵対的生成ボコーダーです。
概要
It became the standard final stage of modern text-to-speech because it is fast, lightweight, and hard to distinguish from real recordings.
ディープダイブ
ボコーダーはほとんどの TTS パイプラインの最後のステップです。Tacotron や FastSpeech のようなモデルはメル スペクトログラム (時間の経過に伴う周波数のコンパクトな画像) を予測し、ボコーダーは実際の波形サンプルを埋めます。 WaveNet のような初期のニューラル ボコーダーはサウンドは素晴らしかったですが、オーディオはサンプルごとに生成されるため、非常に遅かったです。 Kong、Kim、Bae によって 2020 年にリリースされた HiFi-GAN は、その自己回帰ループを敵対的にトレーニングされた単一のフィードフォワード ジェネレーターに置き換えました。その重要なトリックは、さまざまなスケールとさまざまな周期パターンでオーディオを判断する複数のディスクリミネーターを使用し、ジェネレーターに細かいテクスチャーとピッチ周期性の両方を正しく取得させることです。その結果、GPU でのリアルタイムよりも数百倍高速に 22 kHz の音声が合成され、グラウンドトゥルース オーディオに匹敵する品質が得られます。
技術的な洞察
HiFi-GAN のジェネレーターは、さまざまなカーネル サイズと拡張を混合してさまざまな波形パターンをキャプチャするスタックされた Multi-Receptive Field ブロックを使用して、転置畳み込みを通じてメル スペクトログラムをアップサンプリングします。 2 つのディスクリミネーター ファミリがポリシングを行います。マルチピリオド ディスクリミネーターは 1D 信号を 2、3、5、7、11 などの素数で 2D グリッドに再形成してピッチ周期性を捕捉し、マルチスケール ディスクリミネーターはいくつかのダウンサンプリングされた解像度で波形を検査します。メル スペクトログラムと特徴マッチングの損失により、トレーニングの安定性が維持されます。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
HiFi-GAN と GAN ボコーダーの将来
GAN ボコーダーは小型化と高速化を続けています。BigVGAN のような子孫はアンチエイリアス アクティベーションを追加して、目に見えない歌手、楽器、言語全体に汎用化する一方、UnivNet と Vocos はユニバーサルなオールバンド合成を目指しています。ストリーミングおよびオンデバイスのバリアントは、低遅延アシスタントのために電話やイヤホン内でボコーディングを実行するようになりました。拡散およびフローマッチングのオーディオ モデルは、GAN スタイルのシングルパス ジェネレーターに蒸留され、拡散の忠実性と GAN の速度が融合することが増えています。ボコーダーは、音声と音楽の両方を強化する汎用ニューラル オーディオ コーデックにフェードインすると予想されます。
現実世界の実装
応答を必要とする仮想アシスタントやナビゲーション アプリの音声出力を、聴覚的な遅延なく生成します。
リアルタイムの音声クローン作成およびダビング ツールを強化し、クローン化されたメル スペクトログラムを自然な音声にレンダリングします。
数時間分の音声を迅速かつ安価に合成するオーディオブックやポッドキャストのナレーション プラットフォームを推進します。
BigVGAN スタイルのユニバーサル ボコーダーを介して、歌声シンセサイザーや音楽デモ内の波形ステージとして機能します。
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the HiFi-GAN and GAN Vocoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
パラレル WaveGAN ボコーダー
よくある質問
What is HiFi-GAN and GAN Vocoders?
HiFi-GAN は、メル スペクトログラムをほぼ瞬時に生のオーディオ波形に変換し、リアルタイムよりもはるかに速くスタジオ品質の音声を生成する敵対的生成ボコーダーです。高速かつ軽量で、実際の録音と区別しにくいため、現代のテキスト読み上げの標準的な最終段階となりました。
テキスト読み上げパイプラインにおける HiFi-GAN のようなボコーダーの主な仕事は何ですか?
ボコーダーは、音響モデルによって生成されたメル スペクトログラムから実際の波形サンプルを合成する最終段階です。
HiFi-GAN が以前の WaveNet ボコーダーよりもはるかに高速なのはなぜですか?
WaveNet はオーディオをサンプルごとに (自己回帰的に) 生成しますが、HiFi-GAN のフィードフォワード ジェネレーターは波形をワンショットで出力し、リアルタイムよりもはるかに速い速度を実現します。
HiFi-GAN の Multi-Period Discriminator は具体的に何をキャプチャするのに役立ちますか?
Multi-Period Discriminator は、素数の周期を使用して 1D 波形を 2D に再形成し、ピッチに関連付けられた周期構造を検出します。
GAN ボコーダーは「敵対的に」トレーニングされます。ここでそれは何を意味しますか?
GAN セットアップでは、ジェネレーターは、本物の音声と合成音声を区別するように訓練された弁別ネットワークを騙すのに十分なほど現実的な波形を生成することを学習します。
HiFi-GAN を拡張して、目に見えない声、歌、楽器をよりよく一般化できるのは、後発のボコーダーのうちどれですか?
BigVGAN は HiFi-GAN をスケールアップし、アンチエイリアス処理された定期的なアクティベーションを追加し、歌や楽器などの配信外のオーディオへの汎用性を向上させます。