オーディオAIガイド

SoundStream ニューラル コーデック

SoundStream は、品質を維持しながら音声と音楽を非常に低いビットレートに圧縮する Google のエンドツーエンドのニューラル オーディオ コーデックです。

2分の読書最終更新日

概要

これは、同じビットレートでOpusのような従来のコーデックを上回り、現代の生成オーディオモデルを動かしている点で重要です。

ディープダイブ

2021 年に Google によって導入された SoundStream は、一緒にトレーニングされた 3 つの部分から構築された完全なニューラル コーデックです。生の波形をコンパクトなベクトルのシーケンスに変換する畳み込みエンコーダー、それらのベクトルを離散化する残差ベクトル量子化器 (RVQ)、および波形を再構築する畳み込みデコーダーです。再構成損失と GAN スタイルの敵対的識別器の両方を使用してトレーニングされているため、出力は数値的に近いというよりはむしろ自然に聞こえます。際立った機能は、「スケーラブル」または量子化器ドロップアウト トレーニングです。再トレーニングを行わずに、推論時に使用する量子化層の数を増減するだけで、単一のモデルがおよそ 3 ~ 18 kbps のビットレートで動作できます。伝えられるところによると、スマートフォンの CPU でリアルタイムに実行できる 1 つのモデルで音声、音楽、および一般オーディオを処理するリスニング テストでは、3 kbps で Opus の 12 kbps よりも優れたパフォーマンスを発揮します。

技術的な洞察

波形は、大量のダウンサンプリングを行うストライド畳み込みを通過し、フレームごとに 1 つのエンベディング (例: 75 フレーム/秒) を生成します。 RVQ は、各エンベディングをコードブック インデックスのスタックとしてエンコードします。ビットレートは、フレーム レートとアクティブな量子化器の数とコードブックあたりのビットを掛けたものと等しくなります。量子化器のドロップアウトにより、トレーニング中に RVQ スタックがランダムに切り捨てられ、以前のコードブックに最も重要な情報が強制的に保持されるため、コーデックはより低いレートで正常に劣化します。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

SoundStream ニューラル コーデックの将来

SoundStream は、後に EnCodec や DAC などのコーデックが洗練されたテンプレートを確立し、その個別のトークンは AudioLM や MusicLM などの生成システムの基盤になりました。子孫は、さらに低いビットレート、言語モデル スタイルのオーディオ ジェネレーターへの入力としても機能する意味論的に構造化されたトークン、および帯域幅と遅延が厳しく制限されているライブ通話、補聴器、ストリーミング用のより緊密なオンデバイス展開を推進することを期待しています。

現実世界の実装

音声通話を最大 3 kbps に圧縮しながら、より高いビットレートで従来のコーデックよりもクリアなサウンドを実現

Google の AudioLM および MusicLM 生成モデルにフィードする個別のオーディオ トークンを生成する

CPU 上のエンコードとデコードによるモバイル デバイスでのリアルタイムの低帯域幅オーディオ ストリーミング

あらゆるコンテンツタイプに対応した単一モデルで音楽と環境音を効率的に保存または送信

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ニューラルオーディオコーデック

よくある質問

SoundStream Neural Codecとは何ですか?

SoundStream は、品質を維持しながら音声と音楽を非常に低いビットレートに圧縮する Google のエンドツーエンドのニューラル オーディオ コーデックです。同じビットレートで Opus などの従来のコーデックを上回り、最新の生成オーディオ モデルを強化するため、これは重要です。

SoundStream アーキテクチャを構成する 3 つのコンポーネントはどれですか?

SoundStream は、畳み込みエンコーダー、埋め込みを離散化する残差ベクトル量子化器、畳み込みデコーダーから構築されており、すべてエンドツーエンドでトレーニングされます。

単一の SoundStream モデルを再トレーニングせずに多くの異なるビットレートに対応できるようにする技術は何ですか?

トレーニング中に、SoundStream は量子化レイヤーをランダムにドロップするため、推論時に使用する RVQ レベルを増減して、1 つのモデルからさまざまなビットレートを達成できます。

Google のリスニング テストでは、3 kbps の SoundStream が 12 kbps のどのコーデックよりも優れていると報告されました。

わずか 3 kbps の SoundStream は、主観的な品質評価において、12 kbps で動作する広く使用されている Opus コーデックと同等かそれを上回りました。

SoundStream は出力サウンドを自然にするためにどのような追加のトレーニング信号を使用しますか?

再構築の損失を超えて、SoundStream は敵対的 (GAN) 識別子を使用するため、再構築は単に数値的に近いというよりも、知覚的に現実的に聞こえます。

SoundStream のビットレートは量子化器とどのように関係していますか?

ビットレートはアクティブな RVQ レイヤーの数 (フレーム レートとコードブックあたりのビット数の積) に応じて変化するため、量子化器を追加するとビットレートと品質が向上します。