オーディオAIガイド

エンコーデックオーディオ圧縮

EnCodec は、Meta の高忠実度ニューラル オーディオ コーデックであり、音声と音楽を非常に低いビットレートで圧縮し、より重い形式に匹敵する品質を実現します。

2分の読書最終更新日

概要

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

ディープダイブ

Meta AI によって 2022 年にリリースされた EnCodec は、エンコーダー、残差ベクトル量子化器 (RVQ)、およびエンドツーエンドでトレーニングされたデコーダーの SoundStream ブループリントに従いますが、いくつかの改良が追加されています。ストリーミング対応の畳み込みエンコーダー、マルチスケール スペクトログラムと時間領域再構成損失、および知覚品質のための敵対的識別器を使用します。注目すべき貢献は、量子化コードをロスレスでさらに圧縮し、品質を損なうことなく余分なビットを絞り出す、小さな Transformer ベースのエントロピー モデルです。 EnCodec では、競合する多くのトレーニング損失を自動的にスケーリングして安定性を維持するバランサーも導入しています。 24 kHz モノラル オーディオと 48 kHz ステレオ オーディオを処理し、1.5、3、6、12 kbps などのビットレートで動作し、6 kbps では 64 kbps の MP3 に匹敵する品質に達します。そのトークンは Meta の MusicGen と AudioGen を動かしています。

技術的な洞察

EnCodec のエンコーダは、ストライド畳み込みを使用して波形を潜在シーケンスにダウンサンプリングし、RVQ がスタック コードブック インデックスに変換します。軽量の Transformer 言語モデルは、これらのトークンの確率を予測して算術コード化し、さらなる圧縮を無料で回復します。トレーニング バランサーは、再構成、スペクトル、および敵対的損失からの勾配の寄与を再スケーリングするため、単一の項が支配的になることがなくなり、ビットレート範囲全体にわたって多目的トレーニングの安定性が維持されます。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

EnCodec オーディオ圧縮の将来

EnCodec はすでに、いくつかのオープン生成オーディオ モデルのデフォルトのトークナイザーであり、その子孫は、低ビットレートでのより高い忠実度、完全なステレオおよび音楽グレードの再構成、テキストからオーディオへのジェネレーターおよびテキストから音楽へのジェネレーターとのより緊密な統合を推進しています。低帯域幅通信、リアルタイム ストリーミング、および大規模な言語モデル スタイルのアーキテクチャでサウンドの読み書きを可能にする標準の「オーディオ トークン」層として、より広範な採用が期待されます。

現実世界の実装

Meta の MusicGen および AudioGen テキスト音声ジェネレーターのオーディオのトークン化

帯域幅制限のある送信用に 24 kHz 音声を 1.5 ~ 6 kbps に圧縮

48 kHz ステレオ音楽を MP3 に近い品質で、より高いビットレートでエンコード

リリースされたチェックポイントを介して、研究およびオーディオ ML パイプライン用のオープンソース ドロップイン コーデックとして機能します。

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

オーディオの埋め込みと表現学習

よくある質問

What is EnCodec Audio Compression?

EnCodec は、Meta の高忠実度ニューラル オーディオ コーデックであり、音声と音楽を非常に低いビットレートで圧縮し、より重い形式に匹敵する品質を実現します。これは最新の生成オーディオ システムを支え、誰でも使用できるオープンソース形式で提供されるため、重要です。

EnCodec をリリースした組織はどこですか?

EnCodec は、2022 年に Meta AI (FAIR) によって高忠実度のニューラル オーディオ コーデックとして導入されました。

EnCodec は、トークンから可逆圧縮をさらに圧縮するために、どのような追加コンポーネントを追加しますか?

EnCodec は、トークンの確率を予測して算術符号化するように小さな Transformer をトレーニングし、RVQ に加えて追加の可逆圧縮を実現します。

およそ 6 kbps の EnCodec の品質は、およそ何ビットレートの MP3 に匹敵すると報告されていますか?

6 kbps の EnCodec は、64 kbps の MP3 と同様の主観的品質に達し、効率が大幅に向上します。

EnCodec の「バランサー」はトレーニング中にどのような問題を解決しますか?

多くの損失 (再構築、スペクトル、敵対的) がある場合、バランサーは勾配を再調整するため、単一の目標が支配的になることがなくなり、トレーニングが安定します。

EnCodec が SoundStream と共有するコアの量子化方法はどれですか?

SoundStream と同様に、EnCodec は残差ベクトル量子化を使用して、エンコーダの埋め込みをスタックされたコードブック インデックスに離散化します。