音訊人工智慧指南

SoundStream 神經編解碼器

SoundStream 是 Google 的端對端神經音訊編解碼器,可將語音和音樂壓縮到極低的位元率,同時保持品質。

閱讀時間約2分鐘最後更新

概述

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

深入探討

SoundStream 由 Google 於 2021 年推出,是一種完全神經編解碼器,由三個一起訓練的部分構建:將原始波形轉換為緊湊向量序列的捲積編碼器、離散化這些向量的殘差向量量化器 (RVQ) 以及重建波形的捲積解碼器。它接受了重建損失和 GAN 式對抗鑑別器的訓練,因此輸出聽起來很自然,而不僅僅是數字上接近。一個突出的功能是「可擴展」或量化器丟失訓練:只需在推理時使用更多或更少的量化器層,單個模型就可以在大約 3 到 18 kbps 的比特率上運行,而無需重新訓練。據報道,在聽力測試、處理語音、音樂和一般音訊方面,它以 3 kbps 的速度優於 12 kbps 的 Opus,該模型可以在智慧型手機 CPU 上即時運行。

技術洞察

波形經過大量下採樣的跨步卷積,每幀產生一個嵌入(例如 75 幀/秒)。然後,RVQ 將每個嵌入編碼為碼本索引堆疊。位元率等於幀速率乘以活動量化器的數量乘以每個碼本的位數。量化器 dropout 在訓練期間隨機截斷 RVQ 堆疊,迫使早期的碼本攜帶最重要的訊息,以便編解碼器以較低的速率優雅地降級。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

SoundStream 神經編解碼器的未來

SoundStream 建立了後來的編解碼器(如 EnCodec 和 DAC)完善的模板,其離散令牌成為 AudioLM 和 MusicLM 等生成系統的基礎。預計後代將推動更低的位元率、語義結構的令牌(可兼作語言模型式音訊產生器的輸入)以及針對頻寬和延遲受到嚴格限制的即時通話、助聽器和串流媒體的更嚴格的設備上部署。

現實世界的實施

將語音通話壓縮至約 3 kbps,同時在更高位元率下聽起來比傳統編解碼器更清晰

產生離散音訊令牌,為 Google 的 AudioLM 和 MusicLM 產生模型提供數據

透過 CPU 上編碼和解碼在行動裝置上進行即時低頻寬音訊串流傳輸

在處理所有內容類型的單一模型中高效儲存或傳輸音樂和環境聲音

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

神經音頻編解碼器

常見問題

What is SoundStream Neural Codec?

SoundStream 是 Google 的端對端神經音訊編解碼器,可將語音和音樂壓縮到極低的位元率,同時保持品質。這很重要,因為它在相同位元率下擊敗了 Opus 等傳統編解碼器,並為現代生成音訊模型提供支援。

SoundStream 架構由哪三個元件組成?

SoundStream 由卷積編碼器、離散化嵌入的殘差向量量化器和卷積解碼器構建,所有這些都經過端到端訓練。

什麼技術可以讓單一 SoundStream 模型在無需重新訓練的情況下提供多種不同的位元率?

在訓練期間,SoundStream 會隨機丟棄量化器層,以便在推理時可以使用更多或更少的 RVQ 等級來達到一個模型的不同位元率。

在 Google 的聆聽測試中,據報告,3 kbps 的 SoundStream 效能優於 12 kbps 的哪種編解碼器?

在主觀品質評估中,僅 3 kbps 的 SoundStream 與以 12 kbps 運行的廣泛使用的 Opus 編解碼器相匹配或擊敗。

SoundStream 使用什麼樣的附加訓練訊號來讓輸出聲音自然?

除了重建損失之外,SoundStream 還使用對抗性 (GAN) 判別器,因此重建聽起來感覺上很真實,而不僅僅是數字上接近。

SoundStream 的比特率與其量化器有何關係?

位元率隨著活動 RVQ 層的數量而變化(乘以幀速率乘以每個碼本的位數),因此添加量化器可以提高位元率和品質。