音訊人工智慧指南

SoundStorm 並行音訊生成

SoundStorm 是一種 Google 音訊生成模型,它並行生成語音和聲音,而不是一次產生一個令牌,從而使高品質音訊合成速度顯著加快。

閱讀時間約2分鐘最後更新

概述

這很重要,因為它能將長片段的生成延遲從幾分鐘縮短到幾秒,同時不犧牲畫質。

深入探討

SoundStorm 由 Google 於 2023 年推出,可從名為 SoundStream 的神經編解碼器產生表示為離散聲學標記的音訊。 AudioLM 等早期模型以自回歸方式產生這些標記,按順序預測每個標記,這對於長音訊來說很慢。相反,SoundStorm 使用借鑒自 MaskGIT 等影像生成模型的非自回歸、基於掩模的方法。它從大部分被屏蔽的標記開始,並通過幾個解碼步驟迭代地填充它們,同時並行預測許多標記。以語義標記(來自 AudioLM 或 SPEAR-TTS 等模型)為條件,它可以在 TPU 上大約半秒內合成 30 秒的自然對話,比自回歸基線快大約 100 倍,同時匹配其品質和說話者一致性。

技術洞察

SoundStorm 對 SoundStream 中的殘差向量量化 (RVQ) 層級的層次結構進行建模。在訓練過程中,隨機標記被屏蔽,模型學習預測它們。在推理時,它運行基於置信度的平行解碼:在每次迭代中,它預測所有屏蔽標記,保留最置信的標記,並重新屏蔽其餘標記。它首先解碼粗略的 RVQ 級別,然後解碼更精細的 RVQ 級別,以比逐個令牌生成少得多的步驟實現完整音訊。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

SoundStorm 並行音訊產生的未來

基於平行遮罩的解碼正在成為快速、可控音訊的標準工具。期望它能夠為即時對話代理、即時語音合成以及長篇播客或有聲讀物生成提供支持,而延遲曾經使自回歸模型變得不切實際。將其與更強的語義調節和水印相結合將提高對話的真實性和可追溯性。相同的迭代細化想法可能會與擴散方法合併,從而模糊編解碼器令牌和連續音訊產生器之間的界限。

現實世界的實施

在不到一秒的時間內為 AI 語音助理產生 30 秒的語音對話

合成具有一致說話者聲音的多輪對話以進行原型設計

在自回歸模型滯後的互動式代理程式中支援低延遲文字到語音

透過並行填充聲學標記快速產生長格式敘述音頻

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStorm Parallel Audio Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

穩定的音頻潛在擴散

常見問題

什麼是 SoundStorm 平行音訊產生?

SoundStorm 是一種 Google 音訊生成模型,它並行生成語音和聲音,而不是一次產生一個令牌,從而使高品質音訊合成速度顯著加快。這很重要,因為它可以將長剪輯的生成延遲從幾分鐘縮短到幾秒鐘,而不會犧牲保真度。

讓 SoundStorm 比 AudioLM 更快的關鍵創新是什麼?

SoundStorm 以非自回歸並行解碼取代了緩慢的自回歸、逐個令牌生成,可同時預測許多令牌。

SoundStorm 採用哪種影像生成技術?

SoundStorm 借鑒了 MaskGIT 在影像合成中流行的基於置信度的掩模和填充解碼策略。

SoundStorm 產生什麼樣的表示形式?

SoundStorm 預測由 SoundStream 編解碼器產生的離散聲學標記,隨後將其解碼為波形。

SoundStorm 在 TPU 上產生 30 秒的音訊大約需要多長時間?

SoundStorm 可以在大約 0.5 秒內合成 30 秒的音頻,比自回歸基線快約 100 倍。

SoundStorm 如何決定在解碼期間保留哪些預測令牌?

在每次迭代中,它都會保留其最高置信度的令牌預測,並為下一次重新封鎖不確定的令牌預測。