音訊人工智慧指南

殘差向量量化

殘差向量量化 (RVQ) 是一種透過重複量化剩餘誤差將連續音訊嵌入轉換為緊湊的離散程式碼堆疊的技術。

閱讀時間約2分鐘最後更新

概述

It matters because it is the engine behind modern neural codecs like SoundStream and EnCodec and the tokenizer for generative audio.

深入探討

普通向量量化 (VQ) 以學習的碼本中最近的條目取代連續向量,但對於高品質而言足夠精細的單一碼​​本將需要大量的條目。 RVQ 透過級聯幾個較小的碼本解決了這個問題。第一個碼本產生粗略近似值;您減去它以獲得殘差,使用第二個碼本量化該殘差,再次相減,然後繼續 N 個階段。最終的程式碼是所有階段所選擇的索引的列表,並且重建是所有選擇的碼本向量的總和。這將一個巨大的有效密碼本分解為許多小的密碼本,大大減少了記憶體和計算量,同時只需使用更多或更少的階段就可以擴展比特率。訓練期間的量化器丟失使早期的碼本攜帶最多的信息,從而實現優雅的質量下降。

技術洞察

每個階段都在其當前殘差的碼本上運行最近鄰查找,並且碼本通常是透過指數移動平均更新加上承諾損失來學習的,因此編碼器輸出保持接近所選條目。每個階段有 M 個階段的 K 個條目,RVQ 表示 K 到 M 的有效組合,僅使用 M 乘 K 的儲存向量和每幀 M 乘 log2(K) 位,比一個巨大的碼本便宜得多。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

殘差向量量化的未來

RVQ 已成為將連續神經表示與基於標記的生成模型聯繫起來的標準離散化層,並且不斷改進:更好地利用碼本以避免「死」條目、分解和低維碼本以及語義上有意義的標記層次結構。除了音訊之外,相同的殘差堆疊想法正在傳播到圖像和視訊分詞器,將 RVQ 定位為連續編碼器和語言模型式序列產生器之間的通用橋樑。

現實世界的實施

SoundStream、EnCodec 和 DAC 神經編解碼器內的離散化編碼器嵌入

產生 AudioLM 和 MusicLM 產生的分層音訊令牌

透過啟動更多或更少的量化器級來提高或降低編解碼器的位元率

使用堆疊碼本壓縮檢索和儲存系統中的高維嵌入

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Residual Vector Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

X 向量揚聲器嵌入

常見問題

What is Residual Vector Quantization?

殘差向量量化 (RVQ) 是一種透過重複量化剩餘誤差將連續音訊嵌入轉換為緊湊的離散程式碼堆疊的技術。這很重要,因為它是 SoundStream 和 EnCodec 等現代神經編解碼器以及生成音訊的分詞器背後的引擎。

RVQ 中每個連續的碼本量化什麼?

在第一個碼本給出粗略估計後,RVQ 將其減去並用下一個碼本量化剩餘的殘差,跨階段重複。

為什麼要使用 RVQ 而不是單一大碼本?

一個足夠精細的高品質密碼本將太大得不切實際;堆疊 M 個包含 K 個條目的碼本可提供 K^M 組合,而所需的存儲空間要少得多。

RVQ碼最終的重構是如何形成的?

重建是所有階段所選的碼本向量的總和,每個階段都校正先前的殘差。

M 個階段,每個階段有 K 個條目,RVQ 代表多少種有效代碼組合?

在 M 個獨立階段的每個階段選擇 K 個條目之一會產生 K^M 種可能的組合,同時僅儲存 M*K 個向量。

訓練 RVQ 碼本時「承諾損失」的典型目的是什麼?

當編碼器的輸出偏離所選碼本向量時,承諾損失會對編碼器進行懲罰,從而保持量化穩定;密碼本本身通常透過指數移動平均線更新。