編碼解碼器音訊壓縮
EnCodec 是 Meta 的高保真神經音訊編解碼器,它以極低的比特率壓縮語音和音樂,其品質可與更重的格式相媲美。
概述
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
深入探討
EnCodec 由 Meta AI 於 2022 年發布,遵循編碼器、殘差向量量化器 (RVQ) 和端到端訓練的解碼器的 SoundStream 藍圖,但添加了一些改進。它使用具有串流媒體功能的捲積編碼器、多尺度頻譜圖和時域重建損失,以及用於感知質量的對抗性鑑別器。一個顯著的貢獻是一個基於 Transformer 的小型熵模型,它進一步無損地壓縮量化程式碼,在不損失品質的情況下擠出額外的位元。 EnCodec 還引入了一個平衡器,可以自動縮放許多競爭訓練損失,使它們保持穩定。它可處理 24 kHz 單聲道和 48 kHz 立體聲音頻,可在 1.5、3、6 和 12 kbps 等比特率下運行,並且在 6 kbps 下可達到與 64 kbps 下的 MP3 相當的品質。其代幣為 Meta 的 MusicGen 和 AudioGen 提供動力。
技術洞察
EnCodec 的編碼器透過跨步卷積將波形下取樣為潛在序列,RVQ 將其轉換為堆疊碼本索引。輕量級 Transformer 語言模型可以預測這些標記的機率並對它們進行算術編碼,從而免費恢復進一步的壓縮。訓練平衡器重新調整重建、頻譜和對抗性損失的梯度貢獻,因此沒有單一佔主導地位,這使多目標訓練在整個位元率範圍內保持穩定。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
EnCodec 音訊壓縮的未來
EnCodec 已經是多個開放生成音頻模型的預設分詞器,其後代正在以較低的比特率推動更高的保真度、完整的立體聲和音樂級重建,以及與文本到音頻和文本到音樂生成器的更緊密整合。預計將在低頻寬通訊、即時串流媒體和標準「音訊令牌」層中得到更廣泛的採用,讓大型語言模型風格的架構能夠讀取和寫入聲音。
現實世界的實施
為 Meta 的 MusicGen 和 AudioGen 文字到音訊產生器標記音訊
將 24 kHz 語音壓縮至 1.5-6 kbps,以實現頻寬有限的傳輸
以更高的位元率編碼品質接近 MP3 的 48 kHz 立體聲音樂
透過已發布的檢查點充當研究和音訊 ML 管道的開源嵌入式編解碼器
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is EnCodec Audio Compression?
EnCodec 是 Meta 的高保真神經音訊編解碼器,它以極低的比特率壓縮語音和音樂,其品質可與更重的格式相媲美。這很重要,因為它支撐著現代生成音訊系統,並以開源形式提供給任何人使用。
EnCodec是哪個組織發布的?
EnCodec 由 Meta AI (FAIR) 於 2022 年推出,作為高保真神經音訊編解碼器。
EnCodec 增加了哪些額外元件來無損地從其令牌中壓縮更多壓縮?
EnCodec 訓練一個小型 Transformer 來預測令牌機率並對它們進行算術編碼,從而在 RVQ 之上實現額外的無損壓縮。
據報導,在大約 6 kbps 的情況下,EnCodec 的品質與比特率大約是多少的 MP3 相當?
6 kbps 的 EnCodec 達到的主觀品質與 64 kbps 的 MP3 類似,效率大幅提升。
EnCodec的「平衡器」在訓練過程中解決什麼問題?
由於存在許多損失(重建、光譜、對抗性),平衡器會重新調整梯度,因此沒有單一目標占主導地位,從而穩定了訓練。
EnCodec 與 SoundStream 共享哪種核心量化方法?
與 SoundStream 一樣,EnCodec 使用殘差向量量化將編碼器嵌入離散化為堆疊碼本索引。