VALL-E 和編解碼器語言模型
VALL-E 將文字轉語音重新定義為音訊編解碼器令牌上的語言建模問題,從而可以從僅三秒的樣本中克隆語音。
概述
It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.
深入探討
VALL-E 由 Microsoft 於 2023 年初宣布,將語音合成視為語言建模。它不是預測頻譜圖,而是預測神經編解碼器 (EnCodec) 的離散聲學標記,因此生成變成了音訊詞彙表上的下一個標記預測。給定一個看不見的說話者加上目標文字的 3 秒錄音,VALL-E 會繼續該說話者的聲音,保留音色甚至聲學環境。它接受了大約 60,000 小時的語音訓練,遠遠超過典型的 TTS 資料集,這使其具有強大的零樣本克隆能力。由於編解碼器標記是分層的(透過 RVQ),VALL-E 使用兩個階段:自迴歸模型預測第一個以提示為條件的粗略標記流,非自迴歸模型填充剩餘的詳細標記。這個編解碼器-LM 配方啟發了 VALL-E 2 等後繼者和許多語音基礎模型。
技術洞察
訣竅是分層編解碼器令牌的混合解碼。自迴歸階段一次預測最重要的第一個密碼本標記,捕捉韻律和內容。其餘的碼本添加了精細的聲學細節,由以第一個串流和揚聲器提示為條件的非自回歸模型並行預測。這種分割保持了高品質,同時避免了順序產生每個令牌的成本,並且使用編解碼器意味著可以使用相同的變壓器機制對語音和文字進行建模。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
VALL-E 和編解碼器語言模型的未來
編解碼器語言模型正在將語音與大型語言模型合併,指向在一個模型中聽、推理和說的統一系統。期待更好的穩定性和更少的偽影、即時流生成以及對情緒和風格的更嚴格控制。同樣強大的克隆使 VALL-E 對於可訪問性和配音很有用,但也引發了深度偽造和同意問題,因此水印、語音驗證保護措施和政策護欄正在成為這些系統部署方式的核心部分。
現實世界的實施
從幾秒鐘的音訊中克隆聲音,以用於個性化助理或恢復丟失聲音的輔助工具
將影片在地化並配音成其他語言,同時保留原始說話者的音色
產生富有表現力、與脈絡相符的旁白,保留錄音的聲學環境
作為多模式助理的語音骨幹,可以理解並產生語音
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VALL-E and Codec Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is VALL-E and Codec Language Models?
VALL-E 將文字轉語音重新定義為音訊編解碼器令牌上的語言建模問題,從而可以從僅三秒的樣本中克隆語音。它表明,為文字 LLM 提供支援的相同下一個標記預測可以產生非常自然、富有表現力的語音。
VALL-E 與早期文字轉語音系統的核心思想是什麼?
VALL-E 將 TTS 重新建構為離散音訊編解碼器令牌的下一個令牌預測,將語音生成視為語言模型。
VALL-E 需要多少參考音訊來複製新說話者的聲音?
VALL-E 可以從看不見的說話者的大約 3 秒樣本中執行零樣本語音克隆。
VALL-E 使用哪種神經編解碼器來產生音訊標記?
VALL-E 基於 Meta 的 EnCodec 構建,預測其離散聲學標記以合成語音。
為什麼 VALL-E 同時使用自迴歸和非自迴歸階段?
編解碼器令牌透過 RVQ 進行分層; VALL-E 以自回歸方式預測第一個粗略流,並並行預測剩餘的細節標記以提高效率。
VALL-E 大約訓練了多少語音數據,以實現強大的零樣本克隆?
VALL-E 接受了大約 60,000 小時的語音訓練,遠遠超過典型的 TTS 資料集,這提高了其零樣本泛化能力。