音訊人工智慧指南

Voicebox 流程匹配語音生成

Voicebox 是 Meta 的文字引導語音生成模型,採用流匹配目標進行訓練,以「填充」屏蔽音頻,讓一個模型進行零樣本語音克隆、噪聲消除、內容編輯和多語言合成。

閱讀時間約2分鐘最後更新

概述

It matters because, like a language model for speech, it generalizes across many tasks it was never explicitly trained for.

深入探討

Voicebox 由 Meta AI 於 2023 年宣布,針對單一任務進行訓練:給定周圍的音頻上下文和相應的文本,預測語音中被屏蔽的部分。這種「上下文中」或填充公式在概念上借鑒了大型語言模型,意味著同一模型透過選擇要屏蔽的內容來處理不同的推理工作。擦除說錯的單詞,Voicebox 會以相同的聲音重新生成它;提供某人的兩秒鐘演講作為上下文,它會模仿他們的音色和風格合成新句子;掩蓋噪音片段並產生乾淨的替代品。報告的結果顯示,與基於擴散的自回歸系統相比,零樣本文字到語音的品質很高,生成速度要快得多,同時一個模型支援多種語言。

技術洞察

Voicebox 使用條件流匹配,訓練連續時間模型來學習平滑的速度場,該速度場將隨機噪音傳輸到真實的語音特徵,以文字和未屏蔽的音訊為條件。與擴散相比,流匹配可以使用常微分方程求解器以相對較少的步驟求解,從而降低推理成本。透過將每項功能定義為“預測給定上下文的屏蔽音訊”,單一非自回歸網路可以學習編輯、複製和去噪,而無需特定於任務的頭或單獨的訓練運行。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

Voicebox 流程配對語音生成的未來

流程匹配語音生成將支援通用語音模型,這些模型可以像文字編輯器處理單字一樣流暢地編輯、翻譯和重新設計音訊。期待即時對話代理、翻譯中的跨語言語音保存以及損壞錄音的高保真恢復。由於相同的技術可以實現令人信服的語音克隆,Meta 最初保留了該模型,並推動了檢測合成語音的研究——來源浮水印、同意框架和檢測工具將成為負責任部署的核心。

現實世界的實施

透過輸入更正的單字並以原始發言者的聲音重新朗讀來編輯播客

只需幾秒鐘的參考音訊即可進行零樣本語音克隆

透過掩蔽和重新生成乾淨的語音片段來消除瞬態噪音

從一個模型跨多種語言合成同一說話者的聲音

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voicebox Flow-Matching Speech Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Voicebox Flow-Matching Speech Generation?

Voicebox 是 Meta 的文字引導語音生成模型,採用流匹配目標進行訓練,以「填充」屏蔽音頻,讓一個模型進行零樣本語音克隆、噪聲消除、內容編輯和多語言合成。這很重要,因為就像語音的語言模型一樣,它可以概括許多從未明確訓練過的任務。

Voicebox 針對哪些單一訓練任務進行了最佳化?

Voicebox 經過訓練,可以使用周圍的音訊和文字來填充語音的屏蔽部分,這是一種受語言模型啟發的上下文表述。

Voicebox 使用哪種生成技術來取代擴散?

Voicebox 使用條件流匹配,學習將噪音傳輸為語音特徵的速度場,並且可以使用 ODE 求解器高效求解。

Voicebox如何進行零樣本語音複製?

給定一個簡短的參考剪輯作為未屏蔽的上下文,Voicebox 會合成與說話者的音色和風格相匹配的新句子,而無需重新訓練。

為什麼 Meta 最初保留完整的 Voicebox 模型?

由於模型可以令人信服地克隆聲音,Meta 推遲了它並強調了檢測合成語音的研究。

一個模型如何處理 Voicebox 中的編輯、克隆和去噪?

所有能力都歸結為相同的填充目標;改變推理時屏蔽的內容可以對一個模型進行編輯、克隆或噪聲消除。