AudioGen 文字到音訊合成
AudioGen 是 Meta 模型,可將文字描述轉換為逼真的環境聲音和音效,例如「鳥叫時狗叫聲」。這很重要,因為它可以讓創作者從簡單的語言生成非語音音頻,這是生成人工智慧長期缺失的功能。
深入探討
AudioGen 由 Meta AI 於 2022 年發布,是一種自回歸語言模型,可直接從文字提示產生通用音訊(音效、環境場景、動物和物件聲音)。與文字轉語音系統不同,它針對的是日常聲音的混亂世界。它首先使用神經編解碼器(具有殘差向量量化的 EnCodec 式自動編碼器)將原始音訊壓縮為一系列離散標記。然後,Transformer 語言模型學習根據單獨的文字編碼器編碼的文字描述來預測這些音訊標記。為了提高對作曲的理解,作者在訓練期間混合併連接了音訊樣本,以便模型可以學習重疊聲音等組合。 AudioGen 後來與 MusicGen 音樂模型一起成為 Meta 的 AudioCraft 庫的一部分。
技術洞察
AudioGen 有兩個階段。首先,音訊自動編碼器學習將波形映射到離散標記的緊湊流並返回。其次,使用語言建模目標對 Transformer 進行訓練,以在給定前面的標記和文字條件的情況下預測下一個音訊標記。無分類器指導和多流碼本建模提高了保真度和文字對齊。產生音訊意味著自回歸取樣標記,然後使用編解碼器將它們解碼回波形。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
AudioGen 文字到音訊合成的未來
文字到音訊正在朝著更高的取樣率、更長的連貫場景以及對聲音的時間和空間位置的更嚴格的控制邁進。期望整合到自動添加匹配音效的視訊工具、以聲音描述場景的輔助工具以及按需合成環境音訊的遊戲引擎中。將 AudioGen 風格的標記模型與擴散方法和更強大的文字編碼器相結合應該可以提高真實感,而水印和來源工具將有助於區分合成聲音和錄製的聲音。
現實世界的實施
根據文字提示產生電影和遊戲的擬音和聲音效果
為應用程式和冥想工具創建環境音景(雨、交通、森林)
無需許可庫存庫即可為視訊項目製作音訊原型
產生以簡單語言描述的自訂警報和通知聲音
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioGen Text-to-Audio Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is AudioGen Text-to-Audio Synthesis?
AudioGen 是 Meta 模型,可將文字描述轉換為逼真的環境聲音和音效,例如「鳥叫時狗叫聲」。這很重要,因為它可以讓創作者從簡單的語言生成非語音音頻,這是生成人工智慧長期缺失的功能。
AudioGen 主要產生什麼?
AudioGen 專門研究非語音、一般音頻,例如環境聲音和文字提示產生的效果。
AudioGen 管道的第一階段是什麼?
神經編解碼器自動編碼器將原始音訊壓縮為語言模型可以預測的離散標記。
什麼類型的模型可以預測音訊標記?
AudioGen 使用一種自回歸 Transformer,根據文字來預測一個又一個的音訊標記。
為什麼作者在訓練期間混合並連接音訊?
透過混合和串聯剪輯進行增強,提高了 AudioGen 在提示中組合多個聲音的能力。
哪個更大的 Meta 庫包含 AudioGen?
AudioGen 是 Meta 的 AudioCraft 函式庫的一部分,該函式庫還包含 MusicGen 模型。