音訊人工智慧指南

自然語音與潛在擴散 TTS

NaturalSpeech 是 Microsoft TTS 研究的系列,旨在實現人類水平的語音質量,後續版本使用潛在擴散來產生豐富、自然的聲音。

閱讀時間約2分鐘最後更新

概述

它展示了以圖像聞名的擴散模型如何產生富有表現力的、可控的音訊。

深入探討

最初的 NaturalSpeech (2022) 是第一個在 LJSpeech 基準上達到人類水平品質的系統,由無法可靠地區分真實錄音的聽眾來判斷。它使用具有仔細匹配先驗的變分自動編碼器來縮小訓練和推理之間的差距。 NaturalSpeech 2 隨後採用了潛在擴散方法:神經音頻編解碼器將語音編碼為連續的潛在向量,擴散模型學習從文本生成這些潛在向量,從而能夠從簡短的提示中實現強大的零樣本語音克隆。 NaturalSpeech 3 引入了分解擴散,將語音分離為內容、韻律、音色和聲學細節等解開的屬性,因此每個屬性都可以獨立建模和控制,以獲得更高的保真度和靈活性。

技術洞察

潛在擴散的工作原理是向緊湊的潛在語音表示添加噪聲,並訓練網路逐步逆轉該噪聲。 NaturalSpeech 2 不是對原始波形或完整頻譜圖進行去噪,而是對編解碼器潛伏進行去噪,這些潛伏維度較低且更易於建模。以文字和參考語音提示為條件來引導反向擴散,因此最終採樣的潛伏解碼為與請求的內容和說話者身分相符的語音。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

自然語音與潛在擴散 TTS 的未來

基於擴散和分解的 TTS 指向的聲音不僅自然而且可精細控制,讓使用者可以像獨立的旋鈕一樣調整音色、情感和韻律。期望透過蒸餾和幾步擴散實現更快的採樣,從幾秒鐘的音訊中進行更強大的零樣本克隆,以及與大型語言模型更緊密的整合以實現上下文感知交付。這些進步也加劇了對浮水印和同意保護措施的需求,因為高保真克隆會帶來明顯的濫用風險。

現實世界的實施

配音工作室使用 NaturalSpeech 2 式零鏡頭克隆技術,從簡短樣本中克隆演員的聲音,以對電影進行本地化。

有聲書平台產生人類層次的敘述,聽眾很難將其與真正的配音人才區分開來。

輔助工具可以為失語者從舊錄音中重新創建一個人自己的聲音。

內容創建套件讓編輯人員能夠利用 NaturalSpeech 3 的分解屬性獨立調整音色和韻律。

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NaturalSpeech and Latent Diffusion TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

穩定的音頻潛在擴散

常見問題

什麼是自然語音和潛在擴散 TTS?

NaturalSpeech 是 Microsoft TTS 研究的系列,旨在實現人類水平的語音質量,後續版本使用潛在擴散來產生豐富、自然的聲音。它展示了以圖像聞名的擴散模型如何產生富有表現力的、可控的音訊。

據報道,最初的 NaturalSpeech (2022) 實現了哪些里程碑?

據報道,NaturalSpeech 是 LJSpeech 上第一個達到人類水平質量的系統,但聽眾無法可靠地將其與真實語音區分開來。

NaturalSpeech 2 的潛在擴散模型實際上產生了什麼?

NaturalSpeech 2 擴散編解碼器潛伏,這些潛伏比原始波形更緊湊且更容易建模,然後將其解碼為音訊。

擴散模型如何產生高水準的數據?

擴散在訓練過程中增加噪聲,並學習將其逆轉,透過逐步從隨機噪聲中去雜訊來產生樣本。

潛在擴散為 NaturalSpeech 2 提供了哪些關鍵功能?

透過調節簡短的語音提示,NaturalSpeech 2 可以複製從未接受過明確訓練的說話者的聲音。

NaturalSpeech 3 的「分解擴散」的中心思想是什麼?

分解擴散可以解開內容、韻律、音色和聲學細節,因此每個屬性都可以單獨建模和控制。