神經聲碼器
神經聲碼器是一種將緊湊的聲學表示(通常是梅爾頻譜圖)轉換為實際可聽波形的模型。
概述
It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.
深入探討
傳統的語音合成使用訊號處理聲碼器,通常聽起來很嗡嗡作響或機械化。神經聲碼器透過對數小時的真實錄音進行訓練,學習從聲譜圖中重建原始音訊樣本。 WaveNet(DeepMind,2016)是一項突破,它以每秒 16,000 多個樣本的速度一次預測一個樣本,產生極其自然的語音,但速度非常慢。後來的模型用自回歸瓶頸換取了速度:WaveGlow 使用基於流的生成,Parallel WaveGAN 和 MelGAN 使用生成對抗網絡,HiFi-GAN 通過生成遠快於實時的高保真 22kHz 音頻而成為流行標準。如今,聲碼器幾乎總是兩級管道的後半部分,與生成梅爾頻譜圖的 Tacotron 2 或 FastSpeech 等聲學模型配對。
技術洞察
梅爾頻譜圖丟棄了音頻的相位訊息,僅保留能量隨時間在頻段上的分佈。聲碼器的艱鉅任務是發明一種可信的、連貫的波形,其幅度頻譜與輸入相符。基於 GAN 的聲碼器(例如 HiFi-GAN)使用多個鑑別器來檢查不同尺度和週期的訊號,推動產生器產生逼真的精細細節,例如諧波和輔音的尖銳瞬態。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
神經聲碼器的未來
聲碼器變得越來越小、速度越來越快,因此它們可以在手機和嵌入式設備上運行,而無需雲端連接。人們也正在推動通用聲碼器的發展,這種聲碼器可以推廣到任何說話者、語言、歌唱,甚至非語音,而無需重新訓練。平行趨勢將聲碼器直接折疊到端到端系統和神經編解碼器中,模糊了單獨的聲學階段和波形階段之間的界限,並減少了透過中間頻譜圖引入的偽影。
現實世界的實施
在螢幕閱讀器和導航應用程式等文字轉語音助理中產生最終的語音音頻
在配音和有聲書旁白工具中產生聽起來自然的克隆聲音
在人工智慧音樂和虛擬歌手軟體中重建歌聲
為智慧揚聲器和輔助設備提供設備上語音輸出,無需伺服器往返
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Neural Vocoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Neural Vocoders?
神經聲碼器是一種將緊湊的聲學表示(通常是梅爾頻譜圖)轉換為實際可聽波形的模型。這是最後階段,提供現代文字轉語音和語音複製其自然的人類聲音。
神經聲碼器的主要工作是什麼?
神經聲碼器採用緊湊的聲學特徵(通常是梅爾頻譜圖),並合成您聽到的實際原始音訊波形。
2016 年哪個模型是讓神經聲碼器聽起來更自然的突破?
DeepMind 於 2016 年推出的 WaveNet 逐個樣本生成音頻,並產生極其自然的語音,開啟了神經聲碼器時代。
為什麼最初的 WaveNet 產生音訊很慢?
WaveNet 是自回歸的:每個音訊樣本都依賴先前的樣本,因此每秒產生數萬個樣本的計算成本很高。
梅爾頻譜圖明顯丟棄了哪些訊息,使聲碼器的任務變得更加困難?
梅爾頻譜圖保留振幅(每個頻帶的能量)但降低相位,因此聲碼器必須重建相位合理的相干波形。
HiFi-GAN 等基於 GAN 的聲碼器如何提高真實感?
HiFi-GAN 使用多個鑑別器來檢查不同的時間尺度和週期,推動發生器產生真實的諧波和瞬態。