來源過濾器聲碼和 WORLD
聲碼器是一種將語音分解為構建塊並重建它的工具。
概述
The source-filter model and the WORLD vocoder are classic methods that power text-to-speech and voice conversion by separating what your vocal cords do from what your mouth shapes.
深入探討
源過濾器模型將語音描述為兩個一起工作的部分:源(來自振動聲帶的濁音的嗡嗡聲,或來自耳語和輔音的嘈雜空氣的嗡嗡聲)通過過濾器(喉嚨、嘴巴和鼻子的共振形狀)。聲碼器分析錄製的音訊以估計這些片段,然後從中合成新的音訊。 WORLD 由 Masanori Morise 於 2016 年左右發布,是一款高品質聲碼器,可提取三個參數:F0(來源的音高輪廓)、頻譜包絡(濾波器,透過 CheapTrick 演算法)和非週期性(噪音與音調的比值,透過 PLATINUM/D4C)。這三個流可以獨立修改然後重新合成,使 WORLD 成為參數 TTS 和歌聲系統的主力。
技術洞察
世界的力量來自於徹底的分離。 CheapTrick 估計對小 F0 誤差具有穩健性的平滑頻譜包絡,而 DIO/Harvest 軌道間距和 D4C 則測量頻帶非週期性。由於音高、音色和噪音存在於單獨的參數流中,因此您可以將 F0 向上移動一個八度,而無需改變聲音的聽起來是誰,或者可以在不改變音高的情況下延長持續時間。像 WaveNet 這樣的神經聲碼器後來直接對波形進行建模,但 WORLD 仍然快速、可解釋且無需許可。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
源濾波器聲碼與世界的未來
在高端自然度方面,純訊號處理聲碼器在很大程度上已被神經聲碼器(HiFi-GAN、WaveRNN)取代,但 WORLD 並沒有消失。它作為一種快速、CPU 友好的前端存在於語音轉換管道、歌唱合成器和研究基線中,並且其 F0 加頻譜包絡功能仍然為許多神經模型提供支援。預計混合系統將採用 WORLD 風格的可解釋參數指導神經解碼器,讓創作者能夠在不犧牲真實性的情況下精確控制音高和音色。
現實世界的實施
語音轉換工具可以改變說話者的音高和音色,同時保持語音清晰易懂
以新音高重新合成音符的歌聲合成器(例如 UTAU/NNSVS 生態系統)
在聲碼之前產生 F0、頻譜和非週期性流的參數化文字轉語音系統
無需重新訓練即可進行音高轉換、時間拉伸和韻律編輯的語音研究基線
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Source-Filter Vocoding and WORLD quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Source-Filter Vocoding and WORLD?
聲碼器是一種將語音分解為構建塊並重建它的工具。來源過濾器模型和 WORLD 聲碼器是經典方法,透過將聲帶的功能與嘴型的功能分開來支援文字轉語音和語音轉換。
在語音的來源過濾器模型中,「過濾器」代表什麼?
濾波器是聲道的共鳴——喉嚨、嘴巴和鼻子的形狀,為聲音著色。來源是聲帶嗡嗡聲或吵雜的氣流。
WORLD 聲碼器從語音中擷取哪三個參數?
WORLD 將語音分解為基頻 (F0)、頻譜包絡(音色/濾波器)和非週期性(噪音與音調平衡)。
用於估計譜包絡的 WORLD 演算法的名稱是什麼?
CheapTrick 估計出一個平滑的譜包絡,該包絡對於音調估計中的小誤差具有穩健性。
為什麼從頻譜包絡中分離音調很有用?
由於音調 (F0) 和音色(頻譜包絡)是獨立的流,因此您可以提高或降低音調,同時保留說話者的身份。
WORLD 與 HiFi-GAN 等神經聲碼器相比如何?
WORLD 是一款訊號處理聲碼器:快速、可解釋且 CPU 友善。神經聲碼器通常可以實現更高的自然度,但也更重。