譜減法和維納濾波
譜減法和維納濾波是經典的、預深度學習的降噪主力。
概述
They clean audio by estimating the noise spectrum and mathematically subtracting or attenuating it, and they still underpin many modern systems.
深入探討
兩種方法都在短時傅立葉變換後在頻域中工作。頻譜減法通常在無聲間隙期間估計平均噪音功率,並將其從每幀的幅度頻譜中減去;剩下的都被視為言語。它簡單且便宜,但往往會產生“音樂噪音”,即由於不完美的減法留下孤立的頻譜峰值而引起的短暫隨機音調。維納濾波更有原則性:它為每個頻率倉導出統計上的最佳增益,以最小化均方誤差,並根據估計的信噪比對倉進行加權。以語音為主的垃圾箱經過;以噪音為主的垃圾箱被嚴重衰減。兩者都假設噪音是相對穩定的,這限制了它們免受突然變化的聲音的影響。
技術洞察
箱中的維納增益大致為 SNR / (SNR + 1),因此高 SNR 箱保留大部分能量,而低 SNR 箱則受到抑制。相反,頻譜減法計算幅度減去估計的雜訊幅度,然後將負值歸零。兩者在重建波形時都重複使用原始雜訊相位,因為人類聽覺對短幀中的相位誤差相對不敏感。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
譜減法與維納濾波的未來
這些方法並沒有消失;而是正在消失。他們正在被吸收。深度網路現在學習維納濾波分析得出的掩碼,而基於信噪比的增益思想直接啟發了神經語音增強中使用的時頻掩碼。預計將繼續用作受限硬體上的輕量級前端、穩定學習模型的先驗以及研究人員對新系統進行基準測試的可解釋基線。
現實世界的實施
Audacity 等音訊編輯器中的降噪預設(頻譜雜訊消除)
舊式電話和 VoIP 系統中的語音清理
低功耗嵌入式晶片上語音辨識前的前端去噪
提高早期助聽器和聽寫系統的清晰度
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Spectral Subtraction and Wiener Filtering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Spectral Subtraction and Wiener Filtering?
譜減法和維納濾波是經典的、預深度學習的降噪主力。它們透過估計噪音頻譜並以數學方式減去或衰減它來淨化音頻,並且它們仍然支撐著許多現代系統。
光譜減法通常會帶來哪些惱人的偽影?
不完美的減法會留下孤立的頻譜峰值,聽起來像隨機的顫音,稱為音樂噪音。
譜減法和維納濾波主要在哪個域中運作?
兩者在處理之前都透過短時傅立葉變換將音訊變換到頻域。
維納濾波器試圖最小化什麼?
維納濾波計算最小化均方誤差的增益,給出統計上的最佳估計。
譜減法通常如何估計雜訊譜?
它測量停頓或非語音間隙期間的平均噪音功率,然後從每個幀中減去該估計值。
bin 中的維納增益可以近似為哪個表達式?
增益大致為 SNR/(SNR+1),因此高 SNR 頻段大部分保留,低 SNR 頻段被衰減。