音訊人工智慧指南

Noise2Noise 語音增強

Noise2Noise 是一種訓練技巧,可以讓模型透過從相同訊號的成對不同雜訊版本中學習,在沒有看到乾淨參考的情況下學習消除雜訊。

閱讀時間約2分鐘最後更新

概述

For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.

深入探討

Noise2Noise 由 NVIDIA 研究人員於 2018 年推出,提出了一個令人驚訝的主張:您可以只使用損壞的範例來訓練降噪器。洞察力是統計性的。如果您為網路提供相同基礎訊號的兩個雜訊版本,並要求它使用均方誤差等損失將一個版本對應到另一個版本,則網路無法預測目標中的隨機雜訊,因此它最多只能輸出期望值,即乾淨的訊號。噪音趨於平均。應用於語音時,您可以發出乾淨的話語,添加兩個獨立的噪音樣本,然後訓練模型預測一個噪音片段與另一個片段。在推理時,模型會消除真實錄音中的雜訊。這迴避了監督去噪的核心瓶頸:需要完美乾淨的真實音訊。

技術洞察

數學依賴 L2(均方誤差)損失在條件平均值下最小化的屬性。如果添加到目標的雜訊是零均值且與輸入雜訊無關,則不可預測的雜訊僅對損失貢獻恆定方差,因此梯度下降將網路驅動到底層的乾淨訊號。同樣的想法也適用於其他估計器:L1 損失恢復中位數,這對脈衝雜訊很有用。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

Noise2Noise 語音增強的未來

Noise2Noise 開創了一系列自我監督去噪方法,包括 Noise2Void 和 Noise2Self,它們進一步放寬了從單一雜訊樣本中學習的要求。對於語音,預計這些想法將為助聽器、通話和現場錄音的設備增強提供支持,在這些領域收集乾淨的參考資料是不切實際的。與生成聲碼器結合,未來的系統不僅可以消除噪音,還可以合理地重建被屏蔽或被破壞的語音內容,同時保持對說話者的忠實。

現實世界的實施

清理沒有原始語音乾淨參考的現場或檔案錄音

透過在現實世界的噪音捕獲上訓練降噪器來提高手機和筆記型電腦上的語音通話清晰度

使用配對的噪音錄音而不是無法獲得的乾淨音訊來增強助聽器的語音

恢復吵雜的舊播客或採訪磁帶,其中只有降級版本倖存

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Noise2Noise Speech Enhancement quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Kaldi 語音辨識工具包

常見問題

What is Noise2Noise Speech Enhancement?

Noise2Noise 是一種訓練技巧,可以讓模型透過從相同訊號的成對不同雜訊版本中學習,在沒有看到乾淨參考的情況下學習消除雜訊。對於語音增強來說,這一點很重要,因為乾淨的錄音價格昂貴或不可能獲得,而嘈雜的錄音卻無處不在。

Noise2Noise 令人驚訝的核心主張是什麼?

Noise2Noise 表明,您可以只使用損壞的範例對來訓練有效的降噪器,而無需乾淨的目標。

為什麼網路不能簡單地記住目標剪輯中的雜訊?

由於目標的雜訊是隨機的並且與輸入無關,因此網路無法對其進行預測,而是收斂到乾淨的期望值。

在 L2(均方誤差)損失下,網路會朝什麼方向收斂?

L2 損失在條件均值處最小化,因此在零均值獨立目標雜訊的情況下,網路輸出底層的乾淨訊號。

為了使技巧發揮作用,添加到目標的噪音必須是真實的嗎?

目標噪聲需要是零均值並且在統計上獨立於輸入噪聲,以便在訓練期間達到平均值。

從 L2 遺失切換到 L1 遺失會使網路恢復哪個統計資料?

L1(絕對誤差)損失在中位數處最小化,這對脈衝雜訊更加穩健。