音訊人工智慧指南

使用 RNNoise 進行語音去噪

RNNoise 是一種微小、快速的神經網絡,可即時去除語音中的背景噪音。

閱讀時間約2分鐘最後更新

概述

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

深入探討

RNNoise 於 2017 年發布,專為語音通話中的低延遲噪音抑製而設計。它不是端到端地學習所有內容,而是將語音分成大約 22 個模仿人耳的頻帶(類似樹皮的音階),並使用帶有門控循環單元的循環神經網路來估計每幀每個頻帶的增益(0 到 1)。這些增益可以衰減噪音頻帶,同時保持語音主導頻帶完好無損。互補的音調濾波器可清除濁音諧波之間的殘留噪音。整個模型有大約 85,000 個權重,在單個 CPU 核心上運行速度比實時更快,並且在 BSD 許可下開源,這就是它被整合到 Opus 編解碼器生態系統、Mumble 和 OBS Studio 等專案中的原因。

技術洞察

關鍵的設計選擇是基於感知頻帶增益而不是原始頻譜箱來操作。透過每幀僅預測約 22 個增益值,GRU 網路保持很小,並避免了舊式頻譜相減方法中常見的音樂雜訊偽影。手工製作的特徵(頻帶能量、音調週期、音調相關性)輸入網絡,將 DSP 知識與學習相結合。單獨的語音活動輸出有助於在純噪音幀期間控制增益。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

RNNoise 語音降噪的未來

RNNoise 激發了一波輕量級即時增強工作;其後續研究(PercepNet、DeepFilterNet)在保持較小 CPU 預算的同時提高了品質。預計降噪器將直接嵌入耳機、助聽器和會議晶片中,與迴聲消除和混響去除相結合,並使用感知甚至產生目標。在低延遲、低功耗和開源許可比原始模型大小更重要的情況下,混合 DSP 加小型網路方案仍然具有影響力。

現實世界的實施

在捆綁 RNNoise 的應用程式中抑制視訊通話期間的鍵盤碰撞聲和風扇嗡嗡聲。

透過內建的 RNNoise 噪音抑制過濾器在 OBS Studio 中清理主播的麥克風。

提高低功耗硬體上遊戲和 Mumble 等 VoIP 工具中語音聊天的清晰度。

預處理雜訊的現場錄音,以便下游語音辨識獲得更清晰的訊號。

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

語音分離和雞尾酒會問題

常見問題

What is Speech Denoising with RNNoise?

RNNoise 是一種微小、快速的神經網絡,可即時去除語音中的背景噪音。它由 Xiph.Org 的 Jean-Marc Valin 創建,將經典訊號處理與小型循環網路結合,因此可以在普通 CPU 甚至嵌入式設備上運行。

RNNoise 對每個短音頻幀主要預測什麼?

RNNoise 估計每個頻帶的增益,這些增益會衰減噪音主導的頻帶,同時保留語音主導的頻帶,而不是在每個頻譜段上工作。

RNNoise 的核心是什麼類型的神經網路?

RNNoise 使用由門控循環單元構建的緊湊循環神經網絡,在保持微小的同時賦予其時間記憶。

為什麼 RNNoise 使用感知頻帶而不是原始頻譜箱?

僅預測約 22 個頻帶增益可以使網路保持小型、快速,且不易受到困擾 per-bin 方法的音樂噪音偽影的影響。

RNNoise 模型大約有多大?

RNNoise 具有大約 85,000 個權重,足夠小,可以在單一 CPU 核心上比即時運行得更快。

RNNoise 中音調濾波器的作用是什麼?

梳狀/音調濾波器利用有聲語音的諧波結構來抑制諧波之間的噪聲,從而補充頻帶增益。