深度噪声抑制挑战
深度噪声抑制 (DNS) 挑战赛是一项由 Microsoft 举办的竞赛,旨在推动研究人员构建能够实时去除语音中背景噪声的神经网络。
概述
It set the modern benchmarks that power features like Teams and Zoom noise removal.
深入探讨
DNS 挑战赛由 Microsoft 于 2020 年发起,并重复举办了几年(通常在 INTERSPEECH 和 ICASSP 上),为团队提供了一个包含干净语音、噪声片段和综合混合噪声录音的大型标准化数据集。至关重要的是,它将评估从 PESQ 等较旧的信号数学转向人类听力分数,并学习了感知质量的预测因素。它还添加了现实世界的严酷条件:混响房间、非平稳噪声(打字、狗、警报器)、音调噪声以及模型必须抑制除注册目标说话者之外的所有人的个性化场景。通过发布数据、基线和通用测试集,实验室可以进行同类比较,并加速从过滤技巧向语音增强的端到端深度学习的转变。
技术洞察
条目通常将噪声波形的短时傅立叶变换馈送到预测时频掩模的循环或卷积网络中。将掩模乘以噪声频谱会衰减噪声主导的频段,同时保留语音主导的频段,然后逆 STFT 重建波形。实时规则限制了算法延迟(大约 40 毫秒),并且需要因果处理,因此模型在清理当前帧时无法查看未来的音频。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
深度噪声抑制挑战的未来
预计该框架将扩展到个性化和多模式抑制,其中嘴唇运动或说话者的声纹指导保留什么。耳塞和助听器的模型正在缩小以在设备上运行,全频段 48 kHz 处理正在成为标准,因此音乐和高频得以生存。重新合成干净语音(而不仅仅是掩盖噪音)的生成方法是一个活跃且有时存在争议的前沿领域。
现实世界的实施
Microsoft Teams 和其他视频通话应用程序中的实时背景噪音消除
在通勤或繁忙的咖啡馆期间,耳塞和耳机中的语音捕捉更加清晰
在自动转录或字幕之前预处理嘈杂的现场录音
提高助听器和助听设备的清晰度
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Noise Suppression Challenge quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Deep Noise Suppression Challenge?
深度噪声抑制 (DNS) 挑战赛是一项由 Microsoft 举办的竞赛,旨在推动研究人员构建能够实时去除语音中背景噪声的神经网络。它设定了现代基准,为 Teams 和 Zoom 噪音消除等功能提供支持。
哪个组织发起了深度噪声抑制 (DNS) 挑战赛?
Microsoft 于 2020 年发起了 DNS 挑战赛,并在 INTERSPEECH 和 ICASSP 等场所举办。
为 DNS 挑战赛构建的系统的主要目标是什么?
该挑战的目标是实时语音增强,抑制噪音,同时保留说话者的声音。
为什么实时 DNS 处理禁止模型使用未来的音频帧?
实时对话需要因果、低延迟处理,因此该模型只能使用过去和当前的音频。
DNS 条目中的一项常见技术是预测“掩码”。面膜有什么作用?
时频掩模与噪声频谱相乘,以抑制噪声主导的频段并保留语音。
DNS 挑战赛如何改变了语音增强的评估方式?
挑战转向人类听力测试并学习感知质量预测因子,而不仅仅是信号数学。