GUÍA de IA en audio

Desafío de supresión profunda del ruido

El Desafío de Supresión Profunda de Ruido (DNS) es una competencia organizada por Microsoft que empuja a los investigadores a construir redes neuronales que eliminen el ruido de fondo del habla en tiempo real.

2 minutos de lecturaÚltima actualización

Descripción general

It set the modern benchmarks that power features like Teams and Zoom noise removal.

Buceo profundo

Lanzado por Microsoft en 2020 y repetido durante varios años (a menudo en INTERSPEECH e ICASSP), el Desafío DNS brindó a los equipos un conjunto de datos grande y estandarizado de voz limpia, clips de ruido y grabaciones ruidosas sintéticamente mezcladas. Fundamentalmente, desplazó la evaluación de las antiguas matemáticas de señales como PESQ hacia puntuaciones de escucha humana y predictores aprendidos de la calidad percibida. También agregó duras condiciones del mundo real: salas reverberantes, ruidos no estacionarios (mecanografía, perros, sirenas), ruidos tonales y escenarios personalizados donde un modelo debe suprimir a todos excepto a un hablante objetivo inscrito. Al publicar datos, líneas de base y un conjunto de pruebas común, permitió a los laboratorios comparar manzanas con manzanas y aceleró el paso de los trucos de filtrado al aprendizaje profundo de un extremo a otro para mejorar el habla.

Información técnica

Las entradas normalmente alimentan la transformada de Fourier de corta duración de la forma de onda ruidosa en una red recurrente o convolucional que predice una máscara de tiempo-frecuencia. Al multiplicar la máscara por el espectro ruidoso se atenúan los contenedores dominados por el ruido y se preservan los dominados por el habla, luego un STFT inverso reconstruye la forma de onda. Las reglas en tiempo real limitan la latencia algorítmica (alrededor de 40 ms) y requieren procesamiento causal, por lo que los modelos no pueden echar un vistazo al audio futuro al limpiar el cuadro actual.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro del desafío de la supresión del ruido profundo

Espere que el marco se expanda hacia una supresión personalizada y multimodal, donde el movimiento de los labios o la huella de la voz de un hablante guían qué conservar. Los modelos se están reduciendo para funcionar en dispositivos para auriculares y audífonos, y el procesamiento de banda completa de 48 kHz se está convirtiendo en un estándar para que la música y las altas frecuencias sobrevivan. Los enfoques generativos que resintetizan el habla limpia, en lugar de limitarse a enmascarar el ruido, son una frontera activa y a veces controvertida.

Implementación en el mundo real

Eliminación de ruido de fondo en tiempo real en Microsoft Teams y otras aplicaciones de videollamadas

Captura de voz más limpia en auriculares y cascos durante los desplazamientos o en cafeterías concurridas

Preprocesamiento de grabaciones de campo ruidosas antes de la transcripción o subtítulos automáticos

Mejora de la inteligibilidad en audífonos y dispositivos de asistencia auditiva

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Deep Noise Suppression Challenge?

El Desafío de Supresión Profunda de Ruido (DNS) es una competencia organizada por Microsoft que empuja a los investigadores a construir redes neuronales que eliminen el ruido de fondo del habla en tiempo real. Estableció los puntos de referencia modernos que impulsan funciones como Teams y la eliminación de ruido de Zoom.

¿Qué organización lanzó el Desafío de Supresión de Ruido Profundo (DNS)?

Microsoft lanzó el DNS Challenge en 2020 y lo llevó a cabo en lugares como INTERSPEECH e ICASSP.

¿Cuál es el objetivo principal de los sistemas creados para el Desafío DNS?

El desafío tiene como objetivo mejorar el habla en tiempo real, suprimiendo el ruido y preservando al mismo tiempo la voz del hablante.

¿Por qué el procesamiento DNS en tiempo real prohíbe a los modelos utilizar futuras tramas de audio?

La conversación en vivo requiere un procesamiento causal de baja latencia, por lo que el modelo solo puede utilizar audio pasado y actual.

Una técnica común en las entradas DNS es predecir una "máscara". ¿Qué hace la máscara?

Una máscara de tiempo-frecuencia se multiplica por el espectro ruidoso para suprimir los contenedores dominados por el ruido y retener la voz.

¿Cómo cambió el DNS Challenge la forma en que se evalúa la mejora del habla?

El desafío avanzó hacia pruebas de escucha humana y aprendió predictores de calidad perceptiva en lugar de solo matemáticas de señales.