GUÍA de IA en audio

Eliminación de ruido del habla con RNNoise

RNNoise es una red neuronal pequeña y rápida que elimina el ruido de fondo del habla en tiempo real.

2 minutos de lecturaÚltima actualización

Descripción general

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Buceo profundo

RNNoise, lanzado en 2017, fue diseñado para la supresión de ruido de baja latencia en llamadas de voz. En lugar de aprender todo de un extremo a otro, divide el habla en aproximadamente 22 bandas de frecuencia modeladas en el oído humano (una escala similar a la de Bark) y utiliza una red neuronal recurrente con unidades recurrentes cerradas para estimar una ganancia (0 a 1) para cada banda por cuadro. Esas ganancias atenúan las bandas ruidosas y mantienen intactas las bandas dominadas por el habla. Un filtro de tono complementario limpia el ruido residual entre los armónicos del habla sonora. Todo el modelo tiene aproximadamente 85.000 pesos, se ejecuta más rápido que en tiempo real en un solo núcleo de CPU y es de código abierto bajo una licencia BSD, razón por la cual se integró en proyectos como el ecosistema de códecs Opus, Mumble y OBS Studio.

Información técnica

La elección de diseño clave es operar con ganancias de banda perceptivas en lugar de contenedores espectrales sin procesar. Al predecir solo ~22 valores de ganancia por cuadro, la red GRU permanece pequeña y evita artefactos de ruido musical comunes en métodos de sustracción espectral más antiguos. Las características hechas a mano (energías de banda, período de tono, correlación de tono) alimentan la red, combinando el conocimiento de DSP con el aprendizaje. Una salida de actividad de voz separada ayuda a controlar las ganancias durante cuadros de ruido puro.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la eliminación de ruido del habla con RNNoise

RNNoise inspiró una ola de trabajos de mejora livianos en tiempo real; su investigación sucesora (PercepNet, DeepFilterNet) aumenta la calidad manteniendo pequeños los presupuestos de CPU. Espere que los eliminadores de ruido se incrusten directamente en auriculares, audífonos y chips de conferencia, se combinen con cancelación de eco y desreverberación, y utilicen objetivos perceptivos e incluso generativos. La receta híbrida DSP más red pequeña sigue siendo influyente allí donde la baja latencia, el bajo consumo y las licencias de código abierto importan más que el tamaño del modelo en bruto.

Implementación en el mundo real

Suprimir el ruido del teclado y el zumbido del ventilador durante las videollamadas en aplicaciones que incluyen RNNoise.

Limpiar el micrófono de un transmisor en OBS Studio mediante el filtro de supresión de ruido RNNoise incorporado.

Mejorar la inteligibilidad del chat de voz en juegos y herramientas VoIP como Mumble en hardware de bajo consumo.

Preprocesar grabaciones de campo ruidosas para que el reconocimiento de voz posterior obtenga una señal más limpia.

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

La separación de discursos y el problema del cóctel

Preguntas frecuentes

What is Speech Denoising with RNNoise?

RNNoise es una red neuronal pequeña y rápida que elimina el ruido de fondo del habla en tiempo real. Creado por Jean-Marc Valin de Xiph.Org, combina el procesamiento de señales clásico con una pequeña red recurrente para que se ejecute en CPU normales e incluso en dispositivos integrados.

¿Qué predice principalmente RNNoise para cada cuadro corto de audio?

RNNoise estima ganancias por banda que atenúan las bandas dominadas por el ruido y al mismo tiempo preservan las dominadas por la voz, en lugar de trabajar en cada contenedor espectral.

¿Qué tipo de red neuronal se encuentra en el núcleo de RNNoise?

RNNoise utiliza una red neuronal recurrente compacta construida con unidades recurrentes cerradas, lo que le proporciona memoria temporal sin dejar de ser pequeña.

¿Por qué RNNoise utiliza bandas de frecuencia de percepción en lugar de contenedores espectrales sin procesar?

Predecir solo ~22 ganancias de banda mantiene la red pequeña, rápida y menos propensa a los artefactos de ruido musical que afectan a los métodos por contenedor.

¿Aproximadamente qué tamaño tiene el modelo RNNoise?

RNNoise tiene del orden de 85.000 pesos, lo suficientemente pequeños como para ejecutarse más rápido que en tiempo real en un solo núcleo de CPU.

¿Cuál es la función del filtro de tono en RNNoise?

Un filtro de peine/tono explota la estructura armónica del habla sonora para suprimir el ruido que se encuentra entre los armónicos, complementando las ganancias de la banda.