GUÍA de IA en audio

Códec neuronal SoundStream

SoundStream es el códec de audio neuronal de extremo a extremo de Google que comprime la voz y la música a velocidades de bits extremadamente bajas y al mismo tiempo preserva la calidad.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Buceo profundo

Introducido por Google en 2021, SoundStream es un códec totalmente neuronal construido a partir de tres piezas entrenadas juntas: un codificador convolucional que convierte la forma de onda sin procesar en una secuencia compacta de vectores, un cuantificador de vector residual (RVQ) que discretiza esos vectores y un decodificador convolucional que reconstruye la forma de onda. Está entrenado tanto con pérdidas de reconstrucción como con un discriminador adversario estilo GAN, por lo que la salida suena natural en lugar de simplemente numéricamente cercana. Una característica destacada es el entrenamiento "escalable" o de abandono del cuantificador: un solo modelo puede operar a velocidades de bits de aproximadamente 3 a 18 kbps simplemente usando más o menos capas de cuantificador en la inferencia, sin reentrenamiento. A 3 kbps, supuestamente supera al Opus a 12 kbps en pruebas de escucha, manejo de voz, música y audio en general en un modelo que puede ejecutarse en tiempo real en la CPU de un teléfono inteligente.

Información técnica

La forma de onda pasa a través de convoluciones escalonadas que reducen mucho la resolución, produciendo una incrustación por cuadro (por ejemplo, 75 cuadros/segundo). Luego, RVQ codifica cada incorporación como una pila de índices de libros de códigos. La tasa de bits es igual a la velocidad de fotogramas multiplicada por el número de cuantificadores activos multiplicada por bits por libro de códigos. La caída del cuantificador trunca aleatoriamente la pila RVQ durante el entrenamiento, lo que obliga a los libros de códigos anteriores a contener la información más importante para que el códec se degrade elegantemente a velocidades más bajas.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro del códec neuronal SoundStream

SoundStream estableció la plantilla que códecs posteriores como EnCodec y DAC refinaron, y sus tokens discretos se convirtieron en el sustrato para sistemas generativos como AudioLM y MusicLM. Espere que los descendientes avancen hacia velocidades de bits aún más bajas, tokens estructurados semánticamente que funcionan como entradas para generadores de audio de estilo modelo de lenguaje y una implementación más estricta en el dispositivo para llamadas en vivo, audífonos y streaming donde el ancho de banda y la latencia están estrictamente limitados.

Implementación en el mundo real

Comprime las llamadas de voz a ~3 kbps y suena más claro que los códecs heredados a velocidades de bits más altas.

Generación de tokens de audio discretos que alimentan los modelos generativos AudioLM y MusicLM de Google

Transmisión de audio en tiempo real con bajo ancho de banda en dispositivos móviles con codificación y decodificación en la CPU

Almacenar o transmitir música y sonido ambiental de manera eficiente en un solo modelo que maneja todo tipo de contenido

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Códecs de audio neuronales

Preguntas frecuentes

What is SoundStream Neural Codec?

SoundStream es el códec de audio neuronal de extremo a extremo de Google que comprime la voz y la música a velocidades de bits extremadamente bajas y al mismo tiempo preserva la calidad. Es importante porque supera a los códecs tradicionales como Opus con la misma tasa de bits y potencia los modelos de audio generativo modernos.

¿Qué tres componentes componen la arquitectura SoundStream?

SoundStream se construye a partir de un codificador convolucional, un cuantificador de vector residual que discretiza las incrustaciones y un decodificador convolucional, todos entrenados de extremo a extremo.

¿Qué técnica permite que un único modelo SoundStream ofrezca muchas velocidades de bits diferentes sin necesidad de volver a entrenar?

Durante el entrenamiento, SoundStream elimina aleatoriamente capas de cuantificador para que, en la inferencia, pueda usar más o menos niveles de RVQ para alcanzar diferentes velocidades de bits de un modelo.

En las pruebas de escucha de Google, ¿qué códec a 12 kbps superó a SoundStream a 3 kbps?

SoundStream a solo 3 kbps igualó o superó al códec Opus ampliamente utilizado que funciona a 12 kbps en evaluaciones de calidad subjetiva.

¿Qué tipo de señal de entrenamiento adicional utiliza SoundStream para que la salida suene natural?

Más allá de las pérdidas de reconstrucción, SoundStream utiliza discriminadores adversarios (GAN) para que las reconstrucciones suenen perceptualmente realistas en lugar de simplemente numéricamente cercanas.

¿Cómo se relaciona la tasa de bits de SoundStream con sus cuantificadores?

La tasa de bits aumenta con el número de capas RVQ activas (multiplicada por la velocidad de cuadros por bits por libro de códigos), por lo que agregar cuantificadores aumenta la tasa de bits y la calidad.