AudioLM
AudioLM es un marco de investigación Google que genera audio realista (habla o música de piano) al tratar el sonido como un lenguaje y predecirlo token por token.
Descripción general
It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.
Buceo profundo
Introducido por Google en 2022, AudioLM replantea la generación de audio como un problema de modelado del lenguaje: convierte formas de onda sin procesar en tokens discretos y luego predice el siguiente token, tal como un modelo de texto predice la siguiente palabra. Su truco clave es una jerarquía de tipos de tokens. Los tokens 'semánticos' (de un modelo como w2v-BERT) capturan la estructura a largo plazo (fonética, sintaxis, melodía) mientras que los tokens 'acústicos' (del códec neuronal SoundStream) capturan detalles finos como la identidad del hablante, el timbre y las condiciones de grabación. Al predecir primero tokens semánticos y luego condicionar tokens acústicos a ellos, AudioLM produce continuaciones que se mantienen coherentes durante muchos segundos y al mismo tiempo preservan la voz o el instrumento original. Tras unos segundos de discurso, continúa hablando con la misma voz; dado el piano, improvisa en el mismo estilo.
Información técnica
AudioLM se entrena exclusivamente con audio, sin transcripciones. SoundStream comprime el audio en tokens acústicos mediante cuantización de vectores residuales, mientras que w2v-BERT proporciona tokens semánticos gruesos. Una pila de modelos de lenguaje Transformer predice tokens en etapas: primero semántico para la estructura, luego tokens acústicos gruesos y finos para la reconstrucción de alta fidelidad. El decodificador de SoundStream finalmente convierte los tokens predichos nuevamente en una forma de onda, produciendo un audio que mantiene consistente la voz y la prosodia del hablante.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro de AudioLM
La receta basada en tokens de AudioLM se convirtió en la base de sistemas posteriores: las ideas de AudioLM de Google se incorporaron a MusicLM para la conversión de texto a música y a SoundStorm para una generación más rápida, mientras que el campo más amplio ahora combina tokens semánticos y acústicos en el habla, la música y los efectos de sonido. Espere una generación más rápida en tiempo real, salidas coherentes más largas y control multimodal donde el texto u otras señales dirigen modelos puramente entrenados en audio. Las mismas técnicas también aumentan las preocupaciones sobre la clonación de voces y las falsificaciones de audio.
Implementación en el mundo real
Continuación de un breve fragmento de discurso con la misma voz y entonación del orador sin transcripción
Improvisar nueva música de piano que coincida con el estilo de un breve mensaje grabado.
Sirviendo como columna vertebral de generación de audio para sistemas de conversión de texto a música como MusicLM
Investigación sobre síntesis del habla que preserva la prosodia y la grabación acústica a partir de una muestra.
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Detección de palabras clave y palabras de activación
Preguntas frecuentes
What is AudioLM?
AudioLM es un marco de investigación Google que genera audio realista (habla o música de piano) al tratar el sonido como un lenguaje y predecirlo token por token. Es importante porque demostró que se pueden producir continuaciones de audio coherentes y con un sonido natural sin ninguna transcripción de texto ni partitura musical.
¿Qué idea central utiliza AudioLM para generar audio?
AudioLM convierte formas de onda en tokens discretos y las predice secuencialmente, aplicando el enfoque del siguiente token de los modelos de lenguaje al sonido sin procesar.
¿Cuál es el papel de los tokens "semánticos" en AudioLM?
Los tokens semánticos (de w2v-BERT) codifican estructura y coherencia de alto nivel, mientras que los tokens acústicos manejan detalles de audio finos.
¿Qué códec neuronal produce los tokens acústicos de AudioLM?
SoundStream utiliza cuantificación de vector residual para comprimir audio en tokens acústicos y luego decodifica los tokens predichos nuevamente en una forma de onda.
¿Qué requiere AudioLM como datos de entrenamiento?
Una característica notable es que AudioLM entrena exclusivamente con audio sin etiquetas de texto, aprendiendo la estructura directamente del sonido.
¿Por qué AudioLM predice tokens semánticos antes que tokens acústicos?
Generar primero una estructura aproximada mantiene la salida coherente a lo largo del tiempo; Luego, las fichas acústicas se condicionan a esa estructura para agregar detalles de alta fidelidad.