GUÍA de IA en audio

Síntesis de texto a audio AudioGen

AudioGen es un modelo Meta que convierte descripciones de texto en sonidos ambientales y efectos de sonido realistas, como "el perro ladra mientras los pájaros cantan". Es importante porque permite a los creadores generar audio que no sea voz a partir de un lenguaje sencillo, una capacidad que hace tiempo que falta en la IA generativa.

2 minutos de lecturaÚltima actualización

Buceo profundo

AudioGen, lanzado por Meta AI en 2022, es un modelo de lenguaje autorregresivo que genera audio general (efectos de sonido, escenas ambientales, sonidos de animales y objetos) directamente a partir de indicaciones de texto. A diferencia de los sistemas de conversión de texto a voz, se centra en el confuso mundo del sonido cotidiano. Primero comprime audio sin procesar en una secuencia de tokens discretos utilizando un códec neuronal (un codificador automático estilo EnCodec con cuantificación de vector residual). Luego, un modelo de lenguaje Transformer aprende a predecir estos tokens de audio condicionados a una descripción de texto codificada por un codificador de texto independiente. Para mejorar la comprensión de la composición, los autores mezclaron y concatenaron muestras de audio durante el entrenamiento para que el modelo pudiera aprender combinaciones como sonidos superpuestos. Más tarde, AudioGen pasó a formar parte de la biblioteca AudioCraft de Meta junto con el modelo musical MusicGen.

Información técnica

AudioGen tiene dos etapas. Primero, un codificador automático de audio aprende a asignar formas de onda a un flujo compacto de tokens discretos y viceversa. En segundo lugar, se entrena a un Transformer con el objetivo de modelar el lenguaje para predecir el siguiente token de audio dados los tokens anteriores más el acondicionamiento del texto. La guía sin clasificadores y el modelado de libros de códigos de flujos múltiples mejoran la fidelidad y la alineación del texto. Generar audio significa muestrear tokens de forma autorregresiva y luego decodificarlos nuevamente en una forma de onda con el códec.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la síntesis de texto a audio de AudioGen

La conversión de texto a audio avanza hacia frecuencias de muestreo más altas, escenas más largas y coherentes y un control más estricto sobre la sincronización y la ubicación espacial de los sonidos. Espere integración con herramientas de video que agregan automáticamente efectos de sonido coincidentes, herramientas de accesibilidad que describen escenas de manera audible y motores de juegos que sintetizan audio ambiental a pedido. La combinación de modelos de tokens estilo AudioGen con métodos de difusión y codificadores de texto más potentes debería mejorar el realismo, mientras que las herramientas de marcas de agua y procedencia ayudarán a distinguir el sonido sintético del grabado.

Implementación en el mundo real

Generación de Foley y efectos de sonido para películas y juegos a partir de indicaciones de texto.

Creación de paisajes sonoros ambientales (lluvia, tráfico, bosques) para aplicaciones y herramientas de meditación.

Creación de prototipos de audio para proyectos de vídeo sin licencia de bibliotecas de archivo

Producir sonidos personalizados de alerta y notificación descritos en lenguaje sencillo

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioGen Text-to-Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Síntesis de audio diferenciable DDSP

Preguntas frecuentes

What is AudioGen Text-to-Audio Synthesis?

AudioGen es un modelo Meta que convierte descripciones de texto en sonidos ambientales y efectos de sonido realistas, como "el perro ladra mientras los pájaros cantan". Es importante porque permite a los creadores generar audio que no sea voz a partir de un lenguaje sencillo, una capacidad que hace tiempo que falta en la IA generativa.

¿Qué genera principalmente AudioGen?

AudioGen se especializa en audio general no hablado, como sonidos ambientales y efectos producidos a partir de indicaciones de texto.

¿Cuál es la primera etapa en el proceso de AudioGen?

Un codificador automático de códec neuronal comprime el audio sin procesar en tokens discretos que luego el modelo de lenguaje puede predecir.

¿Qué tipo de modelo predice los tokens de audio?

AudioGen utiliza un transformador autorregresivo que predice tokens de audio uno tras otro, condicionados al texto.

¿Por qué los autores mezclaron y concatenaron audio durante el entrenamiento?

El aumento con clips mezclados y concatenados mejoró la capacidad de AudioGen para componer múltiples sonidos descritos juntos en un mensaje.

¿Qué biblioteca Meta más grande incluye AudioGen?

AudioGen es parte de la biblioteca AudioCraft de Meta, que también contiene el modelo MusicGen.