GUÍA de IA en audio

Difusión del espectrograma de riffusión

Riffusion es un truco inteligente que genera música tratando el sonido como una imagen: ajusta el modelo de imagen de Difusión Estable para pintar espectrogramas y luego convierte esas imágenes nuevamente en audio.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Buceo profundo

Riffusion, lanzado a finales de 2022 por Seth Forsgren y Hayk Martiros, comenzó como un proyecto de hobby. El truco principal: un espectrograma es una imagen 2D donde el eje horizontal es el tiempo, el eje vertical es la frecuencia y el brillo de los píxeles es el volumen. Dado que Stable Diffusion ya genera imágenes a partir de mensajes de texto, los creadores lo ajustaron en miles de ejemplos de texto y espectrograma emparejados. Pídelo con un "bajo funky de jazz" y eliminará el ruido aleatorio en un espectrograma de ese sonido. Para reproducir audio, Riffusion ejecuta el espectrograma a través de un algoritmo Griffin-Lim que reconstruye la información de fase faltante. Debido a que la difusión puede interpolar suavemente entre indicaciones, Riffusion también puede transformar un estilo en otro a lo largo de un clip continuo, realizando un bucle sin interrupciones.

Información técnica

Riffusion reutiliza el canal de difusión latente sin cambios: U-Net elimina iterativamente el ruido gaussiano de una imagen latente condicionada a una incrustación de texto CLIP. El único trabajo específico de dominio es la representación del espectrograma (escala Mel, potencia logarítmica) y la reconstrucción de fase de Griffin-Lim que convierte el espectrograma de magnitud predicha nuevamente en una forma de onda. La fase se descarta durante la codificación, por lo que la estimación iterativa de Griffin-Lim es la fuente principal de los característicos artefactos "acuosos".

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la difusión del espectrograma de riffusión

Riffusion demostró que el puente de espectrograma como imagen funciona, y esa idea ahora vive dentro de sistemas de audio más grandes y en la empresa se convirtió Riffusion. Espere que herramientas futuras reemplacen Griffin-Lim con pérdidas con codificadores de voz neuronales aprendidos para una fase más limpia y combinen la difusión de espectrogramas con códecs de audio latentes. La lección más amplia, que los modelos de imágenes pueden redirigirse a nuevas modalidades, continúa influyendo en la forma en que los investigadores arrancan los generadores de audio y video a partir de redes troncales previamente capacitadas.

Implementación en el mundo real

Generación de pistas de fondo en bucle breve para videojuegos independientes a partir de un mensaje de texto como "persecución tensa de ondas sintéticas"

Transformarse suavemente entre dos estilos musicales, p. mezclando 'house tropical' con 'hip hop lo-fi' en un solo clip

Producción de bases de música ambiental libres de derechos para vídeos y podcasts de YouTube sin pagar licencias

Creación de prototipos de ideas melódicas o rítmicas que luego un músico vuelve a grabar correctamente en una estación de trabajo de audio digital.

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Vocodificador de difusión DiffWave

Preguntas frecuentes

What is Riffusion Spectrogram Diffusion?

Riffusion es un truco inteligente que genera música tratando el sonido como una imagen: ajusta el modelo de imagen de Difusión Estable para pintar espectrogramas y luego convierte esas imágenes nuevamente en audio. Es importante porque muestra que una herramienta creada para un medio (imágenes) puede producir otro (música) casi sin nueva arquitectura.

¿Qué modelo de IA existente afinó Riffusion para generar música?

Riffusion ajustó la difusión estable, un modelo de difusión de imágenes, para generar imágenes de espectrograma que luego se convierten en audio.

¿Qué representa un espectrograma en sus dos ejes?

En un espectrograma, el eje horizontal es el tiempo, el eje vertical es la frecuencia y el brillo representa el volumen.

¿Por qué Riffusion necesita un algoritmo como Griffin-Lim?

El espectrograma almacena la magnitud pero descarta la fase, por lo que Griffin-Lim estima de forma iterativa la fase para reconstruir una forma de onda reproducible.

¿Qué capacidad le da la difusión a Riffusion cuando se combinan dos indicaciones?

Los modelos de difusión pueden interpolar en el espacio latente, permitiendo que Riffusion se transforme continuamente de un estilo musical a otro.

¿Cómo se creó y lanzó originalmente Riffusion?

Riffusion comenzó como un proyecto de hobby de Seth Forsgren y Hayk Martiros, lanzado públicamente a finales de 2022.