GUIDE de l'IA audio

Spectrogramme de Riffusion Diffusion

Riffusion est un hack intelligent qui génère de la musique en traitant le son comme une image : il affine le modèle d'image Stable Diffusion pour peindre des spectrogrammes, puis reconvertit ces images en audio.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Plongée profonde

Riffusion, sorti fin 2022 par Seth Forsgren et Hayk Martiros, a démarré comme un projet de loisir. L'astuce principale : un spectrogramme est une image 2D où l'axe horizontal est le temps, l'axe vertical est la fréquence et la luminosité des pixels est le volume. Étant donné que Stable Diffusion génère déjà des images à partir d’invites de texte, les créateurs l’ont peaufiné sur des milliers d’exemples de spectrogramme-texte couplés. Invitez-le avec « funky jazz bass » et il débruite le bruit aléatoire en un spectrogramme de ce son. Pour rendre l'audio lisible, Riffusion exécute le spectrogramme via un algorithme Griffin-Lim qui reconstruit les informations de phase manquantes. Parce que la diffusion peut interpoler en douceur entre les invites, Riffusion peut également transformer un style en un autre sur un clip continu, en boucle de manière transparente.

Aperçu technique

Riffusion réutilise le pipeline de diffusion latente sans modification : un U-Net supprime de manière itérative le bruit gaussien d'une image latente conditionnée par l'intégration de texte CLIP. Le seul travail spécifique au domaine est la représentation du spectrogramme (échelle mel, puissance log) et la reconstruction de phase Griffin-Lim qui transforme le spectrogramme d'amplitude prédit en une forme d'onde. La phase est ignorée lors du codage, de sorte que l'estimation itérative de Griffin-Lim est la principale source des artefacts « aqueux » caractéristiques.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L’avenir de la diffusion de spectrogrammes de Riffusion

Riffusion a prouvé que le pont spectrogramme-image fonctionne, et cette idée perdure désormais dans des systèmes audio plus grands et la société Riffusion est devenue. Attendez-vous à ce que les futurs outils remplacent Griffin-Lim avec perte par des vocodeurs neuronaux appris pour une phase plus propre et combinent la diffusion de spectrogramme avec des codecs audio latents. La leçon plus large, à savoir que les modèles d'images peuvent être redirigés vers de nouvelles modalités, continue d'influencer la manière dont les chercheurs amorcent les générateurs audio et vidéo à partir des réseaux fédérateurs pré-entraînés existants.

Mise en œuvre dans le monde réel

Génération de courtes pistes de fond en boucle pour les jeux vidéo indépendants à partir d'une invite de texte telle que « chasse tendue synthwave »

Morphing fluide entre deux styles musicaux, par ex. mélangeant la « house tropicale » et le « hip hop lo-fi » dans un seul clip

Produire des lits de musique d'ambiance libres de droits pour les vidéos et podcasts YouTube sans frais de licence

Prototypage d'idées mélodiques ou rythmiques qu'un musicien réenregistre ensuite correctement dans une station de travail audio numérique

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Vocodeur de diffusion DiffWave

Questions fréquemment posées

What is Riffusion Spectrogram Diffusion?

Riffusion est un hack intelligent qui génère de la musique en traitant le son comme une image : il affine le modèle d'image Stable Diffusion pour peindre des spectrogrammes, puis reconvertit ces images en audio. C’est important car cela montre qu’un outil conçu pour un support (les images) peut en produire un autre (la musique) sans pratiquement aucune nouvelle architecture.

Quel modèle d’IA existant Riffusion a-t-il peaufiné pour générer de la musique ?

Riffusion a affiné Stable Diffusion, un modèle de diffusion d'images, pour générer des images de spectrogramme qui sont ensuite converties en audio.

Que représente un spectrogramme sur ses deux axes ?

Dans un spectrogramme, l'axe horizontal représente le temps, l'axe vertical la fréquence et la luminosité représente le volume.

Pourquoi Riffusion a-t-il besoin d'un algorithme comme Griffin-Lim ?

Le spectrogramme stocke l'amplitude mais ignore la phase, donc Griffin-Lim estime la phase de manière itérative pour reconstruire une forme d'onde jouable.

Quelle capacité la diffusion donne-t-elle à Riffusion lors du mélange de deux invites ?

Les modèles de diffusion peuvent s'interpoler dans un espace latent, permettant à Riffusion de se transformer continuellement d'un style musical à un autre.

Comment Riffusion a-t-il été créé et publié à l’origine ?

Riffusion a commencé comme un projet de loisir de Seth Forsgren et Hayk Martiros, rendu public fin 2022.