Audio AI-GIDS

Riffusie Spectrogram Diffusie

Riffusion is een slimme hack die muziek genereert door geluid als een beeld te behandelen: het verfijnt het Stable Diffusion-beeldmodel om spectrogrammen te schilderen en zet die beelden vervolgens weer om in audio.

2 min readLaatst bijgewerkt

Overzicht

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Diepe duik

Riffusion, eind 2022 uitgebracht door Seth Forsgren en Hayk Martiros, begon als een hobbyproject. De kerntruc: een spectrogram is een 2D-beeld waarbij de horizontale as de tijd is, de verticale as de frequentie en de pixelhelderheid de luidheid. Omdat Stable Diffusion al afbeeldingen genereert op basis van tekstprompts, hebben de makers het verfijnd op basis van duizenden gepaarde spectrogram-tekstvoorbeelden. Roep het op met 'funky jazz bass' en het ontleedt willekeurige ruis tot een spectrogram van dat geluid. Om afspeelbare audio te maken, voert Riffusion het spectrogram door een Griffin-Lim-algoritme dat de ontbrekende fase-informatie reconstrueert. Omdat diffusie soepel tussen prompts kan interpoleren, kan Riffusion ook de ene stijl in de andere veranderen via een doorlopende clip, die naadloos in een lus loopt.

Technisch inzicht

Riffusie hergebruikt de latente diffusiepijplijn onveranderd: een U-Net verwijdert iteratief Gaussiaanse ruis uit een latent beeld dat is geconditioneerd op een CLIP-tekstinbedding. Het enige domeinspecifieke werk is de spectrogramrepresentatie (mel-schaal, logvermogen) en de Griffin-Lim-fasereconstructie die het voorspelde magnitudespectrogram weer in een golfvorm omzet. Fase wordt tijdens het coderen weggegooid, dus de iteratieve schatting van Griffin-Lim is de belangrijkste bron van de karakteristieke 'waterige' artefacten.

Strategische impact

Access and reach

Het verbetert de toegankelijkheid via transcriptie, gesproken tekst en spraakinterfaces.

Cost and budget

Mediateams kunnen met kleinere budgetten sneller gepolijste audio leveren.

Speed and scale

Klantgerichte systemen kunnen gesproken interacties op grotere schaal verwerken.

De toekomst van riffusiespectrogramdiffusie

Riffusion bewees dat de spectrogram-als-beeldbrug werkt, en dat idee leeft nu voort in grotere audiosystemen en het bedrijf Riffusion werd dat. Verwacht toekomstige tools om verliesgevende Griffin-Lim te vervangen door aangeleerde neurale vocoders voor een schonere fase, en om spectrogramdiffusie te combineren met latente audiocodecs. De bredere les, dat beeldmodellen kunnen worden omgeleid naar nieuwe modaliteiten, blijft van invloed op de manier waarop onderzoekers audio- en videogeneratoren opstarten vanuit bestaande, vooraf getrainde backbones.

Implementatie in de echte wereld

Korte looping-achtergrondtracks genereren voor indie-videogames vanaf een tekstprompt zoals 'tense synthwave chase'

Soepel schakelen tussen twee muziekstijlen, b.v. 'tropical house' versmelten met 'lo-fi hiphop' in één clip

Het produceren van royaltyvrije sfeermuziekbedden voor YouTube-video's en podcasts zonder licentiekosten

Het prototypen van melodische of ritmische ideeën die een muzikant vervolgens opnieuw opneemt in een digitaal audiowerkstation

Risico's en vangrails

Het risico op stemmisbruik en imitatie neemt toe als de toestemming ontbreekt.

De nauwkeurigheid kan afnemen bij accenten, dialecten of luidruchtige omgevingen.

Synthetische audio kan worden aangezien voor authentieke spraak zonder duidelijke labels.

Implementatie routekaart

1

Verkrijg expliciete toestemming voor het vastleggen, klonen en hergebruiken van spraak.

2

Test de kwaliteit van diverse sprekers en achtergrondomstandigheden.

3

Bepaal wanneer een mens de output moet beoordelen of goedkeuren.

4

Label synthetische audio en houd de herkomstgegevens bij voor verantwoording.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

DiffWave Diffusie Vocoder

Frequently asked questions

What is Riffusion Spectrogram Diffusion?

Riffusion is een slimme hack die muziek genereert door geluid als een beeld te behandelen: het verfijnt het Stable Diffusion-beeldmodel om spectrogrammen te schilderen en zet die beelden vervolgens weer om in audio. Het is belangrijk omdat het laat zien dat een hulpmiddel dat voor het ene medium (beelden) is gebouwd, een ander medium (muziek) kan produceren met vrijwel geen nieuwe architectuur.

Welk bestaande AI-model heeft Riffusion verfijnd om muziek te genereren?

Riffusie heeft Stable Diffusion, een beelddiffusiemodel, verfijnd om spectrogrambeelden te genereren die vervolgens naar audio worden omgezet.

Wat vertegenwoordigt een spectrogram op zijn twee assen?

In een spectrogram is de horizontale as de tijd, de verticale as de frequentie en vertegenwoordigt de helderheid de luidheid.

Waarom heeft Riffusion een algoritme als Griffin-Lim nodig?

Het spectrogram slaat de magnitude op, maar negeert de fase, dus schat Griffin-Lim iteratief de fase om een ​​speelbare golfvorm opnieuw op te bouwen.

Welke mogelijkheden biedt diffusie Riffusion bij het samenvoegen van twee prompts?

Diffusiemodellen kunnen interpoleren in de latente ruimte, waardoor Riffusie voortdurend van de ene muziekstijl naar de andere verandert.

Hoe werd Riffusion oorspronkelijk gemaakt en uitgebracht?

Riffusion begon als een hobbyproject van Seth Forsgren en Hayk Martiros en werd eind 2022 publiekelijk uitgebracht.