GHID audio AI

Difuzarea spectrogramei de rifuzie

Riffusion este un hack inteligent care generează muzică tratând sunetul ca pe o imagine: ajustează modelul de imagine Stable Diffusion pentru a picta spectrograme, apoi convertește acele imagini înapoi în audio.

2 minute de lecturăUltima actualizare

Prezentare generală

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Scufundare în profunzime

Riffusion, lansat la sfârșitul anului 2022 de Seth Forsgren și Hayk Martiros, a început ca un proiect de hobby. Trucul de bază: o spectrogramă este o imagine 2D în care axa orizontală este timpul, axa verticală este frecvența și luminozitatea pixelilor este volumul. Deoarece Stable Diffusion generează deja imagini din solicitări de text, creatorii l-au ajustat pe mii de exemple pereche spectrogramă-text. Promiteți-l cu „bas funky jazz” și va elimina zgomotul aleatoriu într-o spectrogramă a acelui sunet. Pentru a face un sunet redabil, Riffusion rulează spectrograma printr-un algoritm Griffin-Lim care reconstruiește informațiile de fază lipsă. Deoarece difuzia se poate interpola fără probleme între solicitări, Riffusion poate, de asemenea, transforma un stil într-un altul printr-un clip continuu, făcând buclă fără întreruperi.

Perspectivă tehnică

Riffusion reutiliza conducta de difuzie latentă neschimbată: un U-Net elimină iterativ zgomotul gaussian dintr-o imagine latentă condiționată de încorporarea unui text CLIP. Singura lucrare specifică domeniului este reprezentarea spectrogramei (scara mel, puterea logului) și reconstrucția de fază Griffin-Lim care transformă spectrograma de magnitudine prezisă înapoi într-o formă de undă. Faza este eliminată în timpul codificării, astfel încât estimarea iterativă a lui Griffin-Lim este sursa principală a artefactelor caracteristice „apoase”.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul difuzării spectrogramelor de rifuziune

Riffusion a dovedit că spectrograma ca imagine funcționează, iar această idee trăiește acum în sistemele audio mai mari și a devenit compania Riffusion. Așteptați-vă ca instrumentele viitoare să înlocuiască Griffin-Lim cu pierderi cu vocodere neuronale învățate pentru o fază mai curată și să combine difuzia spectrogramelor cu codecuri audio latente. Lecția mai amplă, aceea că modelele de imagine pot fi redirecționate către noi modalități, continuă să influențeze modul în care cercetătorii pornesc generatoarele audio și video din coloana vertebrală deja pregătită.

Implementare în lumea reală

Generarea de melodii de fundal scurte în buclă pentru jocuri video indie dintr-un mesaj text, cum ar fi „gonita în undă încordată”

Morphing fără probleme între două stiluri muzicale, de ex. amestecând „casă tropicală” cu „hip hop lo-fi” într-un singur clip

Producerea de paturi de muzică ambientală fără drepturi de autor pentru videoclipuri și podcasturi YouTube, fără taxe de licență

Prototiparea ideilor melodice sau ritmice pe care un muzician apoi le reînregistrează corect într-o stație de lucru audio digitală

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

DiffWave Diffusion Vocoder

Întrebări frecvente

What is Riffusion Spectrogram Diffusion?

Riffusion este un hack inteligent care generează muzică tratând sunetul ca pe o imagine: ajustează modelul de imagine Stable Diffusion pentru a picta spectrograme, apoi convertește acele imagini înapoi în audio. Contează pentru că arată că un instrument construit pentru un mediu (imagini) poate produce altul (muzică) fără o arhitectură nouă.

Ce model AI existent a ajustat Riffusion pentru a genera muzică?

Riffusion reglat fin Stable Diffusion, un model de difuzie a imaginii, pentru a genera imagini spectrograme care sunt apoi convertite în audio.

Ce reprezintă o spectrogramă pe cele două axe ale sale?

Într-o spectrogramă axa orizontală este timpul, axa verticală este frecvența, iar luminozitatea reprezintă volumul.

De ce are nevoie Riffusion de un algoritm precum Griffin-Lim?

Spectrograma stochează magnitudinea, dar elimină faza, astfel încât Griffin-Lim estimează iterativ faza pentru a reconstrui o formă de undă redabilă.

Ce capacitate oferă difuzia Riffusion atunci când combinați două prompturi?

Modelele de difuzie se pot interpola în spațiul latent, lăsând Riffusion să se transforme continuu de la un stil muzical la altul.

Cum a fost creat și lansat inițial Riffusion?

Riffusion a început ca un proiect de hobby al lui Seth Forsgren și Hayk Martiros, lansat public la sfârșitul anului 2022.