Riffusionsspektrogramm-Diffusion
Riffusion ist ein cleverer Hack, der Musik erzeugt, indem er Ton als Bild behandelt: Er optimiert das Stable Diffusion-Bildmodell, um Spektrogramme zu zeichnen, und wandelt diese Bilder dann wieder in Audio um.
Übersicht
It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.
Tiefer Einblick
Riffusion, Ende 2022 von Seth Forsgren und Hayk Martiros veröffentlicht, begann als Hobbyprojekt. Der Kerntrick: Ein Spektrogramm ist ein 2D-Bild, bei dem die horizontale Achse die Zeit, die vertikale Achse die Frequenz und die Pixelhelligkeit die Lautstärke darstellt. Da Stable Diffusion bereits Bilder aus Texteingabeaufforderungen generiert, haben die Entwickler es anhand Tausender gepaarter Spektrogramm-Textbeispiele verfeinert. Wenn Sie es mit „Funky Jazz Bass“ auffordern, werden zufällige Geräusche in ein Spektrogramm dieses Klangs umgewandelt. Um abspielbares Audio zu erstellen, führt Riffusion das Spektrogramm durch einen Griffin-Lim-Algorithmus, der die fehlenden Phaseninformationen rekonstruiert. Da Diffusion reibungslos zwischen Eingabeaufforderungen interpolieren kann, kann Riffusion auch über einen kontinuierlichen Clip hinweg einen Stil in einen anderen verwandeln und nahtlos in einer Schleife ablaufen.
Technischer Einblick
Riffusion verwendet die latente Diffusionspipeline unverändert wieder: Ein U-Net entfernt iterativ Gaußsches Rauschen aus einem latenten Bild, das auf einer CLIP-Texteinbettung basiert. Die einzige domänenspezifische Arbeit ist die Spektrogrammdarstellung (Mel-Skala, logarithmische Leistung) und die Griffin-Lim-Phasenrekonstruktion, die das vorhergesagte Größenspektrogramm wieder in eine Wellenform umwandelt. Die Phase wird während der Kodierung verworfen, daher ist die iterative Schätzung von Griffin-Lim die Hauptquelle für die charakteristischen „wässerigen“ Artefakte.
Strategische Auswirkungen
Zugang und Erreichbarkeit
Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.
Kosten und Budget
Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.
Geschwindigkeit und Umfang
Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.
Die Zukunft der Riffusionsspektrogrammdiffusion
Riffusion hat bewiesen, dass die Spektrogramm-als-Bild-Brücke funktioniert, und diese Idee lebt heute in größeren Audiosystemen und dem Unternehmen, zu dem Riffusion wurde, weiter. Erwarten Sie, dass zukünftige Tools verlustbehaftetes Griffin-Lim durch erlernte neuronale Vocoder für eine sauberere Phase ersetzen und Spektrogrammdiffusion mit latenten Audio-Codecs kombinieren. Die umfassendere Erkenntnis, dass Bildmodelle auf neue Modalitäten umgeleitet werden können, beeinflusst weiterhin die Art und Weise, wie Forscher Audio- und Videogeneratoren aus vorhandenen vortrainierten Backbones booten.
Reale Umsetzung
Generieren kurzer Hintergrund-Looping-Tracks für Indie-Videospiele aus einer Textaufforderung wie „Tense Synthwave Chase“
Reibungsloser Übergang zwischen zwei Musikstilen, z.B. In einem einzigen Clip vermischt er „Tropical House“ mit „Lo-Fi-Hip-Hop“.
Produktion lizenzfreier Ambient-Musikbetten für YouTube-Videos und Podcasts ohne Lizenzgebühren
Prototyping melodischer oder rhythmischer Ideen, die ein Musiker dann ordnungsgemäß in einer digitalen Audio-Workstation neu aufnimmt
Risiken und Leitplanken
Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.
Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.
Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.
Implementierungs-Roadmap
Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.
Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.
Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.
Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Riffusion Spectrogram Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
DiffWave-Diffusions-Vocoder
Häufig gestellte Fragen
What is Riffusion Spectrogram Diffusion?
Riffusion ist ein cleverer Hack, der Musik erzeugt, indem er Ton als Bild behandelt: Er optimiert das Stable Diffusion-Bildmodell, um Spektrogramme zu zeichnen, und wandelt diese Bilder dann wieder in Audio um. Das ist wichtig, weil es zeigt, dass ein Werkzeug, das für ein Medium (Bilder) entwickelt wurde, fast ohne neue Architektur ein anderes (Musik) produzieren kann.
Welches bestehende KI-Modell hat Riffusion verfeinert, um Musik zu generieren?
Riffusion hat Stable Diffusion, ein Bilddiffusionsmodell, verfeinert, um Spektrogrammbilder zu erzeugen, die dann in Audio umgewandelt werden.
Was stellt ein Spektrogramm auf seinen beiden Achsen dar?
In einem Spektrogramm ist die horizontale Achse die Zeit, die vertikale Achse die Frequenz und die Helligkeit die Lautstärke.
Warum braucht Riffusion einen Algorithmus wie Griffin-Lim?
Das Spektrogramm speichert die Größe, verwirft jedoch die Phase, sodass Griffin-Lim die Phase iterativ schätzt, um eine abspielbare Wellenform wiederherzustellen.
Welche Möglichkeiten bietet die Diffusion Riffusion beim Mischen zweier Eingabeaufforderungen?
Diffusionsmodelle können im latenten Raum interpolieren, sodass sich Riffusion kontinuierlich von einem Musikstil zum anderen verändern kann.
Wie wurde Riffusion ursprünglich erstellt und veröffentlicht?
Riffusion begann als Hobbyprojekt von Seth Forsgren und Hayk Martiros und wurde Ende 2022 öffentlich veröffentlicht.