MusicGen
MusicGen ist das KI-Modell von Meta, das Musik aus einer Textbeschreibung und optional einer Melodie, die Sie summen oder hochladen, generiert.
Übersicht
It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.
Tiefer Einblick
MusicGen wurde 2023 von Meta AI als Teil des AudioCraft-Projekts veröffentlicht und verwandelt Aufforderungen wie „einen peppigen 80er-Jahre-Synthesizer-Pop-Track mit einer treibenden Bassline“ in etwa 12 Sekunden lange (erweiterbare) Musikclips. Im Gegensatz zu mehrstufigen Systemen verwendet MusicGen ein einziges Transformer-Sprachmodell, das Audio-Tokens vorhersagt, die vom neuronalen Codec EnCodec von Meta erzeugt werden. Sein cleverer Beitrag ist ein Token-Interleaving-Muster (Delay-Interleaving genannt), das es einem Modell ermöglicht, die mehreren parallelen Token-Streams von EnCodec effizient zu verarbeiten und so die Kaskade separater Modelle zu vermeiden, die frühere Ansätze erforderten. MusicGen kann auf zwei Arten gleichzeitig gesteuert werden: durch eine Textbeschreibung und durch eine Referenzmelodie, sodass Sie nach einer „Jazz-Version“ einer Melodie fragen können, die Sie summen. Meta veröffentlichte den Code und die Gewichte offen und löste damit eine Welle von Community-Tools und Experimenten aus.
Technischer Einblick
MusicGen stellt Audio als parallele Streams diskreter Token vom EnCodec-Codec dar, wobei jeder Stream unterschiedliche Details erfasst. Anstatt Streams mit separaten Modellen zu modellieren, verschachtelt MusicGen sie mit kontrollierten Verzögerungen, sodass ein einzelner autoregressiver Transformer sie in einem Durchgang vorhersagt. Die Textkonditionierung erfolgt über einen T5-Textencoder, während die optionale Melodiekonditionierung ein Chromagramm (das Tonhöhenklassenprofil des Audios) verwendet, sodass das Modell einer Melodie folgt, ohne deren genaue Aufnahme zu kopieren.
Strategische Auswirkungen
Zugang und Erreichbarkeit
Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.
Kosten und Budget
Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.
Geschwindigkeit und Umfang
Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.
Die Zukunft von MusicGen
Mit der offenen Veröffentlichung von MusicGen wurde ein Grundstein gelegt, den die Nachfolger mit längerer Ausgabe mit höherer Wiedergabetreue und Stereoausgabe sowie einer feineren Kontrolle über Struktur, Instrumentierung und Songabschnitte übertreffen wollen. Erwarten Sie eine engere Integration in Musikproduktionssoftware, interaktive Echtzeitgenerierung und bessere Tools zum Bearbeiten oder Erweitern vorhandener Titel. Wie bei jeder generativen Musik wirft es Fragen zum Urheberrecht an Trainingsdaten, zur Künstlervergütung und zur Kennzeichnung von KI-generierten Songs auf einem überfluteten Markt auf.
Reale Umsetzung
Generieren von lizenzfreier Hintergrundmusik für ein YouTube-Video aus einer Textaufforderung
Eine Melodie summen und MusicGen um ein komplettes Orchesterarrangement davon bitten
Spieleentwickler erstellen schnell Prototypen für Soundtracks auf Niveauniveau in verschiedenen Genres
Forscher und Hobbyisten nutzen die Open-Source-Software, um mit Text-zu-Musik zu experimentieren
Risiken und Leitplanken
Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.
Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.
Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.
Implementierungs-Roadmap
Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.
Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.
Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.
Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MusicGen quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Zwangsausrichtung
Häufig gestellte Fragen
What is MusicGen?
MusicGen ist das KI-Modell von Meta, das Musik aus einer Textbeschreibung und optional einer Melodie, die Sie summen oder hochladen, generiert. Es ist wichtig, weil es hochwertige, kontrollierbare Musikproduktion in einem einzigen, offen veröffentlichten Modell vereint, das von Hobbyisten und Forschern tatsächlich ausgeführt werden kann.
Welche zwei Arten von Eingaben können MusicGen gleichzeitig steuern?
MusicGen akzeptiert eine Textaufforderung und optional eine Melodie, sodass Sie eine stilistische Version einer von Ihnen bereitgestellten Melodie anfordern können.
Welcher neuronale Codec erzeugt die von MusicGen vorhergesagten Audio-Tokens?
MusicGen modelliert diskrete Token, die vom EnCodec-Codec von Meta generiert werden, der die vorhergesagten Token auch wieder in Audio dekodiert.
Was ist die wichtigste architektonische Vereinfachung von MusicGen gegenüber früheren Ansätzen?
Durch die Verschachtelung der parallelen Tokenströme von EnCodec mit kontrollierten Verzögerungen kann ein autoregressiver Transformer sie in einem einzigen Durchgang modellieren und so eine Kaskade von Modellen vermeiden.
Wie folgt MusicGen einer bereitgestellten Melodie, ohne die genaue Aufnahme zu kopieren?
Ein Chromagramm erfasst, welche Tonhöhenklassen im Laufe der Zeit vorhanden sind, sodass MusicGen die Harmonie und Kontur der Melodie anpassen kann, ohne die ursprüngliche Klangfarbe zu reproduzieren.
Welches Projekt und welches Unternehmen hat MusicGen veröffentlicht?
MusicGen wurde 2023 als Teil des AudioCraft-Projekts von Meta AI mit offenem Code und Modellgewichten veröffentlicht.