GUIDE de l'IA audio

MusiqueGen

MusicGen est le modèle d'IA de Meta qui génère de la musique à partir d'une description textuelle et éventuellement d'une mélodie que vous fredonnez ou téléchargez.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Plongée profonde

Lancé par Meta AI en 2023 dans le cadre du projet AudioCraft, MusicGen transforme des invites comme « un morceau synth-pop optimiste des années 80 avec une ligne de basse entraînante » en clips musicaux d'environ 12 secondes (extensibles). Contrairement aux systèmes à plusieurs étages, MusicGen utilise un modèle de langage Transformer unique qui prédit les jetons audio produits par le codec neuronal EnCodec de Meta. Sa contribution intelligente est un modèle d'entrelacement de jetons (appelé entrelacement de retard) qui permet à un modèle de gérer efficacement les multiples flux de jetons parallèles d'EnCodec, évitant ainsi la cascade de modèles séparés nécessaires aux approches précédentes. MusicGen peut être piloté de deux manières à la fois : par une description textuelle et par une mélodie de référence, vous pouvez donc demander une « version jazz » d'un morceau que vous fredonnez. Meta a publié ouvertement le code et les pondérations, alimentant une vague d'outils et d'expériences communautaires.

Aperçu technique

MusicGen représente l'audio sous forme de flux parallèles de jetons discrets provenant du codec EnCodec, chaque flux capturant des détails différents. Plutôt que de modéliser les flux avec des modèles séparés, MusicGen les entrelace avec des délais contrôlés afin qu'un seul transformateur autorégressif les prédise en un seul passage. Le conditionnement du texte provient d'un encodeur de texte T5, tandis que le conditionnement mélodique en option utilise un chromagramme (le profil de classe de hauteur de l'audio) afin que le modèle suive une mélodie sans copier son enregistrement exact.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir de MusicGen

La version ouverte de MusicGen a établi une référence que les successeurs visent à battre avec une sortie stéréo plus longue, plus haute fidélité, ainsi qu'un contrôle plus fin sur la structure, l'instrumentation et les sections de chansons. Attendez-vous à une intégration plus étroite dans les logiciels de production musicale, à une génération interactive en temps réel et à de meilleurs outils pour éditer ou étendre les pistes existantes. Comme pour toute musique générative, cela aiguise les questions sur les droits d’auteur des données de formation, la rémunération des artistes et la manière d’étiqueter les chansons générées par l’IA dans un marché inondé.

Mise en œuvre dans le monde réel

Générer une musique de fond libre de droits pour une vidéo YouTube à partir d'une invite texte

Fredonner une mélodie et demander à MusicGen un arrangement orchestral complet

Les développeurs de jeux prototypent rapidement des bandes sonores de niveau dans différents genres

Chercheurs et amateurs utilisant des poids open source pour expérimenter la conversion texte-musique

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

What is MusicGen?

MusicGen est le modèle d'IA de Meta qui génère de la musique à partir d'une description textuelle et éventuellement d'une mélodie que vous fredonnez ou téléchargez. C’est important car cela regroupe la création musicale de haute qualité et contrôlable dans un modèle unique et ouvertement publié que les amateurs et les chercheurs peuvent réellement exécuter.

Quels sont les deux types d’apports qui peuvent piloter MusicGen en même temps ?

MusicGen accepte une invite de texte et, éventuellement, une mélodie, afin que vous puissiez demander une version stylistique d'une chanson que vous fournissez.

Quel codec neuronal produit les jetons audio prédits par MusicGen ?

MusicGen modélise les jetons discrets générés par le codec EnCodec de Meta, qui décode également les jetons prédits en audio.

Quelle est la principale simplification architecturale de MusicGen par rapport aux approches précédentes ?

En entrelaçant les flux de jetons parallèles d'EnCodec avec des retards contrôlés, un transformateur autorégressif peut les modéliser en un seul passage, évitant ainsi une cascade de modèles.

Comment MusicGen suit-il une mélodie fournie sans copier l'enregistrement exact ?

Un chromagramme capture les classes de hauteur présentes au fil du temps, permettant à MusicGen d'adapter l'harmonie et le contour de la mélodie sans reproduire le timbre d'origine.

Quel projet et quelle entreprise ont sorti MusicGen ?

MusicGen a été publié en 2023 dans le cadre du projet AudioCraft de Meta AI, avec du code ouvert et des poids de modèle.