GUIDE de l'IA audio

MusicLM : jetons sémantiques et acoustiques hiérarchiques

MusicLM est le modèle texte-musique de Google qui génère de l'audio de longue durée via une hiérarchie de jetons sémantiques pour la structure musicale et de jetons acoustiques pour les détails sonores.

2 minutes de lectureDernière mise à jour

Plongée profonde

Annoncé par Google Research début 2023, MusicLM définit la génération de musique comme la prédiction de séquences de jetons audio discrets, un peu comme un modèle de langage prédit des mots. Il utilise une hiérarchie de représentations : les jetons sémantiques (issus d'un modèle appelé w2v-BERT) capturent des structures de haut niveau comme la mélodie et le rythme sur de longues périodes, tandis que les jetons acoustiques (issus du codec neuronal SoundStream) capturent des détails fins comme le timbre et la texture. Une première étape génère des jetons sémantiques à partir de l'invite de texte, puis les étapes ultérieures remplissent les détails acoustiques conditionnés par ces sémantiques. Le conditionnement du texte provient de MuLM/MuLan, un système d'intégration conjoint musique-texte formé de manière à ce que les descriptions et l'audio atterrissent dans le même espace. Cette approche par étapes permet à MusicLM de rester musicalement cohérent pendant quelques minutes plutôt que de dériver après quelques secondes.

Aperçu technique

L'idée clé est de découpler la structure de la texture à travers une hiérarchie de jetons. Les jetons sémantiques grossiers sont rares et évoluent lentement, de sorte qu'un Transformer peut modéliser une forme à long terme sans une longueur de séquence énorme. Les jetons acoustiques sont denses et à débit élevé, mais ils doivent uniquement être prédits en fonction de la sémantique déjà fixée, ce qui rend chaque étape traitable. La quantification vectorielle résiduelle de SoundStream produit les codes acoustiques en couches qu'un décodeur final transforme en formes d'onde de 24 kHz.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir de MusicLM : jetons sémantiques et acoustiques hiérarchiques

L'approche hiérarchique des jetons de MusicLM est devenue un modèle pour des systèmes ultérieurs tels que MusicGen et des outils musicaux commerciaux. Attendez-vous à un conditionnement mélodique plus serré (fredonnez un morceau, obtenez un arrangement complet), à des chansons plus longues et entièrement structurées avec des couplets et des refrains, et à un meilleur contrôle des instruments et des tonalités. Les questions épineuses sont d’ordre juridique et éthique : les licences de données de formation, le consentement de l’artiste et le filigranage de l’audio généré afin de le distinguer de la musique créée par l’homme sont désormais au cœur du déploiement.

Mise en œuvre dans le monde réel

Transformer une description de scène écrite en musique de film ou de bande-annonce, par ex. 'construction orchestrale épique avec chœur'

Générer une musique de fond conditionnée par une légende d'image ou même des descriptions de peinture pour des installations artistiques

Prolonger une courte mélodie fredonnée ou sifflée dans un arrangement entièrement instrumenté

Produire des morceaux de musique d'archives variés à différents tempos et ambiances pour la publicité et les créateurs de contenu

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Génération de musique symbolique

Questions fréquemment posées

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM est le modèle texte-musique de Google qui génère de l'audio de longue durée via une hiérarchie de jetons sémantiques pour la structure musicale et de jetons acoustiques pour les détails sonores.

Comment MusicLM traite-t-il fondamentalement la tâche de génération de musique ?

MusicLM définit la génération de musique comme une prédiction autorégressive sur des jetons audio discrets, de la même manière qu'un modèle de langage prédit les mots.

Quel est le rôle des jetons sémantiques dans MusicLM ?

Les jetons sémantiques (de w2v-BERT) capturent des structures grossières et à évolution lente telles que la mélodie et le rythme sur de longues périodes.

Quel composant fournit les détails acoustiques fins comme le timbre et la texture ?

Les jetons acoustiques proviennent du codec neuronal SoundStream et codent des détails fins tels que le timbre et la texture.

Comment MusicLM connecte-t-il une invite textuelle à l'audio musical ?

MuLan est formé de manière à ce que les descriptions de texte et la correspondance audio correspondent à des points proches dans un espace d'intégration partagé, permettant ainsi le conditionnement du texte.

Pourquoi la conception hiérarchique et par étapes facilite-t-elle la structure à long terme ?

Les jetons sémantiques clairsemés changent lentement, de sorte qu'un Transformer peut modéliser efficacement une forme à long terme avant que les détails acoustiques denses ne soient remplis.