GUIDE de l'IA audio

Extension et continuation de la musique AI

L'extension musicale AI utilise un modèle génératif pour continuer un clip audio existant, régénérer une section au milieu (inpainting), la restyler ou ajouter et remplacer des tiges d'instrument individuelles.

  • 4 minutes de lecture
  • Dernière mise à jour
Sur cette page4 minutes de lecture
  1. Aperçu
  2. Plongée profonde
  3. Impact stratégique
  4. L’avenir de l’extension et de la continuation de la musique IA
  5. Mise en œuvre dans le monde réel
  6. Risques et garde-fous
  7. Feuille de route de mise en œuvre
  8. Continuez à explorer
  9. Questions fréquemment posées

Aperçu

Il permet à une courte idée de devenir une piste complète ou à une prise défectueuse d'être réparée sans réenregistrement. C’est important parce que cela change la façon dont les gens rédigent et éditent la musique, mais cela a des limites de qualité claires et ne supprime pas les droits de celui qui possède l’audio original.

Plongée profonde

L'extension prend un clip existant et génère ce qui vient ensuite. Une approche courante est la continuation autorégressive. MusicGen de Meta, sorti en 2023 dans le cadre d'AudioCraft, convertit l'audio en jetons discrets avec un codec neuronal appelé EnCodec et prédit d'autres jetons après ceux que vous fournissez, un peu comme un modèle de langage continue une phrase. Les services grand public tels que Suno et Udio proposent cela sous forme de fonctionnalité Extend, vous permettant généralement de choisir un point de départ et de modifier les paroles ou le style de la nouvelle section. L'inpainting régénère une région masquée au milieu tout en préservant l'audio des deux côtés, utile pour corriger des paroles ou remplacer quatre mesures. Les modèles de diffusion conviennent car l'audio connu peut rester fixe tandis que seule la plage masquée est débruitée. Les modes audio-audio ou remix, comme celui Stability AI introduit avec Stable Audio 2.0 en 2024, ajoutent partiellement du bruit à une entrée et la régénèrent sous une nouvelle invite, afin que la structure survive pendant que le timbre et le style changent. Un paramètre de force contrôle la quantité d’original restant. Le travail des tiges combine séparation et génération. Les modèles de séparation de source tels que Demucs open source de Meta divisent un mixage en voix, batterie, basse et autres ; un générateur peut alors ajouter ou remplacer une pièce conditionnée au reste. Les limites sont réelles. Les longues extensions dérivent : le tempo, la tonalité, l'équilibre du mix et le timbre vocal peuvent varier. Les jointures peuvent cliquer ou sauter en volume. Les modèles voient une fenêtre contextuelle limitée, donc un motif de la première minute peut être oublié. Une idée fausse courante est que le modèle comprend la structure de la chanson comme le fait un musicien ; il correspond à des modèles audio récents. Les droits persistent également : l'extension d'un enregistrement commercial que vous ne possédez pas en crée un dérivé, et les conditions de nombreux services interdisent de télécharger des fichiers audio pour lesquels vous n'avez pas de droits.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L’avenir de l’extension et de la continuation de la musique IA

La recherche s'oriente vers un contexte plus long, une meilleure connaissance de la structure et un contrôle plus précis des tiges individuelles, ce qui devrait réduire la dérive et rendre les modifications au niveau des sections plus prévisibles. L'intégration dans des postes de travail audio numériques est une direction probable, car l'édition au sein d'un projet existant est plus utile que la génération de chansons entières dans un navigateur. La qualité au niveau des coutures et la préservation de l'identité spécifique d'un chanteur restent des problèmes difficiles. Du côté des droits, les accords de filtrage des téléchargements et de licence entre les services et les titulaires de droits sont encore en développement, de sorte que ce que les utilisateurs peuvent légalement étendre dépendra de l'évolution des conditions et des décisions des tribunaux plutôt que de la seule technologie.

Mise en œuvre dans le monde réel

Un auteur-compositeur fredonne une idée de refrain de 20 secondes, la télécharge sur un générateur de musique et utilise une fonction Extend à partir de 0:18 pour produire un couplet et un pont qui se succèdent dans la même tonalité et le même tempo.

Un éditeur de podcast dispose d'un lit musical sous licence de 30 secondes qui est trop court pour l'intro, il génère donc une suite et la fait fondre sur une ligne de mesure pour atteindre 60 secondes.

Un producteur sépare une ancienne démo en voix, batterie, basse et autres stems avec Demucs, coupe le stem de batterie faible et demande à un modèle de générer une nouvelle partie de batterie conditionnée sur les stems restants.

Un groupe peint deux mesures où le chanteur a gonflé des paroles, en gardant intact l'audio des deux côtés, puis vérifie que la voix régénérée sonne toujours comme le même chanteur.

Risques et garde-fous

  • Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

  • La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

  • L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

  1. Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

  2. Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

  3. Définissez quand un humain doit examiner ou approuver les résultats.

  4. Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI Music Extension and Continuation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

Qu’est-ce que l’extension et la continuation de AI Music ?

L'extension musicale AI utilise un modèle génératif pour continuer un clip audio existant, régénérer une section au milieu (inpainting), la restyler ou ajouter et remplacer des tiges d'instrument individuelles. Il permet à une courte idée de devenir une piste complète ou à une prise défectueuse d'être réparée sans réenregistrement. C’est important parce que cela change la façon dont les gens rédigent et éditent la musique, mais cela a des limites de qualité claires et ne supprime pas les droits de celui qui possède l’audio original.

Comment un modèle autorégressif comme MusicGen continue-t-il un clip audio ?

Le clip est converti en jetons discrets et le modèle prédit quels jetons suivront, de la même manière qu'un modèle de langage continue le texte.

Quel codec neuronal MusicGen utilise-t-il pour transformer l'audio en jetons ?

MusicGen s'appuie sur EnCodec, un codec audio neuronal de Meta, pour représenter l'audio sous forme de jetons discrets.

À quoi sert l’inpainting audio ?

L'inpainting remplit ou remplace une étendue sélectionnée, comme des paroles ratées, tout en gardant l'audio environnant intact.

Pourquoi les modèles de diffusion sont-ils bien adaptés à l’inpainting ?

La diffusion peut contraindre les régions connues lors du débruitage, de sorte que seule la section manquante est régénérée pour s'adapter à son environnement.

Dans un mode remix ou audio-audio, que contrôle le réglage de la force ?

Une force plus élevée ajoute plus de bruit et régénère davantage, modifiant davantage l'entrée ; une résistance inférieure conserve une plus grande partie de sa structure.