GUIDE de l'IA audio

Séparation des sources musicales Demucs et HT-Demucs

Demucs est le modèle open source de séparation des sources musicales de Meta ; Hybrid Transformer Demucs (HT-Demucs) divise les chansons en voix, batterie, basse et autres tiges à l'aide du traitement de forme d'onde et de spectrogramme.

2 minutes de lectureDernière mise à jour

Plongée profonde

Demucs (Deep Extractor for Music Sources) s'attaque au problème classique du « dé-mixage » : récupérer des pistes d'instruments individuelles à partir d'un enregistrement stéréo final. Les premières versions utilisaient un U-Net de domaine de forme d'onde qui fonctionnait directement sur des échantillons audio bruts, préservant les informations de phase que les méthodes de spectrogramme perdent souvent. Les Demucs hybrides largement utilisés et plus tard les Demucs de transformateur hybrides (HT-Demucs) traitent simultanément l'audio dans les domaines de la forme d'onde et du spectrogramme, puis les fusionnent et ajoutent l'attention du transformateur inter-domaines pour modéliser la structure à longue portée. Formé sur l'ensemble de données MUSDB18 ainsi que sur des données supplémentaires, Demucs sépare un mixage en quatre stems (chant, batterie, basse, autres) et est devenu un outil par défaut car il est open source, fonctionne sur des GPU grand public et obtient systématiquement des scores proches du sommet sur les tests de séparation.

Aperçu technique

Hybrid Demucs gère deux branches codeur-décodeur parallèles : une sur la forme d'onde dans le domaine temporel et une sur le spectrogramme STFT. Les caractéristiques sont échangées entre les branches et combinées, de sorte que le modèle exploite la phase précise de la forme d'onde et la structure de fréquence claire du spectrogramme. La qualité est mesurée avec le rapport signal/distorsion (SDR) en décibels sur les chansons diffusées. La variante Transformer ajoute une attention personnelle et croisée pour capturer le contexte musical sur plusieurs secondes.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir de la séparation des sources musicales Demucs et HT-Demucs

La séparation des sources évolue vers davantage de tiges (séparant des guitares individuelles, des pianos ou même des chanteurs spécifiques), un fonctionnement en temps réel et sur l'appareil, et une séparation à l'aide d'un message texte (« isoler le saxophone »). De meilleurs modèles réduiront les artefacts aqueux qui apparaissent encore sur les mélanges denses. À mesure que la qualité augmente, attendez-vous à une intégration plus profonde dans les DAW, les applications de karaoké et de remix et les outils d'éducation musicale, ainsi qu'un débat en cours sur les implications en matière de droits d'auteur et de consentement liées à l'extraction propre de la voix isolée de n'importe quel artiste.

Mise en œuvre dans le monde réel

Producteurs et remixeurs extrayant des acapellas ou des instrumentaux propres à partir de morceaux sortis

Les applications de karaoké suppriment les voix principales à la volée pour créer des pistes d'accompagnement

Musiciens isolant une ligne de basse ou un groove de batterie pour transcrire ou pratiquer avec

Workflows de restauration audio et d'échantillonnage qui doivent extraire un instrument d'un ancien mixage

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Demucs and HT-Demucs Music Source Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Séparation de musique ouverte-unmix

Questions fréquemment posées

What is Demucs and HT-Demucs Music Source Separation?

Demucs est le modèle open source de séparation des sources musicales de Meta ; Hybrid Transformer Demucs (HT-Demucs) divise les chansons en voix, batterie, basse et autres tiges à l'aide du traitement de forme d'onde et de spectrogramme.

Que fait Demucs à une chanson terminée ?

Demucs effectue la séparation des sources musicales, divisant un mixage stéréo en instruments individuels et tiges vocales.

Qu’est-ce qui rend Hybrid Demucs « hybride » ?

Hybrid Demucs combine une branche de forme d'onde dans le domaine temporel et une branche de spectrogramme, fusionnant leurs atouts.

Quelle métrique est couramment utilisée pour évaluer la qualité de la séparation ?

Le SDR, mesuré en décibels, quantifie la précision avec laquelle la tige estimée correspond à la véritable source.

Quelle organisation a initialement publié Demucs ?

Demucs a été développé et open source par des chercheurs de Meta AI / FAIR.

Pourquoi les premiers Demucs travaillaient-ils directement sur la forme d’onde brute ?

Opérer dans le domaine de la forme d'onde préserve la phase, que les méthodes de spectrogramme-magnitude rejettent souvent et doivent estimer.