GUIDA AI audio

Separazione delle sorgenti musicali Demucs e HT-Demucs

Demucs è il modello di separazione delle fonti musicali open source di Meta; Hybrid Transformer Demucs (HT-Demucs) divide i brani in voce, batteria, basso e altri gambi utilizzando l'elaborazione della forma d'onda e dello spettrogramma.

2 minuti di letturaUltimo aggiornamento

Immersione profonda

Demucs (Deep Extractor for Music Sources) affronta il classico problema del "un-mixing": recuperare le singole tracce strumentali da una registrazione stereo finale. Le prime versioni utilizzavano un U-Net con dominio della forma d'onda che funzionava direttamente su campioni audio grezzi, preservando le informazioni sulla fase che i metodi dello spettrogramma spesso perdono. Gli Hybrid Demucs ampiamente utilizzati e successivamente Hybrid Transformer Demucs (HT-Demucs) elaborano l'audio simultaneamente sia nel dominio della forma d'onda che in quello dello spettrogramma, quindi li fondono e aggiungono l'attenzione del trasformatore tra domini per modellare la struttura a lungo raggio. Addestrato sul set di dati MUSDB18 più dati extra, Demucs separa un mix in quattro radici (voce, batteria, basso, altro) ed è diventato uno strumento predefinito perché è open source, funziona su GPU consumer e ottiene costantemente punteggi vicini ai massimi livelli nei benchmark di separazione.

Approfondimento tecnico

Hybrid Demucs esegue due rami paralleli di codificatore-decodificatore: uno sulla forma d'onda nel dominio del tempo e uno sullo spettrogramma STFT. Le caratteristiche vengono scambiate tra rami e combinate, quindi il modello sfrutta la fase precisa della forma d'onda e la chiara struttura di frequenza dello spettrogramma. La qualità viene misurata con il rapporto segnale-distorsione (SDR) in decibel sui brani trattenuti. La variante del trasformatore aggiunge attenzione personale e incrociata per catturare il contesto musicale in pochi secondi.

Impatto strategico

Accedere e raggiungere

Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.

Costo e budget

I team media possono fornire audio raffinato più velocemente con budget inferiori.

Velocità e scala

I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.

Il futuro di Demucs e la separazione delle fonti musicali HT-Demucs

La separazione della sorgente si sta spostando verso più stem (separando singole chitarre, pianoforti o anche cantanti specifici), operazioni in tempo reale e sul dispositivo e separazione tramite testo ("isolare il sassofono"). Modelli migliori ridurranno gli artefatti acquosi che appaiono ancora su miscele dense. Man mano che la qualità aumenta, ci si aspetta un'integrazione più profonda nelle DAW, nelle app di karaoke e remix e negli strumenti di educazione musicale, insieme al dibattito in corso sulle implicazioni sul copyright e sul consenso dell'estrazione pulita della voce isolata di qualsiasi artista.

Implementazione nel mondo reale

Produttori e remixer che estraggono acapellali o brani strumentali puliti dalle tracce pubblicate

App karaoke che rimuovono al volo la voce solista per creare tracce di accompagnamento

Musicisti che isolano una linea di basso o un groove di batteria per trascriverli o esercitarsi insieme

Flussi di lavoro di restauro e campionamento audio che necessitano di estrarre uno strumento da un vecchio mix

Rischi e guardrail

I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.

La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.

L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.

Tabella di marcia per l'implementazione

1

Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.

2

Testare la qualità su diversi altoparlanti e condizioni di fondo.

3

Definire quando un essere umano deve rivedere o approvare gli output.

4

Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Demucs and HT-Demucs Music Source Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Separazione musicale Open-Unmix

Domande frequenti

What is Demucs and HT-Demucs Music Source Separation?

Demucs è il modello di separazione delle fonti musicali open source di Meta; Hybrid Transformer Demucs (HT-Demucs) divide i brani in voce, batteria, basso e altri gambi utilizzando l'elaborazione della forma d'onda e dello spettrogramma.

Cosa fa Demucs a una canzone finita?

Demucs esegue la separazione della sorgente musicale, suddividendo un mix stereo in singoli strumenti e radici vocali.

Cosa rende Hybrid Demucs “ibrido”?

Hybrid Demucs combina un ramo della forma d'onda nel dominio del tempo e un ramo dello spettrogramma, fondendo i loro punti di forza.

Quale metrica viene comunemente utilizzata per valutare la qualità della separazione?

L'SDR, misurato in decibel, quantifica la precisione con cui la radice stimata corrisponde alla vera fonte.

Quale organizzazione ha originariamente rilasciato Demucs?

Demucs è stato sviluppato e reso open source dai ricercatori di Meta AI / FAIR.

Perché i primi Demuc lavoravano direttamente sulla forma d'onda grezza?

Operare nel dominio della forma d'onda preserva la fase, che i metodi di ampiezza dello spettrogramma spesso scartano e devono stimare.