GUIDA AI audio

Separazione dello stelo spleeter

Spleeter è uno strumento open source di Deezer che divide una canzone finita in tracce separate (voce, batteria, basso e altro) utilizzando il deep learning.

2 minuti di letturaUltimo aggiornamento

Panoramica

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Immersione profonda

Spleeter, pubblicato dalla società di streaming musicale Deezer nel 2019, separa una registrazione mista in gambi di singoli strumenti. Viene fornito in tre configurazioni pre-addestrate: 2 gambi (voce più accompagnamento), 4 gambi (voce, batteria, basso, altro) e 5 gambi (che aggiunge pianoforte). Sotto il cofano utilizza le reti neurali convoluzionali U-Net che operano sullo spettrogramma dell'audio, prevedendo una maschera morbida per ciascuna sorgente. Moltiplicando la maschera per lo spettrogramma originale e convertendola nuovamente in audio si ottiene ciascuna radice. Ciò che ha reso famoso Spleeter è stata la velocità: può separare l'audio circa 100 volte più velocemente del tempo reale su una GPU. È ampiamente utilizzato da DJ, remixer, trascrittori e produttori di karaoke e ha scatenato un'ondata di separatori concorrenti come Demucs.

Approfondimento tecnico

Spleeter lavora nel dominio tempo-frequenza. L'audio viene convertito in uno spettrogramma di magnitudine tramite la trasformata di Fourier a breve termine (STFT). Un U-Net (codificatore-decodificatore con connessioni skip) apprende, per sorgente, una maschera compresa tra 0 e 1 per ogni contenitore tempo-frequenza. Lo spettrogramma mascherato viene ricombinato con la fase della miscela originale, quindi una STFT inversa ricostruisce la forma d'onda. Poiché stima le maschere morbide anziché l'audio grezzo, le perdite e la fase riutilizzata causano artefatti.

Impatto strategico

Accedere e raggiungere

Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.

Costo e budget

I team media possono fornire audio raffinato più velocemente con budget inferiori.

Velocità e scala

I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.

Il futuro della separazione dello stelo della spleeter

I modelli più recenti di dominio della forma d'onda come Demucs e separatori di trasformatori ibridi ora battono Spleeter in termini di qualità, recuperando transitori più nitidi e meno artefatti. La tendenza è verso un numero maggiore di stem (separazione di singole chitarre o cori), separazione sul dispositivo in tempo reale in DAW e telefoni e integrazione in app di streaming per remix o accessibilità istantanei. Lo stesso Spleeter rimane una base di riferimento popolare perché è leggero, gratuito e facile da gestire, anche se la ricerca spinge verso approcci generativi e consapevoli delle fasi.

Implementazione nel mondo reale

Creazione di tracce karaoke istantanee rimuovendo la voce solista da una canzone commerciale

DJ e produttori isolano un gambo di batteria o basso per creare remix e mashup

Studenti di musica che estraggono una singola linea strumentale per trascriverla ed esercitarsi insieme

Ripristino o pulizia di vecchie registrazioni separando e riequilibrando miscele fangose

Rischi e guardrail

I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.

La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.

L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.

Tabella di marcia per l'implementazione

1

Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.

2

Testare la qualità su diversi altoparlanti e condizioni di fondo.

3

Definire quando un essere umano deve rivedere o approvare gli output.

4

Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Separazione del dominio temporale Conv-TasNet

Domande frequenti

What is Spleeter Stem Separation?

Spleeter è uno strumento open source di Deezer che divide una canzone finita in tracce separate (voce, batteria, basso e altro) utilizzando il deep learning. Ha reso la separazione degli steli di alta qualità veloce, gratuita e accessibile a chiunque abbia un laptop.

Quale azienda ha originariamente rilasciato Spleeter?

Spleeter è stato rilasciato come open source nel 2019 da Deezer, la società francese di streaming musicale.

In cosa separa l'audio il modello a 4 radici di Spleeter?

La configurazione a 4 steli emette voce, batteria, basso e un "altro" stelo per tutto il resto.

Quale architettura di rete neurale utilizza Spleeter?

Spleeter utilizza le reti convoluzionali U-Net che prevedono le maschere sullo spettrogramma dell'audio.

In che modo Spleeter estrae effettivamente una singola fonte dal mix?

La rete prevede una maschera per sorgente (valori da 0 a 1) che viene moltiplicata con lo spettrogramma della miscela.

Qual è un vantaggio pratico chiave che ha reso popolare Spleeter?

Spleeter può separare l'audio circa 100 volte più velocemente del tempo reale su una GPU, rendendolo veloce e accessibile.