GHID audio AI

Separarea tulpinii spleeterului

Spleeter este un instrument open-source de la Deezer care împarte o melodie terminată în piese separate (voce, tobe, bas și multe altele) folosind deep learning.

2 minute de lecturăUltima actualizare

Prezentare generală

A făcut ca separarea tijilor de înaltă calitate să fie rapidă, gratuită și accesibilă oricui are un laptop.

Scufundare în profunzime

Spleeter, lansat de compania de streaming muzical Deezer în 2019, separă o înregistrare mixtă în instrumente individuale. Se livrează în trei configurații pre-antrenate: 2-stem (voce plus acompaniament), 4-stem (voce, tobe, bas, altele) și 5-stem (care adaugă pian). Sub capotă folosește rețele neuronale convoluționale U-Net care operează pe spectrograma audio, prezicând o mască moale pentru fiecare sursă. Înmulțirea măștii cu spectrograma originală și inversarea înapoi la audio produce fiecare tulpină. Ceea ce l-a făcut celebru pe Spleeter a fost viteza: poate separa sunetul de aproximativ 100 de ori mai rapid decât în ​​timp real pe un GPU. Este utilizat pe scară largă de DJ, remixeri, transcrieri și producători de karaoke și a declanșat un val de separatori concurenti precum Demucs.

Perspectivă tehnică

Spleeter funcționează în domeniul timp-frecvență. Audio este convertit într-o spectrogramă de magnitudine prin transformarea Fourier de scurtă durată (STFT). Un U-Net (encoder-decodor cu conexiuni ignorate) învață, pe sursă, o mască între 0 și 1 pentru fiecare bin timp-frecvență. Spectrograma mascata este recombinată cu faza amestecului original, apoi un STFT invers reconstruiește forma de undă. Deoarece estimează măștile moi decât sunetul brut, scurgerile și faza reutilizată cauzează artefacte.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul separării tulpinilor Spleeter

Modelele mai noi cu domeniul formei de undă, cum ar fi Demucs și separatoarele de transformatoare hibride, îl înving acum pe Spleeter din punct de vedere al calității, recuperând tranzitorii mai clare și mai puține artefacte. Tendința este către un număr mai mare de stem (separarea chitarelor individuale sau a sunetelor vocale), separarea în timp real de pe dispozitiv în DAW și telefoane și integrarea în aplicațiile de streaming pentru remixare instantanee sau accesibilitate. Spleeter în sine rămâne o bază populară, deoarece este ușor, gratuit și ușor de rulat, chiar dacă cercetarea împinge abordări conștiente și generative.

Implementare în lumea reală

Crearea de piese de karaoke instantanee prin eliminarea vocii principale dintr-o melodie comercială

DJ și producători care izolează o tulpină de tobe sau bass pentru a construi remixuri și mashup-uri

Studenții de muzică extrag o singură linie de instrument pentru a transcrie și a exersa împreună

Restaurarea sau curățarea înregistrărilor vechi prin separarea și reechilibrarea amestecurilor noroioase

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Conv-TasNet Separare timp-domeniu

Întrebări frecvente

Ce este separarea tulpinilor Spleeter?

Spleeter este un instrument open-source de la Deezer care împarte o melodie terminată în piese separate (voce, tobe, bas și multe altele) folosind deep learning. A făcut separarea tulpinilor de înaltă calitate rapidă, gratuită și accesibilă oricui are un laptop.

Ce companie a lansat inițial Spleeter?

Spleeter a fost lansat ca sursă deschisă în 2019 de Deezer, compania franceză de streaming muzical.

În ce separă sunetul modelul cu 4 tije al lui Spleeter?

Configurația cu 4 stem emite voce, tobe, bas și o „altă” stem pentru orice altceva.

Ce arhitectură de rețea neuronală folosește Spleeter?

Spleeter folosește rețele convoluționale U-Net care prezic măști pe spectrograma audio.

Cum extrage de fapt Spleeter o singură sursă din amestec?

Rețeaua prezice o mască per sursă (valori de la 0 la 1) care este înmulțită cu spectrograma amestecului.

Care este un avantaj practic cheie care a făcut ca Spleeter să fie popular?

Spleeter poate separa sunetul de aproximativ 100 de ori mai rapid decât în ​​timp real pe un GPU, făcându-l rapid și accesibil.