Zvukový průvodce AI

Separace stonku spleeter

Spleeter je open-source nástroj od Deezeru, který pomocí hlubokého učení rozděluje hotovou skladbu na samostatné stopy (zpěv, bicí, basa a další).

2 minuty čteníNaposledy aktualizováno

Přehled

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Hluboký ponor

Spleeter, vydaný hudební streamovací společností Deezer v roce 2019, rozděluje smíšenou nahrávku na jednotlivé nástrojové kmeny. Dodává se ve třech předem připravených konfiguracích: 2-kmenový (zpěv plus doprovod), 4-kmenový (zpěv, bicí, basa, další) a 5-kmenový (který přidává klavír). Pod kapotou využívá konvoluční neuronové sítě U-Net, které pracují na zvukovém spektrogramu a předpovídají jemnou masku pro každý zdroj. Vynásobením masky původním spektrogramem a invertováním zpět na zvuk získáme každý kmen. Co udělalo Spleeter slavným, byla rychlost: dokáže oddělit zvuk zhruba 100krát rychleji než v reálném čase na GPU. Je široce používán DJs, remixéry, přepisovači a tvůrci karaoke a vyvolal vlnu konkurenčních separátorů, jako je Demucs.

Technický přehled

Spleeter pracuje v časově-frekvenční doméně. Audio je převedeno na magnitudový spektrogram pomocí Short-Time Fourier Transform (STFT). U-Net (kodér-dekodér s vynechanými připojeními) se pro každý zdroj naučí masku mezi 0 a 1 pro každý časový interval. Maskovaný spektrogram je rekombinován s fází původní směsi, poté inverzní STFT rekonstruuje tvar vlny. Protože odhaduje měkké masky spíše než nezpracovaný zvuk, únik a znovu použitá fáze způsobují artefakty.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost oddělování stonků spleeteru

Novější modely vlnových domén, jako jsou Demucs a hybridní transformátorové separátory, nyní porážejí Spleeter v kvalitě, obnovují ostřejší přechodové jevy a méně artefaktů. Trend směřuje k vyššímu počtu stopek (oddělování jednotlivých kytar nebo doprovodných vokálů), separaci na zařízení v reálném čase v DAW a telefonech a integraci do streamovacích aplikací pro okamžité remixování nebo dostupnost. Spleeter sám o sobě zůstává oblíbeným základem, protože je lehký, bezplatný a snadno ovladatelný, i když výzkum prosazuje fázově orientované a generativní přístupy.

Real-World Implementace

Vytváření okamžitých karaoke skladeb odstraněním hlavního vokálu z komerční písně

DJs a producenti izolují drum nebo bass stonek pro vytváření remixů a mashupů

Studenti hudby extrahují jeden nástrojový řádek, aby jej přepsali a procvičili

Obnova nebo čištění starých nahrávek oddělením a vyvážením zablácených směsí

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Conv-TasNet Time-Domain Separation

Často kladené otázky

What is Spleeter Stem Separation?

Spleeter je open-source nástroj od Deezeru, který pomocí hlubokého učení rozděluje hotovou skladbu na samostatné stopy (zpěv, bicí, basa a další). Díky tomu bylo vysoce kvalitní oddělení stonků rychlé, bezplatné a přístupné komukoli s notebookem.

Která společnost původně vydala Spleeter?

Spleeter byl vydán jako open source v roce 2019 francouzskou hudební streamovací společností Deezer.

Na co rozděluje Spleeterův 4-stopkový model zvuk?

Konfigurace se 4 stopkami vydává vokály, bicí, basu a „jiný“ stopku pro všechno ostatní.

Jakou architekturu neuronové sítě používá Spleeter?

Spleeter používá konvoluční sítě U-Net, které předpovídají masky na spektrogramu zvuku.

Jak vlastně Spleeter extrahuje jeden zdroj ze směsi?

Síť předpovídá masku pro každý zdroj (hodnoty 0 až 1), která se vynásobí spektrogramem směsi.

Jaká je klíčová praktická výhoda, díky které je Spleeter populární?

Spleeter dokáže oddělit zvuk přibližně 100x rychleji než v reálném čase na GPU, takže je rychlý a dostupný.