Audio AI ÚTMUTATÓ

Demucs és HT-Demucs zenei forrás elkülönítése

A Demucs a Meta nyílt forráskódú zenei forrás-elválasztási modellje; A Hybrid Transformer Demucs (HT-Demucs) hullámforma és spektrogram feldolgozás segítségével vokálra, dobra, basszusra és egyéb szárra osztja a dalokat.

2 perc olvasásUtoljára frissítve

Mély merülés

A Demucs (Deep Extractor for Music Sources) megoldja a klasszikus „keverés megszüntetésének” problémáját: az egyes hangszerszámok visszaállítását a végső sztereó felvételről. A korai verziók egy hullámforma-tartományú U-Net-et használtak, amely közvetlenül a nyers hangmintákon dolgozott, és megőrizte a fázisinformációkat, amelyeket a spektrogramos módszerek gyakran elveszítenek. A széles körben használt Hybrid Demucs, majd később a Hybrid Transformer Demucs (HT-Demucs) egyszerre dolgozza fel a hangot mind a hullámforma, mind a spektrogram tartományban, majd egyesíti őket, és a tartományok közötti transzformátorok figyelmét adják hozzá a nagy hatótávolságú struktúra modellezéséhez. A MUSDB18 adatkészletre és extra adatokra kiképzett Demucs négy tőre (ének, dob, basszusgitár, egyéb) osztja szét a keveréket, és alapértelmezett eszközzé vált, mivel nyílt forráskódú, fogyasztói GPU-kon fut, és folyamatosan a csúcspontok közelében ér el az elválasztási benchmarkokban.

Technikai betekintés

A Hybrid Demucs két párhuzamos kódoló-dekódoló ágat futtat: egyet az időtartomány hullámformáján, egyet pedig az STFT spektrogramon. A jellemzőket az ágak között cserélik és kombinálják, így a modell a hullámforma pontos fázisát és a spektrogram tiszta frekvenciastruktúráját használja ki. A minőséget a jel-torzítás aránnyal (SDR) decibelben mérik a kinyújtott dalokon. A transzformátor változat ön- és keresztfigyelést ad a zenei kontextus másodpercek alatti rögzítéséhez.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Demucs jövője és a HT-Demucs zenei források szétválasztása

A források szétválasztása több tőhöz (az egyes gitárok, zongorák vagy akár meghatározott énekesek elkülönítése), a valós idejű és az eszközön történő működés, valamint a szöveges elválasztás ("isolate the saxophone") felé halad. A jobb modellek csökkentik a sűrű keverékeken még mindig megjelenő vizes műtermékeket. A minőség javulásával egyre mélyebb integrációra számíthat a DAW-kbe, a karaoke- és remix-alkalmazásokba, valamint a zenei oktatási eszközökbe, valamint az előadó elszigetelt énekhangjának tisztán kivonatolása szerzői jogi és beleegyezési következményeiről folyó folyamatos vita.

Valós megvalósítás

Producerek és remixerek, akik tiszta acapellákat vagy instrumentálisokat bontanak ki a megjelent számokból

Karaoke-alkalmazások, amelyek menet közben eltávolítják a vezető énekhangokat, hogy háttérszámokat hozzanak létre

Zenészek, akik elszigetelik a basszusvonalat vagy a dob groove-ot, hogy átírják vagy gyakorolják

Hang-helyreállítási és mintavételi munkafolyamatok, amelyeknek ki kell emelniük egy hangszert egy régi keverékből

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Demucs and HT-Demucs Music Source Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Open-Unmix zeneelválasztás

Gyakran ismételt kérdések

What is Demucs and HT-Demucs Music Source Separation?

A Demucs a Meta nyílt forráskódú zenei forrás-elválasztási modellje; A Hybrid Transformer Demucs (HT-Demucs) hullámforma és spektrogram feldolgozás segítségével vokálra, dobra, basszusra és egyéb szárra osztja a dalokat.

Mit csinál Demucs egy kész dallal?

A Demucs a zenei források szétválasztását hajtja végre, a sztereó mixet külön hangszerre és énektövekre bontja.

Mitől „hibrid” a Hybrid Demucs?

A hibrid Demucs egy időtartomány hullámforma ágat és egy spektrogram ágat egyesít, egyesítve ezek erősségeit.

Melyik mérőszámot használják általában az elválasztás minőségének értékelésére?

A decibelben mért SDR számszerűsíti, hogy a becsült szár mennyire pontosan illeszkedik a valódi forráshoz.

Melyik szervezet adta ki eredetileg a Demucsot?

A Demucsot a Meta AI / FAIR kutatói fejlesztették ki és nyitották meg.

Miért dolgozott a korai Demucs közvetlenül a nyers hullámformán?

A hullámforma tartományban való működés megőrzi a fázist, amelyet a spektrogram-nagyságrendű módszerek gyakran elvetnek és meg kell becsülniük.