Separacja źródeł muzyki Demucs i HT-Demucs
Demucs to model separacji źródeł muzyki typu open source firmy Meta; Hybrid Transformer Demucs (HT-Demucs) dzieli utwory na ścieżki wokalne, perkusyjne, basowe i inne, korzystając z przetwarzania przebiegów i spektrogramów.
Głębokie nurkowanie
Demucs (Deep Extractor for Music Sources) rozwiązuje klasyczny problem „un-miksowania”: odzyskiwanie poszczególnych ścieżek instrumentów z końcowego nagrania stereo. Wczesne wersje wykorzystywały sieć U-Net w domenie przebiegów, która działała bezpośrednio na surowych próbkach audio, zachowując informacje o fazie, które często tracą metody spektrogramowe. Szeroko stosowane hybrydowe demuki, a później hybrydowe demuki transformatorowe (HT-Demucs), przetwarzają dźwięk jednocześnie w domenie przebiegu i spektrogramu, a następnie łączą je i dodają uwagę transformatora międzydomenowego w celu modelowania struktury dalekiego zasięgu. Wyszkolony na zestawie danych MUSDB18 i dodatkowych danych, Demucs dzieli miks na cztery ścieżki (wokal, perkusja, bas i inne) i stał się narzędziem domyślnym, ponieważ jest narzędziem typu open source, działa na konsumenckich procesorach graficznych i konsekwentnie osiąga prawie najlepsze wyniki w testach separacji.
Wgląd techniczny
Hybrid Demucs obsługuje dwie równoległe gałęzie kodera-dekodera: jedną na przebiegu w dziedzinie czasu i jedną na spektrogramie STFT. Funkcje są wymieniane między gałęziami i łączone, dzięki czemu model wykorzystuje precyzyjną fazę przebiegu i przejrzystą strukturę częstotliwościową spektrogramu. Jakość mierzona jest za pomocą współczynnika sygnału do zniekształcenia (SDR) w decybelach w przypadku odtwarzanych utworów. Wariant transformatora dodaje samouważności i uwagi, aby uchwycić kontekst muzyczny w ciągu kilku sekund.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość separacji źródeł muzyki Demucs i HT-Demucs
Separacja źródeł zmierza w kierunku większej liczby pni (oddzielenie poszczególnych gitar, fortepianów, a nawet konkretnych wokalistów), operacji w czasie rzeczywistym i na urządzeniu oraz separacji wyświetlanej za pomocą tekstu („izolowanie saksofonu”). Lepsze modele zmniejszą wodniste artefakty, które nadal pojawiają się w gęstych mieszankach. Wraz ze wzrostem jakości można spodziewać się głębszej integracji z programami DAW, aplikacjami do karaoke i remiksów oraz narzędziami do edukacji muzycznej, a także trwającej debaty na temat konsekwencji związanych z prawami autorskimi i zgodą czystego wydobywania izolowanego wokalu dowolnego artysty.
Implementacja w świecie rzeczywistym
Producenci i remikserzy wydobywający czyste acapelle lub instrumenty z wydanych utworów
Aplikacje do karaoke na bieżąco usuwają główny wokal i tworzą podkłady
Muzycy izolujący linię basu lub rytm perkusyjny w celu transkrypcji lub ćwiczeń
Procesy przywracania dźwięku i próbkowania, które wymagają wydobycia jednego instrumentu ze starego miksu
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Separacja muzyki typu open-unmix
Często zadawane pytania
Co to jest separacja źródeł muzyki Demucs i HT-Demucs?
Demucs to model separacji źródeł muzyki typu open source firmy Meta; Hybrid Transformer Demucs (HT-Demucs) dzieli utwory na ścieżki wokalne, perkusyjne, basowe i inne, korzystając z przetwarzania przebiegów i spektrogramów.
Co Demucs robi z gotową piosenką?
Demucs wykonuje separację źródeł muzyki, dzieląc miks stereo na poszczególne ścieżki instrumentów i wokali.
Co sprawia, że Hybrid Demucs jest „hybrydowy”?
Hybrydowy Demucs łączy gałąź fali w dziedzinie czasu i gałąź spektrogramu, łącząc ich mocne strony.
Który wskaźnik jest powszechnie używany do oceny jakości separacji?
SDR, mierzony w decybelach, określa ilościowo, jak dokładnie oszacowany rdzeń odpowiada prawdziwemu źródłu.
Która organizacja pierwotnie wydała Demucs?
Demucs został opracowany i udostępniony na zasadach open source przez badaczy z Meta AI / FAIR.
Dlaczego wczesne Demuki pracowały bezpośrednio na surowym przebiegu?
Działanie w domenie przebiegu zachowuje fazę, którą metody spektrogramu często odrzucają i muszą oszacować.