PRZEWODNIK AI audio

Separacja źródeł muzyki Demucs i HT-Demucs

Demucs to model separacji źródeł muzyki typu open source firmy Meta; Hybrid Transformer Demucs (HT-Demucs) dzieli utwory na ścieżki wokalne, perkusyjne, basowe i inne, korzystając z przetwarzania przebiegów i spektrogramów.

2 minuty czytaniaOstatnia aktualizacja

Głębokie nurkowanie

Demucs (Deep Extractor for Music Sources) rozwiązuje klasyczny problem „un-miksowania”: odzyskiwanie poszczególnych ścieżek instrumentów z końcowego nagrania stereo. Wczesne wersje wykorzystywały sieć U-Net w domenie przebiegów, która działała bezpośrednio na surowych próbkach audio, zachowując informacje o fazie, które często tracą metody spektrogramowe. Szeroko stosowane hybrydowe demuki, a później hybrydowe demuki transformatorowe (HT-Demucs), przetwarzają dźwięk jednocześnie w domenie przebiegu i spektrogramu, a następnie łączą je i dodają uwagę transformatora międzydomenowego w celu modelowania struktury dalekiego zasięgu. Wyszkolony na zestawie danych MUSDB18 i dodatkowych danych, Demucs dzieli miks na cztery ścieżki (wokal, perkusja, bas i inne) i stał się narzędziem domyślnym, ponieważ jest narzędziem typu open source, działa na konsumenckich procesorach graficznych i konsekwentnie osiąga prawie najlepsze wyniki w testach separacji.

Wgląd techniczny

Hybrid Demucs obsługuje dwie równoległe gałęzie kodera-dekodera: jedną na przebiegu w dziedzinie czasu i jedną na spektrogramie STFT. Funkcje są wymieniane między gałęziami i łączone, dzięki czemu model wykorzystuje precyzyjną fazę przebiegu i przejrzystą strukturę częstotliwościową spektrogramu. Jakość mierzona jest za pomocą współczynnika sygnału do zniekształcenia (SDR) w decybelach w przypadku odtwarzanych utworów. Wariant transformatora dodaje samouważności i uwagi, aby uchwycić kontekst muzyczny w ciągu kilku sekund.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość separacji źródeł muzyki Demucs i HT-Demucs

Separacja źródeł zmierza w kierunku większej liczby pni (oddzielenie poszczególnych gitar, fortepianów, a nawet konkretnych wokalistów), operacji w czasie rzeczywistym i na urządzeniu oraz separacji wyświetlanej za pomocą tekstu („izolowanie saksofonu”). Lepsze modele zmniejszą wodniste artefakty, które nadal pojawiają się w gęstych mieszankach. Wraz ze wzrostem jakości można spodziewać się głębszej integracji z programami DAW, aplikacjami do karaoke i remiksów oraz narzędziami do edukacji muzycznej, a także trwającej debaty na temat konsekwencji związanych z prawami autorskimi i zgodą czystego wydobywania izolowanego wokalu dowolnego artysty.

Implementacja w świecie rzeczywistym

Producenci i remikserzy wydobywający czyste acapelle lub instrumenty z wydanych utworów

Aplikacje do karaoke na bieżąco usuwają główny wokal i tworzą podkłady

Muzycy izolujący linię basu lub rytm perkusyjny w celu transkrypcji lub ćwiczeń

Procesy przywracania dźwięku i próbkowania, które wymagają wydobycia jednego instrumentu ze starego miksu

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Demucs and HT-Demucs Music Source Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Separacja muzyki typu open-unmix

Często zadawane pytania

Co to jest separacja źródeł muzyki Demucs i HT-Demucs?

Demucs to model separacji źródeł muzyki typu open source firmy Meta; Hybrid Transformer Demucs (HT-Demucs) dzieli utwory na ścieżki wokalne, perkusyjne, basowe i inne, korzystając z przetwarzania przebiegów i spektrogramów.

Co Demucs robi z gotową piosenką?

Demucs wykonuje separację źródeł muzyki, dzieląc miks stereo na poszczególne ścieżki instrumentów i wokali.

Co sprawia, że Hybrid Demucs jest „hybrydowy”?

Hybrydowy Demucs łączy gałąź fali w dziedzinie czasu i gałąź spektrogramu, łącząc ich mocne strony.

Który wskaźnik jest powszechnie używany do oceny jakości separacji?

SDR, mierzony w decybelach, określa ilościowo, jak dokładnie oszacowany rdzeń odpowiada prawdziwemu źródłu.

Która organizacja pierwotnie wydała Demucs?

Demucs został opracowany i udostępniony na zasadach open source przez badaczy z Meta AI / FAIR.

Dlaczego wczesne Demuki pracowały bezpośrednio na surowym przebiegu?

Działanie w domenie przebiegu zachowuje fazę, którą metody spektrogramu często odrzucają i muszą oszacować.