PRZEWODNIK AI audio

Separacja muzyki typu open-unmix

Open-Unmix (UMX) to system głębokiego uczenia się typu open source, który dzieli utwór na części: wokal, perkusję, bas i inne instrumenty.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters as a reproducible, reference-quality baseline that made music source separation accessible to researchers, musicians, and hobbyists.

Głębokie nurkowanie

Wydany w 2019 roku przez Stoter, Uhlich, Liutkus i Mitsufuji, Open-Unmix został celowo zbudowany jako przejrzysty, dobrze udokumentowany punkt odniesienia w PyTorch (z portami TensorFlow i NNabla). Trenuje jeden model na docelowy trzon na spektrogramie wielkości mieszaniny. Rdzeń stanowi trójwarstwowy dwukierunkowy LSTM owinięty w pełni połączonymi warstwami, który przewiduje maskę widmową dla źródła docelowego. Ponieważ działa na skalę, ponownie wykorzystuje fazę mieszaniny i rekonstruuje trzon za pomocą odwrotnej STFT, opcjonalnie rafinowanej za pomocą wielokanałowego filtra Wienera. Trenowany na otwartym zbiorze danych MUSDB18, nie goni za najlepszymi wynikami w rankingach; jego celem jest przejrzystość i powtarzalność, zapewnienie społeczności godnego zaufania punktu porównania i podstawy, na której można budować.

Wgląd techniczny

Każdy rdzeń ma własną sieć działającą na spektrogramie wielkości wejściowej. Przedziały częstotliwości są standaryzowane, a wymiarowość zredukowana przez gęstą warstwę, dwukierunkowy LSTM przechwytuje kontekst czasowy w obu kierunkach, a dalsze gęste warstwy rozszerzają się z powrotem do pełnej rozdzielczości częstotliwościowej, tworząc miękką maskę. Mnożąc maskę przez wielkość mieszaniny, otrzymujemy szacunkowe źródło; oryginalna faza jest ponownie wykorzystywana, a filtr Wienera może wspólnie udoskonalić wszystkie łodygi, aby uzyskać czystsze rezultaty.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość separacji muzyki typu Open-Unmix

Open-Unmix został wyprzedzony pod względem surowej jakości przez modele przebiegów, takie jak Demucs i hybrydowe systemy spektrogram-fala, ale jego rola jako jasnego, możliwego do hackowania odniesienia sprawia, że ​​jest on przydatny w nauczaniu i szybkim prototypowaniu. Należy spodziewać się dalszego wykorzystania w edukacji i jako punktu odniesienia przy sprawdzaniu poprawności, podczas gdy szersza dziedzina zmierza w kierunku separatorów hybrydowych i transformatorowych o wyższej jakości oraz w kierunku oddzielania większej liczby kategorii instrumentów o mniejszym ziarnie.

Implementacja w świecie rzeczywistym

Wyodrębnianie izolowanej ścieżki wokalnej w celu stworzenia wersji karaoke lub instrumentalnej utworu.

Wyciąganie pałeczek perkusyjnych lub basowych w celu remiksowania i samplowania przez producentów.

Służy jako odtwarzalna baza badawcza do oceny nowych modeli separacji na MUSDB18.

Umożliwianie studentom muzyki izolowania jednego instrumentu w celu zbadania jego roli w miksie.

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Unmix Music Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Open-Unmix Music Separation?

Open-Unmix (UMX) to system głębokiego uczenia się typu open source, który dzieli utwór na części: wokal, perkusję, bas i inne instrumenty. Ma to znaczenie jako powtarzalny punkt odniesienia o jakości referencyjnej, dzięki któremu separacja źródeł muzyki jest dostępna dla badaczy, muzyków i hobbystów.

Co robi Open-Unmix?

Open-Unmix to system separacji źródeł muzyki, który dzieli mieszankę na poszczególne ścieżki instrumentów i wokali.

Jaka sieć neuronowa stanowi rdzeń Open-Unmix?

Open-Unmix przewiduje maskę widmową przy użyciu dwukierunkowego LSTM owiniętego w pełni połączonymi warstwami.

Na jakiej reprezentacji działa Open-Unmix?

Działa na spektrogramach wielkości, przewidując maskę i ponownie wykorzystując fazę mieszaniny do rekonstrukcji.

Na jakim zbiorze danych szkolony jest Open-Unmix?

Open-Unmix wykorzystuje otwarty zbiór danych dotyczących separacji muzyki MUSDB18 do szkolenia i oceny.

Jaki był główny cel projektowy Open-Unmix?

Został zbudowany jako jasny, dobrze udokumentowany i powtarzalny punkt odniesienia, a nie najlepiej oceniana czarna skrzynka.