PRZEWODNIK AI audio

MusicLM: Hierarchiczne tokeny semantyczne i akustyczne

MusicLM to model zamiany tekstu na muzykę firmy Google, który generuje długie dźwięki poprzez hierarchię tokenów semantycznych określających strukturę muzyczną i tokenów akustycznych określających szczegóły dźwięku.

2 minuty czytaniaOstatnia aktualizacja

Głębokie nurkowanie

Ogłoszone przez zespół badawczy Google na początku 2023 r. narzędzie MusicLM określa generowanie muzyki jako przewidywanie sekwencji dyskretnych tokenów audio, podobnie jak model językowy przewiduje słowa. Wykorzystuje hierarchię reprezentacji: tokeny semantyczne (z modelu o nazwie w2v-BERT) przechwytują strukturę wysokiego poziomu, taką jak melodia i rytm, w długich okresach, podczas gdy tokeny akustyczne (z kodeka neuronowego SoundStream) przechwytują drobne szczegóły, takie jak barwa i tekstura. Pierwszy etap generuje tokeny semantyczne na podstawie podpowiedzi tekstowej, następnie kolejne etapy wypełniają szczegóły akustyczne uwarunkowane tą semantyką. Kondycjonowanie tekstu pochodzi z MuLM/MuLan, wspólnego osadzania muzyki i tekstu, wyszkolonego tak, aby opisy i dźwięk znajdowały się w tej samej przestrzeni. To etapowe podejście pozwala MusicLM zachować spójność muzyczną przez kilka minut, a nie dryfować po kilku sekundach.

Wgląd techniczny

Kluczową ideą jest oddzielenie struktury od tekstury w całej hierarchii tokenów. Zgrubne tokeny semantyczne są rzadkie i wolno się zmieniają, więc Transformator może modelować formę długoterminową bez ogromnej długości sekwencji. Tokeny akustyczne są gęste i charakteryzują się dużą szybkością, ale należy je jedynie przewidzieć w oparciu o już ustaloną semantykę, dzięki czemu każdy etap będzie wykonalny. Kwantyzacja wektorów resztkowych SoundStream tworzy warstwowe kody akustyczne, które końcowy dekoder przekształca z powrotem w kształty fal o częstotliwości 24 kHz.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość muzykiLM: hierarchiczne tokeny semantyczne i akustyczne

Hierarchiczne podejście do tokenów MusicLM stało się szablonem dla późniejszych systemów, takich jak MusicGen i komercyjne narzędzia muzyczne. Spodziewaj się mocniejszego warunkowania melodii (nuć melodię, uzyskaj pełną aranżację), dłuższych, w pełni ustrukturyzowanych utworów ze zwrotkami i refrenami oraz lepszej kontroli nad instrumentami i tonacją. Drażliwe kwestie są prawne i etyczne: obecnie kluczowe znaczenie mają licencjonowanie danych szkoleniowych, zgoda artysty i dźwięk wygenerowany ze znakiem wodnym, umożliwiający odróżnienie go od muzyki stworzonej przez człowieka.

Implementacja w świecie rzeczywistym

Przekształcenie pisemnego opisu sceny w ścieżkę dźwiękową do filmu lub zwiastuna, np. „epicka konstrukcja orkiestrowa z chórem”

Generowanie podkładu muzycznego uzależnionego od podpisu obrazu lub nawet opisów malarskich do instalacji artystycznych

Rozszerzenie krótkiej, nuconej lub gwizdniętej melodii do aranżacji w pełni instrumentalnej

Produkcja różnorodnych utworów muzycznych w różnym tempie i nastrojach dla twórców reklam i treści

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Symboliczne pokolenie muzyki

Często zadawane pytania

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM to model zamiany tekstu na muzykę firmy Google, który generuje długie dźwięki poprzez hierarchię tokenów semantycznych określających strukturę muzyczną i tokenów akustycznych określających szczegóły dźwięku.

Jak MusicLM zasadniczo traktuje zadanie generowania muzyki?

MusicLM określa generowanie muzyki jako przewidywanie autoregresyjne na podstawie dyskretnych tokenów audio, podobnie jak model językowy przewiduje słowa.

Jaka jest rola tokenów semantycznych w MusicLM?

Tokeny semantyczne (z w2v-BERT) przechwytują zgrubną, wolno zmieniającą się strukturę, taką jak melodia i rytm, na długich dystansach.

Który komponent zapewnia doskonałe szczegóły akustyczne, takie jak barwa i faktura?

Tokeny akustyczne pochodzą z kodeka neuronowego SoundStream i kodują drobne szczegóły, takie jak barwa i tekstura.

W jaki sposób MusicLM łączy monit tekstowy z dźwiękiem muzycznym?

MuLan jest przeszkolony w zakresie mapowania opisów tekstowych i pasujących dźwięków do pobliskich punktów we wspólnej przestrzeni osadzania, umożliwiając warunkowanie tekstu.

Dlaczego hierarchiczny, etapowy projekt pomaga w przypadku struktury dalekiego zasięgu?

Rzadkie znaczniki semantyczne zmieniają się powoli, więc Transformer może efektywnie modelować formę długoterminową, zanim zostaną wypełnione gęste szczegóły akustyczne.