PRZEWODNIK AI audio

MusicGen

MusicGen to model sztucznej inteligencji Meta, który generuje muzykę na podstawie opisu tekstowego i opcjonalnie melodii, którą nucisz lub przesyłasz.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Głębokie nurkowanie

Wydany przez Meta AI w 2023 roku w ramach projektu AudioCraft, MusicGen zamienia podpowiedzi takie jak „optymistyczny utwór synth-pop z lat 80. z porywającą linią basu” w około 12-sekundowe (z możliwością przedłużenia) klipy muzyczne. W przeciwieństwie do systemów wieloetapowych MusicGen wykorzystuje pojedynczy model języka Transformer, który przewiduje tokeny audio wytwarzane przez kodek neuronowy EnCodec firmy Meta. Jego sprytnym wkładem jest wzorzec przeplatania tokenów (zwany przeplataniem opóźnionym), który pozwala jednemu modelowi efektywnie obsługiwać wiele równoległych strumieni tokenów EnCodeca, unikając kaskady oddzielnych modeli potrzebnych wcześniej. MusicGen można sterować na dwa sposoby jednocześnie: za pomocą opisu tekstowego i melodii referencyjnej, dzięki czemu możesz poprosić o „wersję jazzową” nuconej przez siebie melodii. Meta otwarcie udostępnił kod i wagi, podsycając falę narzędzi i eksperymentów społeczności.

Wgląd techniczny

MusicGen reprezentuje dźwięk jako równoległe strumienie dyskretnych tokenów z kodeka EnCodec, przy czym każdy strumień przechwytuje inne szczegóły. Zamiast modelować strumienie za pomocą oddzielnych modeli, MusicGen przeplata je z kontrolowanymi opóźnieniami, dzięki czemu pojedynczy transformator autoregresyjny przewiduje je w jednym przebiegu. Kondycjonowanie tekstu odbywa się za pomocą kodera tekstu T5, natomiast opcjonalne kondycjonowanie melodii wykorzystuje chromatogram (profil klasy wysokości dźwięku), dzięki czemu model podąża za melodią bez kopiowania dokładnego nagrania.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość muzykiGen

Otwarte wydanie MusicGen wyznaczyło punkt odniesienia, który następcy mają na celu pobić dłuższym, wierniejszym dźwiękiem i wyjściem stereo, a także lepszą kontrolą nad strukturą, instrumentacją i sekcjami utworów. Oczekuj ściślejszej integracji z oprogramowaniem do produkcji muzyki, interaktywnego generowania w czasie rzeczywistym i lepszych narzędzi do edycji lub rozszerzania istniejących utworów. Podobnie jak w przypadku każdej muzyki generatywnej, stawia ona pytania dotyczące praw autorskich do danych szkoleniowych, wynagrodzeń artystów i sposobu oznaczania utworów wygenerowanych przez sztuczną inteligencję na zalanym rynku.

Implementacja w świecie rzeczywistym

Generowanie bezpłatnej muzyki w tle do filmu YouTube z podpowiedzi tekstowej

Nucenie melodii i proszenie MusicGen o pełną aranżację orkiestrową

Twórcy gier szybko prototypują ścieżki dźwiękowe różnych gatunków

Naukowcy i hobbyści korzystający z oprogramowania typu open source w celu eksperymentowania z zamianą tekstu na muzykę

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is MusicGen?

MusicGen to model sztucznej inteligencji Meta, który generuje muzykę na podstawie opisu tekstowego i opcjonalnie melodii, którą nucisz lub przesyłasz. Ma to znaczenie, ponieważ łączy wysokiej jakości, kontrolowane tworzenie muzyki w jeden, otwarcie udostępniany model, z którego mogą korzystać hobbyści i badacze.

Jakie dwa rodzaje danych wejściowych mogą jednocześnie sterować MusicGen?

MusicGen akceptuje podpowiedzi tekstowe i opcjonalnie melodię, więc możesz poprosić o stylistyczną wersję dostarczonego utworu.

Który kodek neuronowy generuje tokeny audio przewidywane przez MusicGen?

MusicGen modeluje dyskretne tokeny generowane przez kodek EnCodec firmy Meta, który również dekoduje przewidywane tokeny z powrotem na dźwięk.

Jakie jest kluczowe uproszczenie architektoniczne MusicGen w porównaniu z wcześniejszymi podejściami?

Przeplatając równoległe strumienie tokenów EnCodeca z kontrolowanymi opóźnieniami, jeden transformator autoregresyjny może modelować je w jednym przebiegu, unikając kaskady modeli.

W jaki sposób MusicGen podąża za dostarczoną melodią bez kopiowania dokładnego nagrania?

Chromagram rejestruje, które klasy wysokości dźwięku są obecne w czasie, umożliwiając MusicGen dopasowanie harmonii i konturu utworu bez odtwarzania oryginalnej barwy.

Który projekt i firma wydała MusicGen?

MusicGen został wydany w 2023 roku jako część projektu AudioCraft Meta AI, z otwartym kodem i wagami modeli.