GHID audio AI

MusicLM: Jetoane semantice și acustice ierarhice

MusicLM este modelul text-to-muzică al Google care generează sunet de formă lungă printr-o ierarhie de simboluri semantice pentru structura muzicală și indicative acustice pentru detaliile sunetului.

2 minute de lecturăUltima actualizare

Scufundare în profunzime

Anunțat de Google Research la începutul anului 2023, MusicLM încadrează generarea muzicii ca și secvențe de predicție de semnale audio discrete, la fel ca un model de limbaj prezice cuvinte. Folosește o ierarhie de reprezentări: jetoanele semantice (de la un model numit w2v-BERT) captează structuri de nivel înalt, cum ar fi melodia și ritmul pe intervale lungi, în timp ce jetoanele acustice (din codecul neural SoundStream) captează detalii fine precum timbrul și textura. O primă etapă generează simboluri semantice din promptul text, apoi etapele ulterioare completează detaliile acustice condiționate de acea semantică. Condiționarea textului provine de la MuLM/MuLan, o încorporare comună muzică-text instruită astfel încât descrierile și audio să ajungă în același spațiu. Această abordare în etape permite MusicLM să rămână consecvent din punct de vedere muzical timp de câteva minute, mai degrabă decât să se deplaseze după câteva secunde.

Perspectivă tehnică

Ideea cheie este decuplarea structurii de textură printr-o ierarhie de simboluri. Tokenurile semantice grosiere sunt rare și se schimbă lent, astfel încât un Transformer poate modela forma pe termen lung fără o lungime mare a secvenței. Tokenurile acustice sunt dense și de mare viteză, dar trebuie doar prezise condiționate de semantica deja fixată, făcând fiecare etapă manevrabilă. Cuantizarea vectorială reziduală a SoundStream produce codurile acustice stratificate pe care un decodor final le transformă înapoi în forme de undă de 24 kHz.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul MusicLM: jetoane semantice și acustice ierarhice

Abordarea ierarhică a simbolurilor MusicLM a devenit un șablon pentru sisteme ulterioare precum MusicGen și instrumente muzicale comerciale. Așteptați-vă la o condiționare a melodiei mai stricte (fredonați o melodie, obțineți un aranjament complet), melodii mai lungi, complet structurate, cu versuri și refrenuri și o mai bună controlabilitate asupra instrumentelor și a tonului. Problemele spinoase sunt legale și etice: acordarea licenței pentru datele de formare, consimțământul artistului și sunetul generat de filigran, astfel încât să poată fi distins de muzica creată de om, sunt acum esențiale pentru implementare.

Implementare în lumea reală

Transformarea unei descrieri scrise a scenei într-o partitură de film sau trailer, de ex. „construcție epică orchestrală cu cor”

Generarea de muzică de fundal condiționată de o legendă a unei imagini sau chiar de pictură de descrieri pentru instalații de artă

Extinderea unei melodii scurte fredonate sau fluierate într-un aranjament complet instrumentat

Producerea de piese variate de muzică stoc la diferite tempo-uri și dispoziții pentru creatorii de publicitate și conținut

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Generația de muzică simbolică

Întrebări frecvente

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM este modelul text-to-muzică al Google care generează sunet de formă lungă printr-o ierarhie de simboluri semantice pentru structura muzicală și indicative acustice pentru detaliile sunetului.

Cum tratează MusicLM în mod fundamental sarcina de a genera muzică?

MusicLM încadrează generarea de muzică ca predicție autoregresivă pe jetoane audio discrete, similar modului în care un model de limbaj prezice cuvinte.

Care este rolul jetoanelor semantice în MusicLM?

Jetoanele semantice (de la w2v-BERT) captează structuri grosiere, care se schimbă lentă, cum ar fi melodia și ritmul pe intervale lungi.

Ce componentă oferă detalii acustice fine, cum ar fi timbrul și textura?

Tokenurile acustice provin din codecul neural SoundStream și codifică detalii fine, cum ar fi timbrul și textura.

Cum conectează MusicLM un mesaj text la sunetul muzical?

MuLan este antrenat astfel încât descrierile de text și potrivirea hărții audio cu punctele din apropiere într-un spațiu de încorporare partajat, permițând condiționarea textului.

De ce designul ierarhic, în etape ajută la structura pe termen lung?

Indicatoarele semantice rare se schimbă lent, astfel încât un transformator poate modela eficient forma pe termen lung înainte de a completa detaliile acustice dense.