Audio AI GUIDE

MusicLM: Hierarkiske semantiske og akustiske tokens

MusicLM er Googles tekst-til-musikk-modell som genererer lyd i lang form gjennom et hierarki av semantiske tokens for musikalsk struktur og akustiske tokens for lyddetaljer.

2 min lesingSist oppdatert

Dypdykk

Annonsert av Google Research tidlig i 2023, rammer MusicLM musikkgenerering som å forutsi sekvenser av diskrete lydtokens, omtrent som en språkmodell forutsier ord. Den bruker et hierarki av representasjoner: semantiske tokens (fra en modell kalt w2v-BERT) fanger opp høynivåstruktur som melodi og rytme over lange spenn, mens akustiske tokens (fra SoundStream nevrale kodeken) fanger fine detaljer som klang og tekstur. Et første trinn genererer semantiske tokens fra tekstmeldingen, deretter fyller senere stadier ut akustiske detaljer avhengig av denne semantikken. Tekstkondisjonering kommer fra MuLM/MuLan, en felles musikk-tekst-innbygging trent slik at beskrivelser og lyd lander på samme plass. Denne iscenesatte tilnærmingen lar MusicLM holde seg musikalsk konsistent over minutter i stedet for å drive etter noen få sekunder.

Teknisk innsikt

Nøkkelideen er å frikoble struktur fra tekstur på tvers av et symbolhierarki. Grove semantiske tokens er sparsomme og skiftende sakte, så en transformator kan modellere langsiktig form uten en enorm sekvenslengde. Akustiske tokens er tette og høyhastighets, men de trenger bare å bli forutsagt avhengig av den allerede faste semantikken, noe som gjør hvert trinn overkommelig. SoundStreams restvektorkvantisering produserer de lagdelte akustiske kodene som en endelig dekoder gjør tilbake til 24 kHz-bølgeformer.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

The Future of MusicLM: Hierarkiske semantiske og akustiske tokens

MusicLMs hierarkiske token-tilnærming ble en mal for senere systemer som MusicGen og kommersielle musikkverktøy. Forvent strammere melodikondisjonering (nynne en melodi, få et fullt arrangement), lengre fullt strukturerte sanger med vers og refrenger, og bedre kontrollerbarhet over instrumenter og tonearter. De vanskelige problemene er juridiske og etiske: opplæringsdatalisensiering, artistsamtykke og vannmerkegenerert lyd slik at den kan skilles fra menneskeskapt musikk er nå sentrale for distribusjon.

Real-World Implementering

Å gjøre om en skriftlig scenebeskrivelse til en film eller trailerscore, f.eks. 'episk orkesterbygg med kor'

Generer bakgrunnsmusikk basert på en bildetekst eller til og med maleribeskrivelser for kunstinstallasjoner

Utvide en kort nynnet eller plystret melodi til et fullt instrumentert arrangement

Produserer varierte lagermusikkspor i forskjellige tempoer og stemninger for reklame- og innholdsskapere

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Symbolsk musikkgenerasjon

Ofte stilte spørsmål

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM er Googles tekst-til-musikk-modell som genererer lyd i lang form gjennom et hierarki av semantiske tokens for musikalsk struktur og akustiske tokens for lyddetaljer.

Hvordan behandler MusicLM grunnleggende oppgaven med å generere musikk?

MusicLM rammer musikkgenerering som autoregressiv prediksjon over diskrete lydtokens, lik hvordan en språkmodell forutsier ord.

Hva er rollen til semantiske tokens i MusicLM?

Semantiske tokens (fra w2v-BERT) fanger opp grov, langsomt skiftende struktur som melodi og rytme over lange spenn.

Hvilken komponent gir de fine akustiske detaljene som klang og tekstur?

Akustiske tokens kommer fra SoundStream nevrale kodeken og koder for fine detaljer som klang og tekstur.

Hvordan kobler MusicLM en tekstmelding til musikalsk lyd?

MuLan er opplært slik at tekstbeskrivelser og matchende lydkart til nærliggende punkter i et delt innebyggingsområde, noe som muliggjør tekstkondisjonering.

Hvorfor hjelper den hierarkiske, iscenesatte designen med langdistansestruktur?

Sparsomme semantiske tokens endres sakte, slik at en transformator kan modellere langsiktig form effektivt før tette akustiske detaljer fylles ut.