Audio AI-GIDS

MusicLM: hiërarchische semantische en akoestische tokens

MusicLM is het tekst-naar-muziekmodel van Google dat lange audio genereert via een hiërarchie van semantische tokens voor muzikale structuur en akoestische tokens voor geluidsdetails.

2 min readLaatst bijgewerkt

Diepe duik

Aangekondigd door Google Research begin 2023, framet MusicLM het genereren van muziek als het voorspellen van reeksen van afzonderlijke audiotokens, net zoals een taalmodel woorden voorspelt. Het maakt gebruik van een hiërarchie van representaties: semantische tokens (van een model genaamd w2v-BERT) leggen structuur op hoog niveau vast, zoals melodie en ritme, over lange perioden, terwijl akoestische tokens (van de neurale codec SoundStream) fijne details zoals timbre en textuur vastleggen. Een eerste fase genereert semantische tokens uit de tekstprompt, en latere fasen vullen akoestische details in, afhankelijk van die semantiek. Tekstconditionering is afkomstig van MuLM/MuLan, een gezamenlijke muziek-tekstinbedding die is getraind zodat beschrijvingen en audio in dezelfde ruimte terechtkomen. Deze geënsceneerde aanpak zorgt ervoor dat MusicLM minutenlang muzikaal consistent blijft, in plaats van na een paar seconden te gaan drijven.

Technisch inzicht

Het belangrijkste idee is het ontkoppelen van structuur en textuur in een tokenhiërarchie. Grove semantische tokens zijn schaars en veranderen langzaam, dus een Transformer kan een langetermijnvorm modelleren zonder een enorme reekslengte. Akoestische tokens zijn compact en hebben een hoge snelheid, maar ze hoeven alleen te worden voorspeld op basis van de reeds vastgestelde semantiek, waardoor elke fase handelbaar wordt. De resterende vectorkwantisering van SoundStream produceert de gelaagde akoestische codes die een uiteindelijke decoder weer omzet in golfvormen van 24 kHz.

Strategische impact

Access and reach

Het verbetert de toegankelijkheid via transcriptie, gesproken tekst en spraakinterfaces.

Cost and budget

Mediateams kunnen met kleinere budgetten sneller gepolijste audio leveren.

Speed and scale

Klantgerichte systemen kunnen gesproken interacties op grotere schaal verwerken.

De toekomst van muziekLM: hiërarchische semantische en akoestische tokens

De hiërarchische tokenbenadering van MusicLM werd een sjabloon voor latere systemen zoals MusicGen en commerciële muziektools. Verwacht een strakkere melodieconditionering (een deuntje neuriën, een volledig arrangement krijgen), langere, volledig gestructureerde nummers met verzen en refreinen, en een betere beheersbaarheid van instrumenten en toonsoorten. De netelige kwesties zijn juridisch en ethisch: het trainen van datalicenties, toestemming van de artiest en het watermerken van gegenereerde audio, zodat deze kan worden onderscheiden van door mensen gemaakte muziek, staan ​​nu centraal bij de implementatie.

Implementatie in de echte wereld

Een geschreven scènebeschrijving omzetten in een film- of trailerscore, b.v. 'epische orkestopbouw met koor'

Het genereren van achtergrondmuziek op basis van een afbeeldingsbijschrift of zelfs schilderijbeschrijvingen voor kunstinstallaties

Een korte neuriënde of gefloten melodie uitbreiden tot een volledig geïnstrumenteerd arrangement

Het produceren van gevarieerde standaardmuziektracks in verschillende tempo's en stemmingen voor reclame- en contentmakers

Risico's en vangrails

Het risico op stemmisbruik en imitatie neemt toe als de toestemming ontbreekt.

De nauwkeurigheid kan afnemen bij accenten, dialecten of luidruchtige omgevingen.

Synthetische audio kan worden aangezien voor authentieke spraak zonder duidelijke labels.

Implementatie routekaart

1

Verkrijg expliciete toestemming voor het vastleggen, klonen en hergebruiken van spraak.

2

Test de kwaliteit van diverse sprekers en achtergrondomstandigheden.

3

Bepaal wanneer een mens de output moet beoordelen of goedkeuren.

4

Label synthetische audio en houd de herkomstgegevens bij voor verantwoording.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Symbolische muziekgeneratie

Frequently asked questions

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM is het tekst-naar-muziekmodel van Google dat lange audio genereert via een hiërarchie van semantische tokens voor muzikale structuur en akoestische tokens voor geluidsdetails.

Hoe gaat MusicLM fundamenteel om met de taak van het genereren van muziek?

MusicLM omschrijft het genereren van muziek als autoregressieve voorspelling over discrete audiotokens, vergelijkbaar met hoe een taalmodel woorden voorspelt.

Wat is de rol van semantische tokens in MusicLM?

Semantische tokens (van w2v-BERT) leggen grove, langzaam veranderende structuren vast, zoals melodie en ritme, over lange perioden.

Welk onderdeel zorgt voor de fijne akoestische details zoals klankkleur en textuur?

Akoestische tokens zijn afkomstig van de neurale codec SoundStream en coderen fijne details zoals timbre en textuur.

Hoe verbindt MusicLM een tekstprompt met muzikale audio?

MuLan is zo getraind dat tekstbeschrijvingen en bijpassende audio naar nabijgelegen punten in een gedeelde inbeddingsruimte verwijzen, waardoor tekstconditionering mogelijk wordt gemaakt.

Waarom helpt het hiërarchische, gefaseerde ontwerp bij de langetermijnstructuur?

Schaarse semantische tokens veranderen langzaam, zodat een Transformer de vorm op de lange termijn efficiënt kan modelleren voordat dichte akoestische details worden ingevuld.