AudioLM
AudioLM is een Google onderzoeksframework dat realistische audio (spraak- of pianomuziek) genereert door geluid als een taal te behandelen en dit stukje bij beetje te voorspellen.
Overzicht
It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.
Diepe duik
AudioLM, geïntroduceerd door Google in 2022, herformuleert het genereren van audio als een taalmodelleringsprobleem: het zet ruwe golfvormen om in discrete tokens en voorspelt vervolgens het volgende token, net zoals een tekstmodel het volgende woord voorspelt. De belangrijkste truc is een hiërarchie van tokentypen. 'Semantische' tokens (van een model als w2v-BERT) leggen de langetermijnstructuur vast - fonetiek, syntaxis, melodie - terwijl 'akoestische' tokens (van de neurale codec van SoundStream) fijne details vastleggen, zoals de identiteit van de spreker, het timbre en de opnameomstandigheden. Door eerst semantische tokens te voorspellen en er vervolgens akoestische tokens aan te conditioneren, produceert AudioLM voortzettingen die gedurende vele seconden coherent blijven terwijl de originele stem of het originele instrument behouden blijft. Na een paar seconden spraak blijft hij met dezelfde stem spreken; gegeven piano, improviseert het in dezelfde stijl.
Technisch inzicht
AudioLM is puur op audio getraind – geen transcripties. SoundStream comprimeert audio in akoestische tokens via residuele vectorkwantisering, terwijl w2v-BERT grove semantische tokens levert. Een stapel Transformer-taalmodellen voorspelt tokens in fasen: eerst semantisch voor structuur, daarna grove en fijne akoestische tokens voor hifi-reconstructie. De decoder van SoundStream verandert de voorspelde tokens uiteindelijk weer in een golfvorm, waardoor audio ontstaat die de stem en de prosodie van de spreker consistent houdt.
Strategische impact
Access and reach
Het verbetert de toegankelijkheid via transcriptie, gesproken tekst en spraakinterfaces.
Cost and budget
Mediateams kunnen met kleinere budgetten sneller gepolijste audio leveren.
Speed and scale
Klantgerichte systemen kunnen gesproken interacties op grotere schaal verwerken.
De toekomst van AudioLM
Het op tokens gebaseerde recept van AudioLM werd de basis voor latere systemen: de AudioLM-ideeën van Google werden ingevoerd in MusicLM voor tekst-naar-muziek en SoundStorm voor snellere generatie, terwijl het bredere veld nu semantische en akoestische tokens combineert met spraak, muziek en geluidseffecten. Verwacht snellere, real-time generatie, langere coherente outputs en multimodale controle waarbij tekst of andere signalen puur audio-getrainde modellen sturen. Dezelfde technieken vergroten ook de zorgen over stemklonen en deepfakes van audio.
Implementatie in de echte wereld
Een kort spraakfragment voortzetten met de stem en intonatie van dezelfde spreker zonder transcriptie
Improviseren van nieuwe pianomuziek die past bij de stijl van een korte opgenomen prompt
Dient als de ruggengraat van de audiogeneratie voor tekst-naar-muzieksystemen zoals MusicLM
Onderzoek naar spraaksynthese waarbij de prosodie en de opnameakoestiek van een sample behouden blijven
Risico's en vangrails
Het risico op stemmisbruik en imitatie neemt toe als de toestemming ontbreekt.
De nauwkeurigheid kan afnemen bij accenten, dialecten of luidruchtige omgevingen.
Synthetische audio kan worden aangezien voor authentieke spraak zonder duidelijke labels.
Implementatie routekaart
Verkrijg expliciete toestemming voor het vastleggen, klonen en hergebruiken van spraak.
Test de kwaliteit van diverse sprekers en achtergrondomstandigheden.
Bepaal wanneer een mens de output moet beoordelen of goedkeuren.
Label synthetische audio en houd de herkomstgegevens bij voor verantwoording.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Trefwoord spotten en wake-words
Frequently asked questions
What is AudioLM?
AudioLM is een Google onderzoeksframework dat realistische audio (spraak- of pianomuziek) genereert door geluid als een taal te behandelen en dit stukje bij beetje te voorspellen. Het is belangrijk omdat het aantoonde dat je coherente, natuurlijk klinkende audio-voortzettingen kunt produceren zonder enige teksttranscriptie of partituur.
Welk kernidee gebruikt AudioLM om audio te genereren?
AudioLM zet golfvormen om in discrete tokens en voorspelt ze opeenvolgend, waarbij de next-token-benadering van taalmodellen wordt toegepast op onbewerkt geluid.
Wat is de rol van 'semantische' tokens in AudioLM?
Semantische tokens (van w2v-BERT) coderen structuur en coherentie op hoog niveau, terwijl akoestische tokens fijne audiodetails verwerken.
Welke neurale codec produceert de akoestische tokens van AudioLM?
SoundStream gebruikt residuele vectorkwantisering om audio te comprimeren in akoestische tokens en decodeert later voorspelde tokens terug in een golfvorm.
Wat heeft AudioLM nodig als trainingsgegevens?
Een opvallend kenmerk is dat AudioLM puur op audio traint, zonder tekstlabels, en structuur rechtstreeks uit geluid leert.
Waarom voorspelt AudioLM semantische tokens vóór akoestische tokens?
Door eerst een grove structuur te genereren, blijft de output in de loop van de tijd coherent; akoestische tokens worden vervolgens op die structuur geconditioneerd om hifi-details toe te voegen.