GUIDA AI audio

AudioLM

AudioLM è un framework di ricerca Google che genera audio realistico (parlato o musica per pianoforte) trattando il suono come un linguaggio e prevedendolo token per token.

2 minuti di letturaUltimo aggiornamento

Panoramica

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Immersione profonda

Introdotto da Google nel 2022, AudioLM riformula la generazione audio come un problema di modellazione del linguaggio: converte le forme d'onda grezze in token discreti e quindi prevede il token successivo, proprio come un modello di testo prevede la parola successiva. Il suo trucco chiave è una gerarchia di tipi di token. I token "semantici" (da un modello come w2v-BERT) catturano la struttura a lungo termine - fonetica, sintassi, melodia - mentre i token "acustici" (dal codec neurale SoundStream) catturano dettagli fini come l'identità di chi parla, il timbro e le condizioni di registrazione. Prevedendo innanzitutto i token semantici e quindi condizionando i token acustici su di essi, AudioLM produce continuazioni che rimangono coerenti per molti secondi preservando la voce o lo strumento originale. Dati pochi secondi di discorso, continua a parlare con la stessa voce; dato il pianoforte, improvvisa nello stesso stile.

Approfondimento tecnico

AudioLM è addestrato esclusivamente sull'audio, senza trascrizioni. SoundStream comprime l'audio in token acustici tramite quantizzazione vettoriale residua, mentre w2v-BERT fornisce token semantici grossolani. Una pila di modelli linguistici Transformer prevede i token in più fasi: prima semantici per la struttura, quindi token acustici grossolani e fini per la ricostruzione ad alta fedeltà. Il decodificatore di SoundStream trasforma finalmente i token previsti in una forma d'onda, producendo un audio che mantiene coerenti la voce e la prosodia di chi parla.

Impatto strategico

Accedere e raggiungere

Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.

Costo e budget

I team media possono fornire audio raffinato più velocemente con budget inferiori.

Velocità e scala

I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.

Il futuro di AudioLM

La ricetta basata su token di AudioLM è diventata la base per i sistemi successivi: le idee AudioLM di Google sono state inserite in MusicLM per la conversione del testo in musica e SoundStorm per una generazione più rapida, mentre il campo più ampio ora fonde token semantici e acustici attraverso parlato, musica ed effetti sonori. Aspettatevi una generazione più rapida e in tempo reale, output coerenti più lunghi e un controllo multimodale in cui testo o altri segnali guidano modelli puramente audio. Le stesse tecniche acuiscono anche le preoccupazioni sulla clonazione vocale e sui deepfake audio.

Implementazione nel mondo reale

Continuazione di un breve spezzone di discorso con la stessa voce e intonazione dello stesso oratore senza trascrizione

Improvvisare nuova musica per pianoforte che corrisponda allo stile di un breve suggerimento registrato

Funge da spina dorsale di generazione audio per sistemi di conversione testo-musica come MusicLM

Ricerca sulla sintesi vocale che preserva la prosodia e registra l'acustica da un campione

Rischi e guardrail

I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.

La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.

L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.

Tabella di marcia per l'implementazione

1

Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.

2

Testare la qualità su diversi altoparlanti e condizioni di fondo.

3

Definire quando un essere umano deve rivedere o approvare gli output.

4

Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Individuazione delle parole chiave e parole risvegliate

Domande frequenti

What is AudioLM?

AudioLM è un framework di ricerca Google che genera audio realistico (parlato o musica per pianoforte) trattando il suono come un linguaggio e prevedendolo token per token. È importante perché ha dimostrato che è possibile produrre continuazioni audio coerenti e dal suono naturale senza alcuna trascrizione di testo o spartito musicale.

Quale idea fondamentale utilizza AudioLM per generare audio?

AudioLM converte le forme d'onda in token discreti e le prevede in sequenza, applicando l'approccio next-token dei modelli linguistici al suono grezzo.

Qual è il ruolo dei token "semantici" in AudioLM?

I token semantici (da w2v-BERT) codificano struttura e coerenza di alto livello, mentre i token acustici gestiscono dettagli audio fini.

Quale codec neurale produce i token acustici di AudioLM?

SoundStream utilizza la quantizzazione vettoriale residua per comprimere l'audio in token acustici e successivamente decodifica i token previsti in una forma d'onda.

Cosa richiede AudioLM come dati di training?

Una caratteristica degna di nota è che AudioLM si allena esclusivamente sull'audio senza etichette di testo, apprendendo la struttura direttamente dal suono.

Perché AudioLM prevede i token semantici prima dei token acustici?

La generazione di una struttura grossolana mantiene innanzitutto l'output coerente nel tempo; i token acustici vengono quindi condizionati su quella struttura per aggiungere dettagli ad alta fedeltà.