GUIDA AI audio

MusicLM: token semantici e acustici gerarchici

MusicLM è il modello da testo a musica di Google che genera audio di lunga durata attraverso una gerarchia di token semantici per la struttura musicale e token acustici per i dettagli del suono.

2 minuti di letturaUltimo aggiornamento

Immersione profonda

Annunciato dalla Google Research all'inizio del 2023, MusicLM inquadra la generazione musicale come previsione di sequenze di token audio discreti, proprio come un modello linguistico prevede le parole. Utilizza una gerarchia di rappresentazioni: i token semantici (da un modello chiamato w2v-BERT) catturano strutture di alto livello come melodia e ritmo su lunghi periodi, mentre i token acustici (dal codec neurale SoundStream) catturano dettagli fini come timbro e trama. Una prima fase genera token semantici dal prompt del testo, quindi le fasi successive riempiono i dettagli acustici condizionati da tali semantiche. Il condizionamento del testo proviene da MuLM/MuLan, un incorporamento congiunto di musica e testo addestrato in modo che le descrizioni e l'audio arrivino nello stesso spazio. Questo approccio graduale consente a MusicLM di rimanere musicalmente coerente per minuti anziché andare alla deriva dopo pochi secondi.

Approfondimento tecnico

L'idea chiave è disaccoppiare la struttura dalla trama attraverso una gerarchia di token. I token semantici grossolani sono sparsi e cambiano lentamente, quindi un Transformer può modellare una forma a lungo termine senza un'enorme lunghezza della sequenza. I token acustici sono densi e ad alta velocità, ma devono solo essere previsti in base alla semantica già fissata, rendendo ogni fase trattabile. La quantizzazione vettoriale residua di SoundStream produce i codici acustici stratificati che un decodificatore finale riconverte in forme d'onda a 24 kHz.

Impatto strategico

Accedere e raggiungere

Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.

Costo e budget

I team media possono fornire audio raffinato più velocemente con budget inferiori.

Velocità e scala

I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.

Il futuro della musicaLM: token semantici e acustici gerarchici

L'approccio token gerarchico di MusicLM è diventato un modello per sistemi successivi come MusicGen e strumenti musicali commerciali. Aspettatevi un condizionamento della melodia più rigoroso (canticchiare una melodia, ottenere un arrangiamento completo), brani più lunghi e completamente strutturati con strofe e ritornelli e un migliore controllo su strumenti e tonalità. Le questioni spinose sono legali ed etiche: la licenza dei dati di formazione, il consenso dell’artista e la filigrana dell’audio generato in modo che possa essere distinto dalla musica creata dall’uomo sono ora centrali per l’implementazione.

Implementazione nel mondo reale

Trasformare la descrizione scritta di una scena in una colonna sonora per film o trailer, ad es. 'epica costruzione orchestrale con coro'

Generazione di musica di sottofondo condizionata da una didascalia di immagine o anche da descrizioni di dipinti per installazioni artistiche

Estendere una breve melodia canticchiata o fischiata in un arrangiamento completamente strumentato

Produzione di vari brani musicali con ritmi e atmosfere diversi per creatori di pubblicità e contenuti

Rischi e guardrail

I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.

La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.

L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.

Tabella di marcia per l'implementazione

1

Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.

2

Testare la qualità su diversi altoparlanti e condizioni di fondo.

3

Definire quando un essere umano deve rivedere o approvare gli output.

4

Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Generazione di musica simbolica

Domande frequenti

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM è il modello da testo a musica di Google che genera audio di lunga durata attraverso una gerarchia di token semantici per la struttura musicale e token acustici per i dettagli del suono.

In che modo MusicLM tratta fondamentalmente il compito di generare musica?

MusicLM inquadra la generazione musicale come previsione autoregressiva su token audio discreti, in modo simile a come un modello linguistico predice le parole.

Qual è il ruolo dei token semantici in MusicLM?

I token semantici (da w2v-BERT) catturano strutture grossolane e che cambiano lentamente come la melodia e il ritmo su lunghi periodi.

Quale componente fornisce i dettagli acustici più fini come timbro e struttura?

I token acustici provengono dal codec neurale SoundStream e codificano dettagli fini come timbro e struttura.

In che modo MusicLM collega un messaggio di testo all'audio musicale?

MuLan è addestrato in modo che le descrizioni del testo e l'audio corrispondente vengano mappati ai punti vicini in uno spazio di incorporamento condiviso, consentendo il condizionamento del testo.

Perché la progettazione gerarchica e graduale aiuta con la struttura a lungo raggio?

I token semantici sparsi cambiano lentamente, quindi un trasformatore può modellare in modo efficiente la forma a lungo termine prima che i dettagli acustici densi vengano riempiti.