GUIDA AI audio

Modelli linguistici VALL-E e Codec

VALL-E ha riformulato la sintesi vocale come un problema di modellazione del linguaggio sui token del codec audio, consentendo la clonazione della voce da soli tre secondi di un campione.

2 minuti di letturaUltimo aggiornamento

Panoramica

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

Immersione profonda

Annunciato da Microsoft all'inizio del 2023, VALL-E tratta la sintesi vocale come un modello linguistico. Invece di prevedere uno spettrogramma, prevede i token acustici discreti di un codec neurale (EnCodec), quindi la generazione diventa la previsione del token successivo su un vocabolario audio. Data una registrazione di 3 secondi di un oratore invisibile più il testo di destinazione, VALL-E continua con la voce di quell'oratore, preservando il timbro e persino l'ambiente acustico. È stato addestrato su circa 60.000 ore di parlato, molto più dei tipici set di dati TTS, il che gli ha dato una forte clonazione zero-shot. Poiché i token codec sono stratificati (tramite RVQ), VALL-E utilizza due fasi: un modello autoregressivo prevede il primo flusso di token grossolano condizionato al prompt e un modello non autoregressivo riempie i token di dettaglio rimanenti. Questa ricetta codec-LM ha ispirato successori come VALL-E 2 e molti modelli di base vocale.

Approfondimento tecnico

Il trucco sta nella decodifica ibrida su token codec gerarchici. La fase autoregressiva prevede i token più importanti del primo codice uno alla volta, catturando prosodia e contenuto. I restanti codici, che aggiungono dettagli acustici fini, sono previsti in parallelo da un modello non autoregressivo condizionato dal primo flusso e dal suggerimento dell'oratore. Questa suddivisione mantiene alta la qualità evitando il costo di generare ogni token in sequenza, e l'utilizzo di un codec significa che parlato e testo possono essere modellati con lo stesso macchinario di trasformazione.

Impatto strategico

Accedere e raggiungere

Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.

Costo e budget

I team media possono fornire audio raffinato più velocemente con budget inferiori.

Velocità e scala

I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.

Il futuro dei modelli linguistici VALL-E e Codec

I modelli linguistici codec stanno fondendo il parlato con modelli linguistici di grandi dimensioni, puntando verso sistemi unificati che ascoltano, ragionano e parlano in un unico modello. Aspettatevi una migliore stabilità e meno artefatti, generazione di streaming in tempo reale e un controllo più stretto su emozioni e stile. La stessa potente clonazione che rende VALL-E utile per l’accessibilità e il doppiaggio solleva anche preoccupazioni relative al deepfake e al consenso, quindi filigrana, garanzie di verifica vocale e barriere politiche stanno diventando una parte centrale del modo in cui questi sistemi vengono implementati.

Implementazione nel mondo reale

Clonazione di una voce da pochi secondi di audio per assistenti personalizzati o strumenti di accessibilità che ripristinano una voce persa

Localizzazione e doppiaggio di video in altre lingue mantenendo il timbro originale dell'oratore

Generazione di una narrazione espressiva e adatta al contesto che preserva l'ambiente acustico di una registrazione

Funge da spina dorsale del parlato negli assistenti multimodali che comprendono e producono audio parlato

Rischi e guardrail

I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.

La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.

L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.

Tabella di marcia per l'implementazione

1

Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.

2

Testare la qualità su diversi altoparlanti e condizioni di fondo.

3

Definire quando un essere umano deve rivedere o approvare gli output.

4

Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Abilità emergenti di modelli linguistici di grandi dimensioni

Domande frequenti

What is VALL-E and Codec Language Models?

VALL-E ha riformulato la sintesi vocale come un problema di modellazione del linguaggio sui token del codec audio, consentendo la clonazione della voce da soli tre secondi di un campione. Ha dimostrato che la stessa previsione del token successivo che alimenta i LLM di testo può generare un discorso straordinariamente naturale ed espressivo.

Quale idea fondamentale distingue VALL-E dai precedenti sistemi di sintesi vocale?

VALL-E riformula TTS come previsione del token successivo su token di codec audio discreti, trattando la generazione del parlato come un modello linguistico.

Di quanto audio di riferimento ha bisogno VALL-E per clonare la voce di un nuovo oratore?

VALL-E può eseguire la clonazione vocale zero-shot da un campione di circa 3 secondi di un oratore invisibile.

Quale codec neurale utilizza VALL-E per produrre i suoi token audio?

VALL-E si basa su EnCodec di Meta, prevedendo i suoi token acustici discreti per sintetizzare il parlato.

Perché VALL-E utilizza sia uno stadio autoregressivo che uno non autoregressivo?

I token codec sono gerarchici tramite RVQ; VALL-E prevede il primo flusso grossolano in modo autoregressivo e i restanti token di dettaglio in parallelo per efficienza.

All'incirca su quanti dati vocali è stato addestrato VALL-E, consentendo una forte clonazione zero-shot?

VALL-E è stato addestrato su circa 60.000 ore di parlato, molto più dei tipici set di dati TTS, il che ha potenziato la sua generalizzazione a colpo zero.