Audio AI GUIDE

VAL-E og kodek språkmodeller

VALL-E omrammede tekst-til-tale som et språkmodelleringsproblem over lydkodek-tokens, noe som muliggjør stemmekloning fra bare tre sekunder av en prøve.

2 min lesingSist oppdatert

Oversikt

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

Dypdykk

Annonsert av Microsoft tidlig i 2023, behandler VALL-E talesyntese som språkmodellering. I stedet for å forutsi et spektrogram, forutsier den de diskrete akustiske symbolene til en nevral kodek (EnCodec), så generering blir neste token-prediksjon over et lydvokabular. Gitt et 3-sekunders opptak av en usett høyttaler pluss måltekst, fortsetter ALL-E i den høyttalerens stemme, og bevarer klangen og til og med det akustiske miljøet. Den ble trent på omtrent 60 000 timer med tale, mye mer enn typiske TTS-datasett, som ga den sterk nullskuddskloning. Fordi kodek-tokens er lagdelt (via RVQ), bruker VALL-E to trinn: en autoregressiv modell forutsier den første, grove tokenstrømmen som er betinget av ledeteksten, og en ikke-autoregressiv modell fyller ut de gjenværende detaljtokenene. Denne kodeken-LM-oppskriften inspirerte etterfølgere som VAL-E 2 og mange talefundamentmodeller.

Teknisk innsikt

Trikset er hybrid dekoding over hierarkiske kodek-tokens. Det autoregressive stadiet forutsier de viktigste første-kodebok-tokenene én om gangen, og fanger opp prosodi og innhold. De resterende kodebøkene, som legger til fine akustiske detaljer, forutses parallelt av en ikke-autoregressiv modell betinget av den første strømmen og høyttalerprompten. Denne delingen holder kvaliteten høy samtidig som man unngår kostnadene ved å generere hvert token sekvensielt, og bruk av en kodek betyr at tale og tekst kan modelleres med samme transformatormaskineri.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

Fremtiden til ALL-E- og kodek-språkmodeller

Kodekspråkmodeller slår sammen tale med store språkmodeller, og peker mot enhetlige systemer som lytter, resonnerer og snakker i én modell. Forvent bedre stabilitet og færre artefakter, generering av strømming i sanntid og tettere kontroll over følelser og stil. Den samme kraftige kloningen som gjør ALL-E nyttig for tilgjengelighet og dubbing, vekker også bekymringer om dypfalsk og samtykke, så vannmerking, sikkerhetstiltak for stemmeverifisering og retningslinjer for retningslinjer blir en sentral del av hvordan disse systemene distribueres.

Real-World Implementering

Kloning av en stemme fra noen sekunders lyd for personlige assistenter eller tilgjengelighetsverktøy som gjenoppretter en tapt stemme

Lokalisering og dubbing av video til andre språk samtidig som den originale høyttalerens klang beholder

Genererer uttrykksfull, konteksttilpasset fortelling som bevarer et opptaks akustiske miljø

Fungerer som taleryggraden i multimodale assistenter som både forstår og produserer talelyd

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Nye evner til store språkmodeller

Ofte stilte spørsmål

What is VALL-E and Codec Language Models?

VALL-E omrammede tekst-til-tale som et språkmodelleringsproblem over lydkodek-tokens, noe som muliggjør stemmekloning fra bare tre sekunder av en prøve. Den viste at den samme neste-token-prediksjon som driver tekst-LLM-er kan generere bemerkelsesverdig naturlig, uttrykksfull tale.

Hvilken kjerneidé skiller VALL-E fra tidligere tekst-til-tale-systemer?

VALL-E omformer TTS som neste-token-prediksjon over diskrete lydkodek-tokens, og behandler talegenerering som en språkmodell.

Hvor mye referanselyd trenger ALL-E for å klone en ny høyttalers stemme?

VALL-E kan utføre stemmekloning med null skudd fra en omtrentlig 3-sekunders prøve av en usett høyttaler.

Hvilken nevrale kodek bruker ALL-E for å produsere sine lydtokens?

VALL-E bygger på Metas EnCodec, og forutsier dens diskrete akustiske tokens for å syntetisere tale.

Hvorfor bruker ALL-E både et autoregressivt og et ikke-autoregressivt stadium?

Codec-tokens er hierarkiske via RVQ; VALL-E forutsier den første grove strømmen autoregressivt og de gjenværende detaljtegnene parallelt for effektivitet.

Omtrent hvor mye taledata ble ALL-E trent på, noe som muliggjorde sterk nullskuddskloning?

VALL-E ble trent på omtrent 60 000 timer med tale, langt mer enn typiske TTS-datasett, noe som økte dens nullskuddsgeneralisering.