Audio AI ÚTMUTATÓ

VALL-E és Codec nyelvi modellek

A VALL-E átkeretezte a szöveg-beszéd funkciót, mint nyelvi modellezési problémát az audiokodek tokeneken keresztül, lehetővé téve a hangklónozást mindössze három másodperces mintából.

2 perc olvasásUtoljára frissítve

Áttekintés

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

Mély merülés

A Microsoft által 2023 elején bejelentett VALL-E a beszédszintézist a nyelvi modellezéshez hasonlóan kezeli. A spektrogram előrejelzése helyett egy neurális kodek (EnCodec) diszkrét akusztikus tokenjeit jósolja meg, így a generálás a következő token előrejelzésévé válik egy hangszókincs felett. Egy 3 másodperces felvétel egy láthatatlan hangszóróról és a célszövegről, a VALL-E a hangszóró hangján folytatja, megőrizve a hangszínt és még az akusztikus környezetet is. Körülbelül 60 000 órányi beszédre képezték ki, ami jóval több, mint a tipikus TTS-adatkészletek, ami erős nullapontos klónozást biztosított számára. Mivel a kodek tokenek rétegzettek (RVQ-n keresztül), a VALL-E két szakaszt használ: egy autoregresszív modell megjósolja az első, durva tokenfolyamot, amely a prompthoz kapcsolódik, és egy nem autoregresszív modell kitölti a fennmaradó részleteket. Ez a codec-LM recept olyan utódokat ihletett meg, mint a VALL-E 2 és számos beszédalap-modell.

Technikai betekintés

A trükk a hibrid dekódolás hierarchikus kodek tokeneken keresztül. Az autoregresszív szakasz egyenként előrejelzi a legfontosabb első kódkönyv tokeneket, rögzítve a prozódiát és a tartalmat. A fennmaradó kódkönyveket, amelyek finom akusztikus részleteket adnak hozzá, párhuzamosan előrejelzi egy nem autoregresszív modell, amely az első adatfolyamon és a hangszóró promptján van kondicionálva. Ez a felosztás magas minőséget biztosít, miközben elkerüli az összes token szekvenciális generálásának költségeit, kodek használatával pedig a beszéd és a szöveg ugyanazzal a transzformátorral modellezhető.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A VALL-E és a kodek nyelvi modellek jövője

A kodek nyelvi modellek egyesítik a beszédet a nagy nyelvi modellekkel, és olyan egységes rendszerek felé mutatnak, amelyek egyetlen modellben figyelnek, érvelnek és beszélnek. Jobb stabilitásra és kevesebb műtermékre, valós idejű adatfolyam-generálásra, valamint az érzelmek és stílusok szigorúbb ellenőrzésére számíthat. Ugyanaz az erőteljes klónozás, amely a VALL-E-t a hozzáférhetőség és a szinkronizálás szempontjából hasznossá teszi, mélyhamisítási és beleegyezési aggodalmakat is felvet, így a vízjelezés, a hangellenőrzési biztosítékok és a házirend-védőkorlátok ezeknek a rendszereknek a központi részévé válnak.

Valós megvalósítás

Hang klónozása néhány másodperces hangból személyre szabott asszisztensek vagy kisegítő eszközök számára, amelyek visszaállítják az elveszett hangot

Videó lokalizálása és más nyelvekre történő átmásolása az eredeti beszélő hangszínének megőrzése mellett

Kifejező, kontextushoz igazodó narráció generálása, amely megőrzi a felvétel akusztikus környezetét

A beszéd gerinceként szolgál a multimodális asszisztensekben, amelyek egyszerre értik és előállítják a beszédhangot

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

A nagy nyelvi modellek kialakuló képességei

Gyakran ismételt kérdések

What is VALL-E and Codec Language Models?

A VALL-E átkeretezte a szöveg-beszéd funkciót, mint nyelvi modellezési problémát az audiokodek tokeneken keresztül, lehetővé téve a hangklónozást mindössze három másodperces mintából. Megmutatta, hogy ugyanaz a következő jelű előrejelzés, amely a szöveges LLM-eket képes feltűnően természetes, kifejező beszédet generálni.

Milyen alapötlet különbözteti meg a VALL-E-t a korábbi szövegfelolvasó rendszerektől?

A VALL-E átkeretezi a TTS-t a következő token előrejelzéseként diszkrét audiokodek tokenek felett, és a beszédgenerálást nyelvi modellként kezeli.

Mennyi referencia hangra van szüksége a VALL-E-nek egy új hangszóró hangjának klónozásához?

A VALL-E zéró felvételű hangklónozást tud végrehajtani egy láthatatlan hangszóró nagyjából 3 másodperces mintájából.

Melyik neurális kodeket használja a VALL-E az audio tokenek előállításához?

A VALL-E a Meta EnCodec-ére épít, előrejelzi a beszédszintetizáló diszkrét akusztikus tokenjeit.

Miért használ a VALL-E autoregresszív és nem autoregresszív szakaszt is?

A kodek tokenek hierarchikusak az RVQ-n keresztül; A VALL-E a hatékonyság érdekében az első durva adatfolyamot autoregresszíven, a többi részletjelzőt pedig párhuzamosan jelzi előre.

Körülbelül mennyi beszédadatra tanították a VALL-E-t, ami lehetővé tette az erős nullapontos klónozást?

A VALL-E-t nagyjából 60 000 órányi beszédre képezték ki, ami jóval több, mint a tipikus TTS-adatkészletek, ami megnövelte a nullapontos általánosítást.