Audio AI ÚTMUTATÓ

AudioLM

Az AudioLM egy Google kutatási keretrendszer, amely valósághű hangot – beszédet vagy zongorazenét – állít elő azáltal, hogy a hangot nyelvként kezeli, és tokenről jelzőre jelzi előre.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Mély merülés

A Google által 2022-ben bevezetett AudioLM nyelvmodellezési problémaként újrakeretezi a hanggenerálást: a nyers hullámformákat diszkrét tokenekké alakítja, majd megjósolja a következő tokent, ahogy a szöveges modell a következő szót. Legfontosabb trükkje a token típusok hierarchiája. A „szemantikus” tokenek (olyan modellből, mint a w2v-BERT) rögzítik a hosszú távú struktúrát – fonetikát, szintaxist, dallamot –, míg az „akusztikus” tokenek (a SoundStream neurális kodekből) olyan finom részleteket rögzítenek, mint a beszélő azonossága, hangszíne és felvételi körülményei. Azáltal, hogy először előrejelzi a szemantikai tokeneket, majd kondicionálja az akusztikus tokeneket, az AudioLM olyan folytatásokat állít elő, amelyek sok másodpercig koherensek maradnak, miközben megőrzik az eredeti hangot vagy hangszert. Néhány másodpercnyi beszéd után ugyanazon a hangon beszél tovább; adott zongora, ugyanabban a stílusban improvizál.

Technikai betekintés

Az AudioLM kizárólag hangra van kiképezve – nincs átirat. A SoundStream akusztikus tokenekké tömöríti a hangot a maradék vektorkvantálás révén, míg a w2v-BERT durva szemantikai tokeneket biztosít. A Transformer nyelvi modellek halmaza szakaszosan jelzi előre a tokeneket: először a szemantikai tokeneket a szerkezethez, majd a durva és finom akusztikus tokeneket a nagy pontosságú rekonstrukcióhoz. A SoundStream dekódere végül a megjósolt tokeneket hullámformává alakítja, és olyan hangot eredményez, amely a beszélő hangját és prozódiáját egységesen tartja.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

Az AudioLM jövője

Az AudioLM token-alapú receptje lett a későbbi rendszerek alapja: az Google AudioLM-ötletei bekerültek a MusicLM-be a szöveg-zene átalakítás érdekében, a SoundStorm pedig a gyorsabb generálás érdekében, míg a tágabb terület mostanra ötvözi a szemantikai és akusztikus tokeneket a beszéd, a zene és a hangeffektusok között. Gyorsabb, valós idejű generálásra, hosszabb koherens kimenetekre és multimodális vezérlésre számíthat, ahol szöveges vagy egyéb jelek irányítják a tisztán hangos modelleket. Ugyanezek a technikák a hangklónozással és a mélyhamisításokkal kapcsolatos aggodalmakat is fokozzák.

Valós megvalósítás

Rövid beszédklip folytatása ugyanazon a beszélő hangján és intonációjával, átirat nélkül

Új zongorazene improvizálása, amely illeszkedik egy rövid felvett felszólítás stílusához

Hanggeneráló gerincként szolgál szöveg-zene rendszerek, például a MusicLM számára

Beszédszintézis kutatása, amely megőrzi a prozódiát és a rögzítési akusztikát egy mintából

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Kulcsszófoltozás és ébresztőszavak

Gyakran ismételt kérdések

What is AudioLM?

Az AudioLM egy Google kutatási keretrendszer, amely valósághű hangot – beszédet vagy zongorazenét – állít elő azáltal, hogy a hangot nyelvként kezeli, és tokenről jelzőre jelzi előre. Ez azért fontos, mert megmutatta, hogy lehet koherens, természetes hangzású hangfolytatásokat készíteni szöveges átirat vagy kotta nélkül.

Milyen alapötletet használ az AudioLM hang generálására?

Az AudioLM a hullámformákat diszkrét tokenekké alakítja, és szekvenciálisan megjósolja, a nyelvi modellek következő token megközelítését alkalmazva a nyers hangra.

Mi a „szemantikus” tokenek szerepe az AudioLM-ben?

A szemantikus tokenek (a w2v-BERT-től) magas szintű struktúrát és koherenciát kódolnak, míg az akusztikus tokenek finom hangrészleteket kezelnek.

Melyik neurális kodek állítja elő az AudioLM akusztikus tokenjeit?

A SoundStream maradék vektorkvantálást használ a hang akusztikus tokenekbe tömörítésére, majd az előre jelzett tokeneket visszakódolja egy hullámformába.

Mit igényel az AudioLM edzésadatként?

Figyelemre méltó jellemzője, hogy az AudioLM tisztán hangon edz, szöveges címkék nélkül, a struktúrát közvetlenül a hangból tanulja meg.

Miért jósolja meg az AudioLM a szemantikai tokeneket az akusztikus tokenek előtt?

A durva szerkezet létrehozása először a kimenetet koherensen tartja az idő múlásával; Az akusztikus tokeneket ezután kondicionálják ezen a szerkezeten, hogy nagy pontosságú részleteket adjanak hozzá.