AudioLM
Az AudioLM egy Google kutatási keretrendszer, amely valósághű hangot – beszédet vagy zongorazenét – állít elő azáltal, hogy a hangot nyelvként kezeli, és tokenről jelzőre jelzi előre.
Áttekintés
It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.
Mély merülés
A Google által 2022-ben bevezetett AudioLM nyelvmodellezési problémaként újrakeretezi a hanggenerálást: a nyers hullámformákat diszkrét tokenekké alakítja, majd megjósolja a következő tokent, ahogy a szöveges modell a következő szót. Legfontosabb trükkje a token típusok hierarchiája. A „szemantikus” tokenek (olyan modellből, mint a w2v-BERT) rögzítik a hosszú távú struktúrát – fonetikát, szintaxist, dallamot –, míg az „akusztikus” tokenek (a SoundStream neurális kodekből) olyan finom részleteket rögzítenek, mint a beszélő azonossága, hangszíne és felvételi körülményei. Azáltal, hogy először előrejelzi a szemantikai tokeneket, majd kondicionálja az akusztikus tokeneket, az AudioLM olyan folytatásokat állít elő, amelyek sok másodpercig koherensek maradnak, miközben megőrzik az eredeti hangot vagy hangszert. Néhány másodpercnyi beszéd után ugyanazon a hangon beszél tovább; adott zongora, ugyanabban a stílusban improvizál.
Technikai betekintés
Az AudioLM kizárólag hangra van kiképezve – nincs átirat. A SoundStream akusztikus tokenekké tömöríti a hangot a maradék vektorkvantálás révén, míg a w2v-BERT durva szemantikai tokeneket biztosít. A Transformer nyelvi modellek halmaza szakaszosan jelzi előre a tokeneket: először a szemantikai tokeneket a szerkezethez, majd a durva és finom akusztikus tokeneket a nagy pontosságú rekonstrukcióhoz. A SoundStream dekódere végül a megjósolt tokeneket hullámformává alakítja, és olyan hangot eredményez, amely a beszélő hangját és prozódiáját egységesen tartja.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
Az AudioLM jövője
Az AudioLM token-alapú receptje lett a későbbi rendszerek alapja: az Google AudioLM-ötletei bekerültek a MusicLM-be a szöveg-zene átalakítás érdekében, a SoundStorm pedig a gyorsabb generálás érdekében, míg a tágabb terület mostanra ötvözi a szemantikai és akusztikus tokeneket a beszéd, a zene és a hangeffektusok között. Gyorsabb, valós idejű generálásra, hosszabb koherens kimenetekre és multimodális vezérlésre számíthat, ahol szöveges vagy egyéb jelek irányítják a tisztán hangos modelleket. Ugyanezek a technikák a hangklónozással és a mélyhamisításokkal kapcsolatos aggodalmakat is fokozzák.
Valós megvalósítás
Rövid beszédklip folytatása ugyanazon a beszélő hangján és intonációjával, átirat nélkül
Új zongorazene improvizálása, amely illeszkedik egy rövid felvett felszólítás stílusához
Hanggeneráló gerincként szolgál szöveg-zene rendszerek, például a MusicLM számára
Beszédszintézis kutatása, amely megőrzi a prozódiát és a rögzítési akusztikát egy mintából
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Kulcsszófoltozás és ébresztőszavak
Gyakran ismételt kérdések
What is AudioLM?
Az AudioLM egy Google kutatási keretrendszer, amely valósághű hangot – beszédet vagy zongorazenét – állít elő azáltal, hogy a hangot nyelvként kezeli, és tokenről jelzőre jelzi előre. Ez azért fontos, mert megmutatta, hogy lehet koherens, természetes hangzású hangfolytatásokat készíteni szöveges átirat vagy kotta nélkül.
Milyen alapötletet használ az AudioLM hang generálására?
Az AudioLM a hullámformákat diszkrét tokenekké alakítja, és szekvenciálisan megjósolja, a nyelvi modellek következő token megközelítését alkalmazva a nyers hangra.
Mi a „szemantikus” tokenek szerepe az AudioLM-ben?
A szemantikus tokenek (a w2v-BERT-től) magas szintű struktúrát és koherenciát kódolnak, míg az akusztikus tokenek finom hangrészleteket kezelnek.
Melyik neurális kodek állítja elő az AudioLM akusztikus tokenjeit?
A SoundStream maradék vektorkvantálást használ a hang akusztikus tokenekbe tömörítésére, majd az előre jelzett tokeneket visszakódolja egy hullámformába.
Mit igényel az AudioLM edzésadatként?
Figyelemre méltó jellemzője, hogy az AudioLM tisztán hangon edz, szöveges címkék nélkül, a struktúrát közvetlenül a hangból tanulja meg.
Miért jósolja meg az AudioLM a szemantikai tokeneket az akusztikus tokenek előtt?
A durva szerkezet létrehozása először a kimenetet koherensen tartja az idő múlásával; Az akusztikus tokeneket ezután kondicionálják ezen a szerkezeten, hogy nagy pontosságú részleteket adjanak hozzá.