Audio AI ÚTMUTATÓ

SoundStream neurális kodek

A SoundStream a Google end-to-end neurális audiokodekje, amely rendkívül alacsony bitrátára tömöríti a beszédet és a zenét, miközben megőrzi a minőséget.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Mély merülés

A Google által 2021-ben bevezetett SoundStream egy teljesen neurális kodek, amely három együtt betanított részből épül fel: egy konvolúciós kódoló, amely a nyers hullámformát vektorok kompakt sorozatává alakítja, egy maradékvektor-kvantáló (RVQ), amely diszkretizálja ezeket a konstrukciós vektorokat, és egy, a konstrukciós vektorokat újrakonstruáló. Mind a rekonstrukciós veszteségekkel, mind a GAN-stílusú ellenfél megkülönböztetővel van kiképezve, így a kimenet természetes hangzású, nem csupán számszerűen közeli. Kiemelkedő szolgáltatás a „skálázható” vagy a kvantáló-kimaradás képzés: egyetlen modell nagyjából 3-18 kbps bitsebességgel tud működni, egyszerűen több vagy kevesebb kvantáló réteg felhasználásával a következtetésnél, átképzés nélkül. Állítólag 3 kb/s sebességgel felülmúlja az Opust 12 kb/s-nál a hallgatási tesztekben, a beszéd, a zene és az általános hang kezelésében egy olyan modellben, amely valós időben futhat egy okostelefon CPU-ján.

Technikai betekintés

A hullámforma lépcsőzetes konvolúciókon megy keresztül, amelyek erősen lemintáznak, és képkockánként egy beágyazást eredményeznek (például 75 képkocka/másodperc). Az RVQ ezután minden egyes beágyazást kódkönyvi indexek kötegében kódol. A bitsebesség a keretsebesség és az aktív kvantálók számának és a kódkönyvenkénti biteknek a szorzata. A kvantáló lemorzsolódása véletlenszerűen csonkolja az RVQ-vermet a képzés során, és arra kényszeríti a korábbi kódkönyveket, hogy hordozzák a legfontosabb információkat, így a kodek kecsesen, alacsonyabb sebességgel romlik.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A SoundStream neurális kodek jövője

A SoundStream létrehozta azt a sablont, amelyet a későbbi kodekek, például az EnCodec és a DAC finomítottak, és diszkrét tokenek az olyan generatív rendszerek szubsztrátumává váltak, mint az AudioLM és a MusicLM. Várható, hogy a leszármazottak még alacsonyabb bitsebességűek, szemantikailag strukturált tokenek, amelyek a nyelvi modell stílusú hanggenerátorok bemeneteiként is szolgálnak, valamint az élő hívásokhoz, a hallókészülékekhez és a streaminghez való szigorúbb telepítéshez, ahol a sávszélesség és a várakozási idő szigorúan korlátozott.

Valós megvalósítás

A hanghívások ~3 kbps-ra tömörítése, miközben tisztább hangzású, mint a régi kodekek magasabb bitsebességgel

Az Google AudioLM és MusicLM generatív modelljeit tápláló diszkrét audio tokenek létrehozása

Valós idejű, alacsony sávszélességű audio streaming mobileszközökön CPU-n belüli kódolással és dekódolással

Zene és környezeti hangok hatékony tárolása vagy továbbítása egyetlen modellben, amely minden tartalomtípust kezel

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is SoundStream Neural Codec?

A SoundStream a Google end-to-end neurális audiokodekje, amely rendkívül alacsony bitrátára tömöríti a beszédet és a zenét, miközben megőrzi a minőséget. Ez azért fontos, mert ugyanazon a bitsebességgel veri az olyan hagyományos kodekeket, mint az Opus, és a modern generatív hangmodelleket támogatja.

Melyik három összetevő alkotja a SoundStream architektúrát?

A SoundStream egy konvolúciós kódolóból, a beágyazásokat diszkretizáló maradék vektorkvantálóból és egy konvolúciós dekódolóból épül fel, amelyek mindegyike a végétől a végéig betanított.

Milyen technika teszi lehetővé, hogy egyetlen SoundStream-modell sokféle bitsebességet szolgáltasson átképzés nélkül?

A képzés során a SoundStream véletlenszerűen ledobja a kvantáló rétegeket, így a következtetésből több vagy kevesebb RVQ szintet használhat egy modell különböző bitrátájának eléréséhez.

A Google hallgatási tesztjei szerint a SoundStream 3 kb/s-nál melyik kodek teljesítménye jobb 12 kb/s-nál?

A mindössze 3 kb/s-os SoundStream szubjektív minőségi értékelések alapján megfelelt vagy felülmúlta a széles körben használt, 12 kbps sebességű Opus kodeket.

Milyen kiegészítő edzésjelet használ a SoundStream, hogy természetessé tegye a kimeneti hangot?

A rekonstrukciós veszteségeken túl a SoundStream adversariális (GAN) megkülönböztetőket használ, így a rekonstrukciók érzékelési szempontból valósághűen hangzanak, nem pedig pusztán számszerűen.

Hogyan viszonyul a SoundStream bitsebessége a kvantálóihoz?

A bitsebesség az aktív RVQ rétegek számával skálázódik (a képkockasebesség szorzata a bitek kódkönyvenként), így a kvantálók hozzáadása növeli a bitsebességet és a minőséget.