EnCodec hangtömörítés
Az EnCodec a Meta nagy hűségű neurális audiokodekje, amely nagyon alacsony bitsebességgel tömöríti a beszédet és a zenét, a jóval nehezebb formátumokkal vetekedő minőséggel.
Áttekintés
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Mély merülés
A Meta AI által 2022-ben kiadott EnCodec egy kódoló, egy maradékvektor-kvantáló (RVQ) és egy dekóder SoundStream tervét követi, végpontokig betanított, de számos finomítást ad hozzá. Adatfolyam-képes konvolúciós kódolót, többléptékű spektrogramot és időtartomány-rekonstrukciós veszteségeket, valamint ellenséges diszkriminátorokat használ az észlelési minőség érdekében. Figyelemre méltó hozzájárulás egy kis Transformer-alapú entrópiamodell, amely tovább tömöríti a kvantált kódokat veszteségmentesen, és extra biteket szorít ki belőle minőségromlás nélkül. Az EnCodec egy kiegyensúlyozót is bevezet, amely automatikusan skálázza a versengő edzési veszteségeket, így azok stabilak maradnak. Kezeli a 24 kHz-es monofonikus és 48 kHz-es sztereó hangot, 1,5, 3, 6 és 12 kbps bitsebességgel működik, és 6 kbps-on az MP3-hoz hasonló minőséget ér el 64 kbps-on. A tokenek a Meta MusicGen és AudioGen funkcióit hajtják végre.
Technikai betekintés
Az EnCodec kódolója lemintázza a hullámformát lépcsőzetes konvolúciókkal egy látens szekvenciává, amelyet az RVQ halmozott kódkönyvi indexekké alakít át. Egy könnyű Transformer nyelvi modell megjósolja ezeknek a tokeneknek a valószínűségét, és aritmetikai kódolást végez, így ingyenesen helyreállítja a további tömörítést. A képzési kiegyenlítő átskálázza a gradiens hozzájárulást a rekonstrukcióból, a spektrális és az ellenséges veszteségekből, így egyetlen kifejezés sem dominál, ami stabilan tartja a többcélú képzést a teljes bitsebesség-tartományban.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
Az EnCodec hangtömörítés jövője
Az EnCodec már számos nyílt generatív hangmodell alapértelmezett tokenizátora, és leszármazottai a magasabb hűséget alacsonyabb bitrátákkal, a teljes sztereó- és zenei szintű rekonstrukciót, valamint a szöveg-audió és szöveg-zene generátorokkal való szorosabb integrációt igyekeznek elérni. Az alacsony sávszélességű kommunikációban, a valós idejű streamingben és a szabványos „audio token” rétegben szélesebb körű elterjedésre számíthat, amely lehetővé teszi a nagy nyelvi modell-stílusú architektúrák hangolvasását és írását.
Valós megvalósítás
Hang tokenizálása a Meta MusicGen és AudioGen szöveg-audio generátoraihoz
A 24 kHz-es beszéd tömörítése 1,5-6 kbps-ra a korlátozott sávszélességű átvitel érdekében
48 kHz-es sztereó zene kódolása MP3-hoz közeli minőséggel, sokkal nagyobb bitsebességgel
Nyílt forráskódú beugró kodekként szolgál kutatási és audio ML-folyamatokhoz a kiadott ellenőrzőpontokon keresztül
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Hangbeágyazások és reprezentációs tanulás
Gyakran ismételt kérdések
What is EnCodec Audio Compression?
Az EnCodec a Meta nagy hűségű neurális audiokodekje, amely nagyon alacsony bitsebességgel tömöríti a beszédet és a zenét, a jóval nehezebb formátumokkal vetekedő minőséggel. Ez azért fontos, mert a modern generatív audiorendszerek alapját képezi, és nyílt forráskódú formában szállítja bárki számára.
Melyik szervezet adta ki az EnCodecet?
Az EnCodec-et az Meta AI (FAIR) vezette be 2022-ben, mint nagy pontosságú neurális audiokodeket.
Milyen extra komponenst ad hozzá az EnCodec, hogy veszteségmentesen szorítsa ki több tömörítést a tokenekből?
Az EnCodec betanít egy kis transzformátort a token valószínűségek előrejelzésére és aritmetikai kódolására, így további veszteségmentes tömörítést ér el az RVQ tetején.
Körülbelül 6 kb/s-nál az EnCodec minősége az MP3-éhoz hasonlítható, körülbelül milyen bitsebességgel?
A 6 kbps-os EnCodec szubjektív minőséget ér el, amely hasonló a 64 kbps-os MP3-hoz, ami nagy hatékonyságnövekedést jelent.
Milyen problémát old meg az EnCodec „kiegyenlítője” edzés közben?
Sok veszteség (rekonstrukció, spektrális, ellenséges) miatt a kiegyenlítő átskálázza a gradienseiket, így egyetlen cél sem dominál, stabilizálja a képzést.
Melyik alapvető kvantálási módszert osztja meg az EnCodec a SoundStreammel?
A SoundStreamhez hasonlóan az EnCodec is maradék vektorkvantálást használ a kódoló beágyazásainak halmozott kódkönyvi indexekbe történő diszkretizálására.