Audio AI ÚTMUTATÓ

EnCodec hangtömörítés

Az EnCodec a Meta nagy hűségű neurális audiokodekje, amely nagyon alacsony bitsebességgel tömöríti a beszédet és a zenét, a jóval nehezebb formátumokkal vetekedő minőséggel.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

Mély merülés

A Meta AI által 2022-ben kiadott EnCodec egy kódoló, egy maradékvektor-kvantáló (RVQ) és egy dekóder SoundStream tervét követi, végpontokig betanított, de számos finomítást ad hozzá. Adatfolyam-képes konvolúciós kódolót, többléptékű spektrogramot és időtartomány-rekonstrukciós veszteségeket, valamint ellenséges diszkriminátorokat használ az észlelési minőség érdekében. Figyelemre méltó hozzájárulás egy kis Transformer-alapú entrópiamodell, amely tovább tömöríti a kvantált kódokat veszteségmentesen, és extra biteket szorít ki belőle minőségromlás nélkül. Az EnCodec egy kiegyensúlyozót is bevezet, amely automatikusan skálázza a versengő edzési veszteségeket, így azok stabilak maradnak. Kezeli a 24 kHz-es monofonikus és 48 kHz-es sztereó hangot, 1,5, 3, 6 és 12 kbps bitsebességgel működik, és 6 kbps-on az MP3-hoz hasonló minőséget ér el 64 kbps-on. A tokenek a Meta MusicGen és AudioGen funkcióit hajtják végre.

Technikai betekintés

Az EnCodec kódolója lemintázza a hullámformát lépcsőzetes konvolúciókkal egy látens szekvenciává, amelyet az RVQ halmozott kódkönyvi indexekké alakít át. Egy könnyű Transformer nyelvi modell megjósolja ezeknek a tokeneknek a valószínűségét, és aritmetikai kódolást végez, így ingyenesen helyreállítja a további tömörítést. A képzési kiegyenlítő átskálázza a gradiens hozzájárulást a rekonstrukcióból, a spektrális és az ellenséges veszteségekből, így egyetlen kifejezés sem dominál, ami stabilan tartja a többcélú képzést a teljes bitsebesség-tartományban.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

Az EnCodec hangtömörítés jövője

Az EnCodec már számos nyílt generatív hangmodell alapértelmezett tokenizátora, és leszármazottai a magasabb hűséget alacsonyabb bitrátákkal, a teljes sztereó- és zenei szintű rekonstrukciót, valamint a szöveg-audió és szöveg-zene generátorokkal való szorosabb integrációt igyekeznek elérni. Az alacsony sávszélességű kommunikációban, a valós idejű streamingben és a szabványos „audio token” rétegben szélesebb körű elterjedésre számíthat, amely lehetővé teszi a nagy nyelvi modell-stílusú architektúrák hangolvasását és írását.

Valós megvalósítás

Hang tokenizálása a Meta MusicGen és AudioGen szöveg-audio generátoraihoz

A 24 kHz-es beszéd tömörítése 1,5-6 kbps-ra a korlátozott sávszélességű átvitel érdekében

48 kHz-es sztereó zene kódolása MP3-hoz közeli minőséggel, sokkal nagyobb bitsebességgel

Nyílt forráskódú beugró kodekként szolgál kutatási és audio ML-folyamatokhoz a kiadott ellenőrzőpontokon keresztül

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Hangbeágyazások és reprezentációs tanulás

Gyakran ismételt kérdések

What is EnCodec Audio Compression?

Az EnCodec a Meta nagy hűségű neurális audiokodekje, amely nagyon alacsony bitsebességgel tömöríti a beszédet és a zenét, a jóval nehezebb formátumokkal vetekedő minőséggel. Ez azért fontos, mert a modern generatív audiorendszerek alapját képezi, és nyílt forráskódú formában szállítja bárki számára.

Melyik szervezet adta ki az EnCodecet?

Az EnCodec-et az Meta AI (FAIR) vezette be 2022-ben, mint nagy pontosságú neurális audiokodeket.

Milyen extra komponenst ad hozzá az EnCodec, hogy veszteségmentesen szorítsa ki több tömörítést a tokenekből?

Az EnCodec betanít egy kis transzformátort a token valószínűségek előrejelzésére és aritmetikai kódolására, így további veszteségmentes tömörítést ér el az RVQ tetején.

Körülbelül 6 kb/s-nál az EnCodec minősége az MP3-éhoz hasonlítható, körülbelül milyen bitsebességgel?

A 6 kbps-os EnCodec szubjektív minőséget ér el, amely hasonló a 64 kbps-os MP3-hoz, ami nagy hatékonyságnövekedést jelent.

Milyen problémát old meg az EnCodec „kiegyenlítője” edzés közben?

Sok veszteség (rekonstrukció, spektrális, ellenséges) miatt a kiegyenlítő átskálázza a gradienseiket, így egyetlen cél sem dominál, stabilizálja a képzést.

Melyik alapvető kvantálási módszert osztja meg az EnCodec a SoundStreammel?

A SoundStreamhez hasonlóan az EnCodec is maradék vektorkvantálást használ a kódoló beágyazásainak halmozott kódkönyvi indexekbe történő diszkretizálására.