Compresie audio EnCodec
EnCodec este codecul audio neuronal de înaltă fidelitate al Meta care comprimă vorbirea și muzica la rate de biți foarte scăzute, cu o calitate care rivalizează cu formate mult mai grele.
Prezentare generală
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Scufundare în profunzime
Lansat de Meta AI în 2022, EnCodec urmează modelul SoundStream al unui codificator, un cuantificator vectorial rezidual (RVQ) și un decodor antrenat cap la cap, dar adaugă mai multe perfecționări. Utilizează un codificator convoluțional capabil de transmitere în flux, pierderi de spectrogramă multi-scale și reconstrucție în domeniul timpului și discriminatori adversi pentru calitatea perceptivă. O contribuție notabilă este un mic model de entropie bazat pe transformator care comprimă în continuare codurile cuantificate fără pierderi, stoarce biți suplimentari fără pierderi de calitate. EnCodec introduce, de asemenea, un echilibrator care scalează automat numeroasele pierderi de antrenament concurente, astfel încât acestea să rămână stabile. Se ocupă de audio monofonic de 24 kHz și stereo de 48 kHz, funcționează cu rate de biți precum 1,5, 3, 6 și 12 kbps, iar la 6 kbps atinge o calitate comparabilă cu MP3 la 64 kbps. Tokenurile sale alimentează MusicGen și AudioGen de la Meta.
Perspectivă tehnică
Codificatorul EnCodec eșantionează forma de undă cu convoluții cu pas într-o secvență latentă, pe care RVQ o convertește în indici de coduri stivuite. Un model ușor de limbaj Transformer prezice probabilitățile acestor jetoane și le codifică aritmetic, recuperând o compresie suplimentară gratuit. Echilibratorul de antrenament redimensionează contribuțiile de gradient de la reconstrucție, pierderile spectrale și adversare, astfel încât niciun termen să nu domine, ceea ce menține antrenamentul multi-obiectiv stabil pe toată gama de bitrate.
Impact strategic
Acces și acoperire
Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.
Cost și buget
Echipele media pot livra audio mai rapid cu bugete mai mici.
Viteză și scară
Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.
Viitorul compresiei audio EnCodec
EnCodec este deja tokenizerul implicit pentru mai multe modele audio generative deschise, iar descendenții săi promovează o fidelitate mai mare la rate de biți mai mici, reconstrucție stereo completă și de calitate muzicală și o integrare mai strânsă cu generatoarele text-to-audio și text-to-muzică. Așteptați-vă la o adoptare mai largă în comunicațiile cu lățime de bandă redusă, streaming în timp real și ca strat standard de „token audio”, care permite arhitecturii mari în stil model de limbă să citească și să scrie sunet.
Implementare în lumea reală
Tokenizare audio pentru generatoarele de text în audio MusicGen și AudioGen de la Meta
Comprimarea vorbirii de 24 kHz la 1,5-6 kbps pentru transmisie cu lățime de bandă limitată
Codificarea muzicii stereo de 48 kHz cu o calitate aproape de MP3 la rate de biți mult mai mari
Servește ca codec cu sursă deschisă pentru cercetare și conducte ML audio prin punctele de control lansate
Riscuri și balustrade
Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.
Precizia poate scădea în accente, dialecte sau medii zgomotoase.
Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.
Foaia de parcurs de implementare
Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.
Testați calitatea pe diverse difuzoare și condiții de fundal.
Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.
Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Încorporarea audio și învățarea reprezentării
Întrebări frecvente
What is EnCodec Audio Compression?
EnCodec este codecul audio neuronal de înaltă fidelitate al Meta care comprimă vorbirea și muzica la rate de biți foarte scăzute, cu o calitate care rivalizează cu formate mult mai grele. Contează pentru că stă la baza sistemelor audio generative moderne și este livrat în formă open-source pentru ca oricine să le poată utiliza.
Ce organizație a lansat EnCodec?
EnCodec a fost introdus de Meta AI (FAIR) în 2022 ca un codec audio neuronal de înaltă fidelitate.
Ce componentă suplimentară adaugă EnCodec pentru a stoarce fără pierderi mai multă compresie din jetoanele sale?
EnCodec antrenează un mic Transformator pentru a prezice probabilitățile de simbol și le codifică aritmetic, realizând o compresie suplimentară fără pierderi pe deasupra RVQ.
La aproximativ 6 kbps, calitatea EnCodec a fost raportată ca fiind comparabilă cu MP3 la aproximativ ce bitrate?
EnCodec la 6 kbps atinge o calitate subiectivă similară cu MP3 la 64 kbps, un câștig mare de eficiență.
Ce problemă rezolvă „echilibratorul” EnCodec în timpul antrenamentului?
Cu multe pierderi (reconstrucție, spectrale, adversarie), echilibrerul își redimensionează gradienții, astfel încât niciun obiectiv să nu domine, stabilizând antrenamentul.
Ce metodă de cuantificare de bază împărtășește EnCodec cu SoundStream?
La fel ca SoundStream, EnCodec folosește cuantizarea vectorială reziduală pentru a discretiza încorporarea codificatoarelor în indici de coduri stivuite.