GHID audio AI

Compresie audio EnCodec

EnCodec este codecul audio neuronal de înaltă fidelitate al Meta care comprimă vorbirea și muzica la rate de biți foarte scăzute, cu o calitate care rivalizează cu formate mult mai grele.

2 minute de lecturăUltima actualizare

Prezentare generală

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

Scufundare în profunzime

Lansat de Meta AI în 2022, EnCodec urmează modelul SoundStream al unui codificator, un cuantificator vectorial rezidual (RVQ) și un decodor antrenat cap la cap, dar adaugă mai multe perfecționări. Utilizează un codificator convoluțional capabil de transmitere în flux, pierderi de spectrogramă multi-scale și reconstrucție în domeniul timpului și discriminatori adversi pentru calitatea perceptivă. O contribuție notabilă este un mic model de entropie bazat pe transformator care comprimă în continuare codurile cuantificate fără pierderi, stoarce biți suplimentari fără pierderi de calitate. EnCodec introduce, de asemenea, un echilibrator care scalează automat numeroasele pierderi de antrenament concurente, astfel încât acestea să rămână stabile. Se ocupă de audio monofonic de 24 kHz și stereo de 48 kHz, funcționează cu rate de biți precum 1,5, 3, 6 și 12 kbps, iar la 6 kbps atinge o calitate comparabilă cu MP3 la 64 kbps. Tokenurile sale alimentează MusicGen și AudioGen de la Meta.

Perspectivă tehnică

Codificatorul EnCodec eșantionează forma de undă cu convoluții cu pas într-o secvență latentă, pe care RVQ o convertește în indici de coduri stivuite. Un model ușor de limbaj Transformer prezice probabilitățile acestor jetoane și le codifică aritmetic, recuperând o compresie suplimentară gratuit. Echilibratorul de antrenament redimensionează contribuțiile de gradient de la reconstrucție, pierderile spectrale și adversare, astfel încât niciun termen să nu domine, ceea ce menține antrenamentul multi-obiectiv stabil pe toată gama de bitrate.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul compresiei audio EnCodec

EnCodec este deja tokenizerul implicit pentru mai multe modele audio generative deschise, iar descendenții săi promovează o fidelitate mai mare la rate de biți mai mici, reconstrucție stereo completă și de calitate muzicală și o integrare mai strânsă cu generatoarele text-to-audio și text-to-muzică. Așteptați-vă la o adoptare mai largă în comunicațiile cu lățime de bandă redusă, streaming în timp real și ca strat standard de „token audio”, care permite arhitecturii mari în stil model de limbă să citească și să scrie sunet.

Implementare în lumea reală

Tokenizare audio pentru generatoarele de text în audio MusicGen și AudioGen de la Meta

Comprimarea vorbirii de 24 kHz la 1,5-6 kbps pentru transmisie cu lățime de bandă limitată

Codificarea muzicii stereo de 48 kHz cu o calitate aproape de MP3 la rate de biți mult mai mari

Servește ca codec cu sursă deschisă pentru cercetare și conducte ML audio prin punctele de control lansate

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Încorporarea audio și învățarea reprezentării

Întrebări frecvente

What is EnCodec Audio Compression?

EnCodec este codecul audio neuronal de înaltă fidelitate al Meta care comprimă vorbirea și muzica la rate de biți foarte scăzute, cu o calitate care rivalizează cu formate mult mai grele. Contează pentru că stă la baza sistemelor audio generative moderne și este livrat în formă open-source pentru ca oricine să le poată utiliza.

Ce organizație a lansat EnCodec?

EnCodec a fost introdus de Meta AI (FAIR) în 2022 ca un codec audio neuronal de înaltă fidelitate.

Ce componentă suplimentară adaugă EnCodec pentru a stoarce fără pierderi mai multă compresie din jetoanele sale?

EnCodec antrenează un mic Transformator pentru a prezice probabilitățile de simbol și le codifică aritmetic, realizând o compresie suplimentară fără pierderi pe deasupra RVQ.

La aproximativ 6 kbps, calitatea EnCodec a fost raportată ca fiind comparabilă cu MP3 la aproximativ ce bitrate?

EnCodec la 6 kbps atinge o calitate subiectivă similară cu MP3 la 64 kbps, un câștig mare de eficiență.

Ce problemă rezolvă „echilibratorul” EnCodec în timpul antrenamentului?

Cu multe pierderi (reconstrucție, spectrale, adversarie), echilibrerul își redimensionează gradienții, astfel încât niciun obiectiv să nu domine, stabilizând antrenamentul.

Ce metodă de cuantificare de bază împărtășește EnCodec cu SoundStream?

La fel ca SoundStream, EnCodec folosește cuantizarea vectorială reziduală pentru a discretiza încorporarea codificatoarelor în indici de coduri stivuite.