Audio AI-GIDS

EnCodec-audiocompressie

EnCodec is de hifi-neurale audiocodec van Meta die spraak en muziek comprimeert bij zeer lage bitrates met een kwaliteit die kan wedijveren met veel zwaardere formaten.

2 min readLaatst bijgewerkt

Overzicht

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

Diepe duik

EnCodec, uitgebracht door Meta AI in 2022, volgt de SoundStream-blauwdruk van een encoder, een residuele vectorkwantiseerder (RVQ) en een decoder die van begin tot eind is getraind, maar voegt verschillende verfijningen toe. Het maakt gebruik van een convolutionele encoder met streamingfunctie, multi-schaal spectrogram en reconstructieverliezen in het tijddomein, en vijandige discriminatoren voor perceptuele kwaliteit. Een opmerkelijke bijdrage is een klein Transformer-gebaseerd entropiemodel dat de gekwantiseerde codes verliesvrij verder comprimeert, waardoor extra bits eruit worden geperst zonder kwaliteitsverlies. EnCodec introduceert ook een balancer die de vele concurrerende trainingsverliezen automatisch schaalt, zodat deze stabiel blijven. Het verwerkt 24 kHz monofoon en 48 kHz stereogeluid, werkt met bitrates zoals 1,5, 3, 6 en 12 kbps, en bereikt bij 6 kbps een kwaliteit die vergelijkbaar is met MP3 bij 64 kbps. De tokens voeden de MusicGen en AudioGen van Meta.

Technisch inzicht

De encoder van EnCodec downsampelt de golfvorm met getrapte convoluties naar een latente reeks, die RVQ omzet in gestapelde codeboekindexen. Een lichtgewicht Transformer-taalmodel voorspelt de kansen van deze tokens en codeert ze rekenkundig, waardoor verdere compressie gratis wordt hersteld. De trainingsbalancer herschaalt de gradiëntbijdragen van reconstructie-, spectrale en vijandige verliezen, zodat geen enkele term domineert, waardoor training met meerdere doelstellingen stabiel blijft over het volledige bitratebereik.

Strategische impact

Access and reach

Het verbetert de toegankelijkheid via transcriptie, gesproken tekst en spraakinterfaces.

Cost and budget

Mediateams kunnen met kleinere budgetten sneller gepolijste audio leveren.

Speed and scale

Klantgerichte systemen kunnen gesproken interacties op grotere schaal verwerken.

De toekomst van EnCodec-audiocompressie

EnCodec is al de standaard tokenizer voor verschillende open generatieve audiomodellen, en zijn nakomelingen streven naar een hogere betrouwbaarheid bij lagere bitrates, volledige reconstructie van stereo en muziekkwaliteit en een nauwere integratie met tekst-naar-audio- en tekst-naar-muziekgeneratoren. Verwacht een bredere acceptatie in communicatie met lage bandbreedte, realtime streaming en als de standaard 'audiotoken'-laag waarmee grote architecturen in taalmodelstijl geluid kunnen lezen en schrijven.

Implementatie in de echte wereld

Tokeniseren van audio voor de MusicGen- en AudioGen-tekst-naar-audiogeneratoren van Meta

Compressie van 24 kHz-spraak naar 1,5-6 kbps voor transmissie met beperkte bandbreedte

Codering van 48 kHz stereomuziek met kwaliteit die dicht bij MP3 ligt, bij veel hogere bitrates

Dient als een open-source drop-in-codec voor onderzoeks- en audio-ML-pijplijnen via de vrijgegeven controlepunten

Risico's en vangrails

Het risico op stemmisbruik en imitatie neemt toe als de toestemming ontbreekt.

De nauwkeurigheid kan afnemen bij accenten, dialecten of luidruchtige omgevingen.

Synthetische audio kan worden aangezien voor authentieke spraak zonder duidelijke labels.

Implementatie routekaart

1

Verkrijg expliciete toestemming voor het vastleggen, klonen en hergebruiken van spraak.

2

Test de kwaliteit van diverse sprekers en achtergrondomstandigheden.

3

Bepaal wanneer een mens de output moet beoordelen of goedkeuren.

4

Label synthetische audio en houd de herkomstgegevens bij voor verantwoording.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Audio-inbedding en leren van representatie

Frequently asked questions

What is EnCodec Audio Compression?

EnCodec is de hifi-neurale audiocodec van Meta die spraak en muziek comprimeert bij zeer lage bitrates met een kwaliteit die kan wedijveren met veel zwaardere formaten. Het is belangrijk omdat het moderne generatieve audiosystemen ondersteunt en in open-sourcevorm wordt geleverd zodat iedereen het kan gebruiken.

Welke organisatie heeft EnCodec uitgebracht?

EnCodec werd in 2022 door Meta AI (FAIR) geïntroduceerd als een hifi neurale audiocodec.

Welke extra component voegt EnCodec toe om verliesloos meer compressie uit zijn tokens te persen?

EnCodec traint een kleine Transformer om tokenkansen te voorspellen en deze rekenkundig te coderen, waardoor extra verliesvrije compressie bovenop RVQ wordt bereikt.

Met ongeveer 6 kbps werd de kwaliteit van EnCodec gerapporteerd als vergelijkbaar met die van MP3, op welke bitsnelheid?

EnCodec bij 6 kbps bereikt een subjectieve kwaliteit die vergelijkbaar is met MP3 bij 64 kbps, een grote efficiëntiewinst.

Welk probleem lost de 'balancer' van EnCodec op tijdens de training?

Bij veel verliezen (reconstructie, spectraal, vijandig) herschaalt de balancer de gradiënten zodat geen enkel doel domineert, waardoor de training wordt gestabiliseerd.

Welke kernkwantiseringsmethode deelt EnCodec met SoundStream?

Net als SoundStream gebruikt EnCodec restvectorkwantisering om de inbedding van encoders te discretiseren in gestapelde codeboekindexen.