Audio AI GUIDE

EnCodec ljudkomprimering

EnCodec är Metas high-fidelity neurala audio-codec som komprimerar tal och musik med mycket låga bithastigheter med kvalitet som konkurrerar med mycket tyngre format.

2 min readSenast uppdaterad

Översikt

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

Djupdykning

EnCodec, som släpptes av Meta AI 2022, följer SoundStream-ritningen av en kodare, en restvektorkvantiserare (RVQ) och en dekodertränad från början till slut, men lägger till flera förbättringar. Den använder en strömningskompatibel faltningskodare, flerskaliga spektrogram och tidsdomänrekonstruktionsförluster och motstridiga diskriminatorer för perceptuell kvalitet. Ett anmärkningsvärt bidrag är en liten transformatorbaserad entropimodell som ytterligare komprimerar de kvantiserade koderna förlustfritt och pressar ut extra bitar utan kvalitetsförlust. EnCodec introducerar också en balanserare som automatiskt skalar de många konkurrerande träningsförlusterna så att de håller sig stabila. Den hanterar 24 kHz monofoniskt och 48 kHz stereoljud, fungerar över bithastigheter som 1,5, 3, 6 och 12 kbps, och vid 6 kbps når en kvalitet jämförbar med MP3 vid 64 kbps. Dess tokens driver Metas MusicGen och AudioGen.

Teknisk insikt

EnCodecs kodare nedsamplar vågformen med stegade faltningar till en latent sekvens, som RVQ omvandlar till staplade kodboksindex. En lätt transformatorspråkmodell förutsäger dessa tokens sannolikheter och aritmetiskt kodar dem och återställer ytterligare komprimering gratis. Träningsbalanseraren skalar om gradientbidrag från rekonstruktion, spektral och motstridiga förluster så att ingen enskild term dominerar, vilket håller multi-objektiv träning stabil över hela bithastighetsintervallet.

Strategisk inverkan

Access and reach

Det förbättrar tillgängligheten genom transkription, berättarröst och röstgränssnitt.

Cost and budget

Medieteam kan skicka polerat ljud snabbare med mindre budgetar.

Speed and scale

Kundvända system kan behandla talade interaktioner i större skala.

Framtiden för EnCodec Audio Compression

EnCodec är redan standardtokenizern för flera öppna generativa ljudmodeller, och dess ättlingar driver högre trohet vid lägre bithastigheter, full stereo- och musikrekonstruktion och stramare integration med text-till-ljud- och text-till-musik-generatorer. Förvänta dig bredare användning inom lågbandbreddskommunikation, realtidsströmning och som standardlager för "ljudtoken" som låter stora arkitekturer i språkmodellstil läsa och skriva ljud.

Real-World Implementation

Tokenisera ljud för Metas MusicGen och AudioGen text-till-ljud-generatorer

Komprimerar 24 kHz tal till 1,5-6 kbps för bandbreddsbegränsad överföring

Kodar 48 kHz stereomusik med kvalitet nära MP3 vid mycket högre bithastigheter

Fungerar som en drop-in codec med öppen källkod för forskning och audio ML pipelines via de släppta kontrollpunkterna

Risker & skyddsräcken

Riskerna för missbruk av röst och personifiering ökar när samtycke saknas.

Noggrannheten kan sjunka över accenter, dialekter eller bullriga miljöer.

Syntetiskt ljud kan misstas för autentiskt tal utan tydlig märkning.

Färdplan för genomförande

1

Skaffa uttryckligt samtycke för röstinfångning, kloning och återanvändning.

2

Testa kvalitet över olika högtalare och bakgrundsförhållanden.

3

Definiera när en människa måste granska eller godkänna utdata.

4

Märk syntetiskt ljud och håll härkomstregister för ansvarstagande.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Audioinbäddningar och representationsinlärning

Frequently asked questions

What is EnCodec Audio Compression?

EnCodec är Metas high-fidelity neurala audio-codec som komprimerar tal och musik med mycket låga bithastigheter med kvalitet som konkurrerar med mycket tyngre format. Det är viktigt eftersom det ligger till grund för moderna generativa ljudsystem och levereras i öppen källkod för alla att använda.

Vilken organisation släppte EnCodec?

EnCodec introducerades av Meta AI (FAIR) 2022 som en high-fidelity neural audio codec.

Vilken extra komponent lägger EnCodec till för att förlustfritt pressa mer komprimering från sina tokens?

EnCodec tränar en liten transformator för att förutsäga tokens sannolikheter och aritmetiskt kodar dem, vilket uppnår ytterligare förlustfri komprimering ovanpå RVQ.

Vid ungefär 6 kbps rapporterades EnCodecs kvalitet som jämförbar med MP3 med ungefär vilken bithastighet?

EnCodec vid 6 kbps når subjektiv kvalitet som liknar MP3 vid 64 kbps, en stor effektivitetsvinst.

Vilket problem löser EnCodecs 'balanserare' under träning?

Med många förluster (rekonstruktion, spektral, motstridig), skalar balanseraren om sina gradienter så att inget enskilt mål dominerar, vilket stabiliserar träningen.

Vilken kärnkvantiseringsmetod delar EnCodec med SoundStream?

Liksom SoundStream använder EnCodec kvarvarande vektorkvantisering för att diskretisera kodarinbäddningar i staplade kodboksindex.