GUIDE de l'IA audio

Compression audio EnCodec

EnCodec est le codec audio neuronal haute fidélité de Meta qui compresse la parole et la musique à des débits binaires très faibles avec une qualité rivalisant avec des formats bien plus lourds.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

Plongée profonde

Lancé par Meta AI en 2022, EnCodec suit le modèle SoundStream d'un encodeur, d'un quantificateur vectoriel résiduel (RVQ) et d'un décodeur entraîné de bout en bout, mais ajoute plusieurs améliorations. Il utilise un codeur convolutionnel compatible avec le streaming, un spectrogramme multi-échelle et des pertes de reconstruction dans le domaine temporel, ainsi que des discriminateurs contradictoires pour la qualité de la perception. Une contribution notable est un petit modèle d'entropie basé sur un transformateur qui compresse davantage les codes quantifiés sans perte, en éliminant les bits supplémentaires sans perte de qualité. EnCodec introduit également un équilibreur qui dimensionne automatiquement les nombreuses pertes d'entraînement concurrentes afin qu'elles restent stables. Il gère l'audio monophonique 24 kHz et stéréo 48 kHz, fonctionne sur des débits binaires tels que 1,5, 3, 6 et 12 kbps, et à 6 kbps atteint une qualité comparable au MP3 à 64 kbps. Ses jetons alimentent MusicGen et AudioGen de Meta.

Aperçu technique

L'encodeur d'EnCodec sous-échantillonne la forme d'onde avec des convolutions striées en une séquence latente, que RVQ convertit en index de livre de codes empilés. Un modèle léger en langage Transformer prédit les probabilités de ces jetons et les code arithmétiquement, récupérant ainsi une compression supplémentaire gratuitement. L'équilibreur d'entraînement redimensionne les contributions de gradient provenant des pertes de reconstruction, spectrales et contradictoires afin qu'aucun terme ne domine, ce qui maintient la formation multi-objectifs stable sur toute la plage de débit binaire.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir de la compression audio EnCodec

EnCodec est déjà le tokenizer par défaut pour plusieurs modèles audio génératifs ouverts, et ses descendants favorisent une fidélité plus élevée à des débits binaires inférieurs, une reconstruction stéréo complète et de qualité musicale, ainsi qu'une intégration plus étroite avec les générateurs de texte-audio et de texte-musique. Attendez-vous à une adoption plus large dans les communications à faible bande passante, le streaming en temps réel et en tant que couche standard de « jeton audio » permettant aux grandes architectures de style modèle de langage de lire et d'écrire du son.

Mise en œuvre dans le monde réel

Tokenisation de l'audio pour les générateurs de texte-audio MusicGen et AudioGen de Meta

Compression de la parole de 24 kHz à 1,5-6 kbps pour une transmission à bande passante limitée

Encodage de musique stéréo 48 kHz avec une qualité proche du MP3 à des débits binaires beaucoup plus élevés

Servir de codec open source pour la recherche et les pipelines de ML audio via les points de contrôle publiés

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Intégrations audio et apprentissage de la représentation

Questions fréquemment posées

What is EnCodec Audio Compression?

EnCodec est le codec audio neuronal haute fidélité de Meta qui compresse la parole et la musique à des débits binaires très faibles avec une qualité rivalisant avec des formats bien plus lourds. C’est important car il sous-tend les systèmes audio génératifs modernes et est livré sous forme open source pour que tout le monde puisse l’utiliser.

Quelle organisation a publié EnCodec ?

EnCodec a été introduit par Meta AI (FAIR) en 2022 en tant que codec audio neuronal haute fidélité.

Quel composant supplémentaire EnCodec ajoute-t-il pour extraire sans perte davantage de compression de ses jetons ?

EnCodec entraîne un petit Transformer pour prédire les probabilités des jetons et les coder arithmétiquement, obtenant ainsi une compression supplémentaire sans perte en plus de RVQ.

À environ 6 kbps, la qualité d'EnCodec était comparable à celle du MP3, à quel débit binaire environ ?

EnCodec à 6 kbps atteint une qualité subjective similaire au MP3 à 64 kbps, un gain d'efficacité important.

Quel problème l'« équilibreur » d'EnCodec résout-il pendant l'entraînement ?

Avec de nombreuses pertes (reconstruction, spectrale, contradictoire), l'équilibreur redimensionne leurs gradients afin qu'aucun objectif ne domine, stabilisant ainsi l'entraînement.

Quelle méthode de quantification de base EnCodec partage-t-il avec SoundStream ?

Comme SoundStream, EnCodec utilise la quantification vectorielle résiduelle pour discrétiser les intégrations d'encodeurs dans des index de livres de codes empilés.