Pemampatan Audio EnCodec
EnCodec ialah codec audio neural kesetiaan tinggi Meta yang memampatkan pertuturan dan muzik pada kadar bit yang sangat rendah dengan kualiti yang menyaingi format yang jauh lebih berat.
Gambaran keseluruhan
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Menyelam dalam
Dikeluarkan oleh Meta AI pada tahun 2022, EnCodec mengikuti rangka tindakan SoundStream pengekod, pengkuantiti vektor sisa (RVQ) dan penyahkod yang dilatih hujung ke hujung, tetapi menambah beberapa pemurnian. Ia menggunakan pengekod konvolusi berkemampuan penstriman, spektrogram berskala dan kerugian pembinaan semula domain masa, dan diskriminator lawan untuk kualiti persepsi. Sumbangan ketara ialah model entropi kecil berasaskan Transformer yang memampatkan lagi kod terkuantisasi tanpa kehilangan, memerah bit tambahan tanpa kehilangan kualiti. EnCodec juga memperkenalkan pengimbang yang secara automatik menskalakan banyak kerugian latihan yang bersaing supaya ia kekal stabil. Ia mengendalikan audio stereo 24 kHz monofonik dan 48 kHz, beroperasi merentasi kadar bit seperti 1.5, 3, 6 dan 12 kbps, dan pada 6 kbps mencapai kualiti yang setanding dengan MP3 pada 64 kbps. Kuasa tokennya Meta's MusicGen dan AudioGen.
Wawasan Teknikal
Pengekod EnCodec menurunkan sampel bentuk gelombang dengan lilitan berjalur ke dalam urutan terpendam, yang RVQ menukarkan kepada indeks buku kod bertindan. Model bahasa Transformer yang ringan meramalkan kebarangkalian token ini dan mengodkan aritmetiknya, memulihkan pemampatan selanjutnya secara percuma. Pengimbang latihan menskalakan semula sumbangan kecerunan daripada pembinaan semula, kerugian spektrum dan lawan supaya tiada satu istilah pun menguasai, yang memastikan latihan berbilang objektif stabil merentas julat kadar bit penuh.
Kesan Strategik
Akses dan capai
Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.
Kos dan bajet
Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.
Kelajuan dan skala
Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.
Masa Depan Pemampatan Audio EnCodec
EnCodec sudah pun menjadi tokenizer lalai untuk beberapa model audio generatif terbuka, dan keturunannya mendorong kesetiaan yang lebih tinggi pada kadar bit yang lebih rendah, pembinaan semula stereo penuh dan gred muzik, dan penyepaduan yang lebih ketat dengan penjana teks-ke-audio dan teks-ke-muzik. Jangkakan penggunaan yang lebih luas dalam komunikasi lebar jalur rendah, penstriman masa nyata dan sebagai lapisan 'token audio' standard yang membenarkan seni bina gaya model bahasa yang besar membaca dan menulis bunyi.
Pelaksanaan Dunia Sebenar
Tokenizing audio untuk penjana teks-ke-audio MusicGen dan AudioGen Meta
Memampatkan pertuturan 24 kHz kepada 1.5-6 kbps untuk penghantaran terhad lebar jalur
Pengekodan muzik stereo 48 kHz dengan kualiti berhampiran MP3 pada kadar bit yang lebih tinggi
Berkhidmat sebagai codec drop-in sumber terbuka untuk penyelidikan dan saluran paip ML audio melalui pusat pemeriksaan yang dikeluarkan
Risiko & Pengawal
Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.
Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.
Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.
Hala Tuju Pelaksanaan
Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.
Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.
Tentukan bila manusia mesti menyemak atau meluluskan output.
Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Pembenaman Audio dan Pembelajaran Perwakilan
Soalan lazim
What is EnCodec Audio Compression?
EnCodec ialah codec audio neural kesetiaan tinggi Meta yang memampatkan pertuturan dan muzik pada kadar bit yang sangat rendah dengan kualiti yang menyaingi format yang jauh lebih berat. Ia penting kerana ia menyokong sistem audio generatif moden dan dihantar dalam bentuk sumber terbuka untuk digunakan oleh sesiapa sahaja.
Organisasi manakah yang mengeluarkan EnCodec?
EnCodec telah diperkenalkan oleh Meta AI (FAIR) pada tahun 2022 sebagai codec audio neural kesetiaan tinggi.
Apakah komponen tambahan yang EnCodec tambah untuk memerah lebih banyak pemampatan daripada tokennya?
EnCodec melatih Transformer kecil untuk meramalkan kebarangkalian token dan kod aritmetiknya, mencapai pemampatan tanpa kehilangan tambahan di atas RVQ.
Pada kira-kira 6 kbps, kualiti EnCodec dilaporkan setanding dengan MP3 pada kadar bit berapa?
EnCodec pada 6 kbps mencapai kualiti subjektif serupa dengan MP3 pada 64 kbps, peningkatan kecekapan yang besar.
Apakah masalah yang 'pengimbang' EnCodec selesaikan semasa latihan?
Dengan banyak kerugian (pembinaan semula, spektrum, lawan), pengimbang menskalakan semula kecerunan mereka supaya tiada objektif tunggal menguasai, menstabilkan latihan.
Kaedah pengkuantitian teras manakah yang EnCodec kongsi dengan SoundStream?
Seperti SoundStream, EnCodec menggunakan pengkuantitian vektor sisa untuk mendiskrisikan pembenaman pengekod ke dalam indeks buku kod bertindan.