เข้ารหัสการบีบอัดเสียง
EnCodec คือตัวแปลงสัญญาณเสียงแบบนิวรัลความเที่ยงตรงสูงของ Meta ที่บีบอัดคำพูดและเพลงด้วยบิตเรตที่ต่ำมากโดยมีคุณภาพทัดเทียมกับรูปแบบที่หนักกว่ามาก
ภาพรวม
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
เจาะลึก
EnCodec เปิดตัวโดย Meta AI ในปี 2022 ตามพิมพ์เขียว SoundStream ของตัวเข้ารหัส, Residual Vector Quantizer (RVQ) และตัวถอดรหัสที่ได้รับการฝึกตั้งแต่ต้นจนจบ แต่เพิ่มการปรับแต่งหลายประการ Convolutional Encoder ที่สามารถสตรีมได้ สเปกโตรแกรมหลายสเกลและการสูญเสียการสร้างโดเมนเวลาใหม่ และใช้ตัวแยกแยะฝ่ายตรงข้ามเพื่อคุณภาพการรับรู้ การสนับสนุนที่โดดเด่นคือโมเดลเอนโทรปีที่ใช้ Transformer ขนาดเล็กที่บีบอัดโค้ดเชิงปริมาณเพิ่มเติมโดยไม่สูญเสียคุณภาพ โดยบีบบิตพิเศษออกมาโดยไม่สูญเสียคุณภาพ นอกจากนี้ EnCodec ยังแนะนำบาลานเซอร์ที่จะปรับขนาดการสูญเสียการฝึกซ้อมของคู่แข่งโดยอัตโนมัติ เพื่อให้มีความเสถียร รองรับเสียงโมโนโฟนิก 24 kHz และเสียงสเตอริโอ 48 kHz ทำงานข้ามบิตเรตเช่น 1.5, 3, 6 และ 12 kbps และที่ 6 kbps จะให้คุณภาพเทียบเท่ากับ MP3 ที่ 64 kbps โทเค็นขับเคลื่อน MusicGen และ AudioGen ของ Meta
ข้อมูลเชิงลึกทางเทคนิค
ตัวเข้ารหัสของ EnCodec จะลดขนาดรูปคลื่นที่มีการบิดแบบก้าวเป็นลำดับแฝง ซึ่ง RVQ จะแปลงเป็นดัชนีสมุดโค้ดแบบเรียงซ้อน โมเดลภาษา Transformer แบบน้ำหนักเบาทำนายความน่าจะเป็นของโทเค็นเหล่านี้และรหัสเลขคณิต และกู้คืนการบีบอัดเพิ่มเติมได้ฟรี Balancer การฝึกจะปรับขนาดการไล่ระดับสีจากการสร้างใหม่ สเปกตรัม และการสูญเสียฝ่ายตรงข้าม ดังนั้นจึงไม่มีคำใดมาครอบงำ ซึ่งทำให้การฝึกแบบหลายวัตถุประสงค์มีความเสถียรตลอดช่วงบิตเรตเต็ม
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการบีบอัดเสียง EnCodec
EnCodec เป็นโทเค็นเริ่มต้นอยู่แล้วสำหรับโมเดลเสียงแบบเปิดหลายรุ่น และผู้สืบทอดของกำลังผลักดันความเที่ยงตรงที่สูงขึ้นด้วยบิตเรตที่ต่ำกว่า การสร้างสเตอริโอและเกรดดนตรีเต็มรูปแบบใหม่ และการบูรณาการที่เข้มงวดยิ่งขึ้นกับโปรแกรมสร้างข้อความเป็นเสียงและข้อความเป็นเพลง คาดว่าจะมีการใช้การสื่อสารแบนด์วิธต่ำ การสตรีมแบบเรียลไทม์ ในวงกว้างขึ้น และเป็นเลเยอร์ 'โทเค็นเสียง' มาตรฐานที่ช่วยให้สถาปัตยกรรมรูปแบบภาษาขนาดใหญ่สามารถอ่านและเขียนเสียงได้
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างโทเค็นเสียงสำหรับโปรแกรมสร้างข้อความเป็นเสียง MusicGen และ AudioGen ของ Meta
การบีบอัดเสียงพูด 24 kHz เป็น 1.5-6 kbps สำหรับการส่งข้อมูลแบบจำกัดแบนด์วิธ
เข้ารหัสเพลงสเตอริโอ 48 kHz ด้วยคุณภาพใกล้เคียง MP3 ที่บิตเรตที่สูงกว่ามาก
ทำหน้าที่เป็นตัวแปลงสัญญาณแบบดรอปอินโอเพ่นซอร์สสำหรับการวิจัยและไปป์ไลน์ ML เสียงผ่านจุดตรวจสอบที่เผยแพร่
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การฝังเสียงและการเรียนรู้การเป็นตัวแทน
คำถามที่พบบ่อย
What is EnCodec Audio Compression?
EnCodec คือตัวแปลงสัญญาณเสียงแบบนิวรัลความเที่ยงตรงสูงของ Meta ที่บีบอัดคำพูดและเพลงด้วยบิตเรตที่ต่ำมากโดยมีคุณภาพทัดเทียมกับรูปแบบที่หนักกว่ามาก สิ่งสำคัญคือเพราะมันสนับสนุนระบบเสียงเจนเนอเรชั่นสมัยใหม่และจัดส่งในรูปแบบโอเพ่นซอร์สเพื่อให้ทุกคนนำไปใช้
องค์กรใดออก EnCodec?
EnCodec เปิดตัวโดย Meta AI (FAIR) ในปี 2022 ในฐานะตัวแปลงรหัสเสียงแบบนิวรัลความเที่ยงตรงสูง
EnCodec เพิ่มองค์ประกอบพิเศษอะไรในการบีบการบีบอัดจากโทเค็นอย่างไม่สูญเสีย?
EnCodec ฝึก Transformer ขนาดเล็กเพื่อทำนายความน่าจะเป็นของโทเค็นและรหัสเลขคณิต ทำให้เกิดการบีบอัดแบบไม่สูญเสียข้อมูลเพิ่มเติมนอกเหนือจาก RVQ
ที่ความเร็วประมาณ 6 kbps คุณภาพของ EnCodec ได้รับการรายงานว่าเทียบได้กับ MP3 ที่บิตเรตประมาณเท่าใด
EnCodec ที่ 6 kbps ให้คุณภาพเชิงอัตนัยที่คล้ายคลึงกับ MP3 ที่ 64 kbps ซึ่งเป็นประสิทธิภาพที่เพิ่มขึ้นอย่างมาก
'บาลานเซอร์' ของ EnCodec แก้ปัญหาอะไรในระหว่างการฝึกอบรม
ด้วยการสูญเสียมากมาย (การสร้างใหม่ สเปกตรัม ฝ่ายตรงข้าม) บาลานเซอร์จะปรับขนาดการไล่ระดับสีใหม่ ดังนั้นจึงไม่มีเป้าหมายเดียวมาครอบงำ และทำให้การฝึกมีความเสถียร
EnCodec แชร์วิธีการหาปริมาณหลักใดกับ SoundStream
เช่นเดียวกับ SoundStream EnCodec ใช้การหาปริมาณเวกเตอร์ที่เหลือเพื่อแยกการฝังตัวเข้ารหัสลงในดัชนีสมุดโค้ดแบบเรียงซ้อน