SoundStream ตัวแปลงสัญญาณประสาท
SoundStream คือตัวแปลงสัญญาณเสียงแบบนิวรอลแบบครบวงจรของ Google ที่บีบอัดคำพูดและเพลงให้มีบิตเรตต่ำมากโดยยังคงคุณภาพไว้
ภาพรวม
It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.
เจาะลึก
SoundStream เปิดตัวโดย Google ในปี 2021 โดยเป็นตัวแปลงสัญญาณแบบนิวรัลที่สมบูรณ์ซึ่งสร้างขึ้นจากชิ้นส่วนสามชิ้นที่ฝึกร่วมกัน ได้แก่ ตัวเข้ารหัสแบบหมุนวนที่เปลี่ยนรูปคลื่นดิบให้เป็นลำดับแบบกะทัดรัดของเวกเตอร์ ตัวควอนไทเซอร์เวกเตอร์ตกค้าง (RVQ) ที่แยกเวกเตอร์เหล่านั้นออก และเครื่องถอดรหัสแบบหมุนที่สร้างรูปคลื่นขึ้นมาใหม่ ได้รับการฝึกฝนทั้งการสูญเสียการฟื้นฟูและการแบ่งแยกฝ่ายตรงข้ามแบบ GAN ดังนั้นเอาต์พุตจึงฟังดูเป็นธรรมชาติมากกว่าแค่ปิดตัวเลข คุณลักษณะที่โดดเด่นคือ 'ปรับขนาดได้' หรือการฝึกแบบควอนไทเซอร์แบบออกกลางคัน: โมเดลเดียวสามารถทำงานได้ข้ามบิตเรตตั้งแต่ประมาณ 3 ถึง 18 kbps เพียงแค่ใช้เลเยอร์ควอนไทเซอร์มากขึ้นหรือน้อยลงในการอนุมาน โดยไม่มีการฝึกใหม่ มีรายงานว่าที่ความเร็ว 3 kbps มีประสิทธิภาพเหนือกว่า Opus ที่ 12 kbps ในการทดสอบการฟัง การจัดการคำพูด เพลง และเสียงทั่วไปในรุ่นเดียวที่ทำงานแบบเรียลไทม์บน CPU ของสมาร์ทโฟน
ข้อมูลเชิงลึกทางเทคนิค
รูปคลื่นจะผ่านผ่านการโน้มน้าวแบบก้าวย่างซึ่งสุ่มตัวอย่างอย่างหนัก ทำให้เกิดหนึ่งการฝังต่อเฟรม (เช่น 75 เฟรม/วินาที) จากนั้น RVQ จะเข้ารหัสการฝังแต่ละรายการเป็นดัชนีสมุดโค้ดแบบสแต็ก บิตเรตเท่ากับอัตราเฟรมคูณจำนวนควอนไทเซอร์ที่ใช้งานอยู่คูณบิตต่อโค้ดบุ๊ค การออกกลางคันของ Quantizer จะตัดทอนสแต็ก RVQ แบบสุ่มระหว่างการฝึก โดยบังคับให้ Codebook รุ่นเก่าๆ ส่งข้อมูลที่สำคัญที่สุด ดังนั้นตัวแปลงสัญญาณจึงลดระดับลงอย่างสวยงามในอัตราที่ต่ำกว่า
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของตัวแปลงสัญญาณประสาท SoundStream
SoundStream สร้างเทมเพลตที่ตัวแปลงสัญญาณในภายหลัง เช่น EnCodec และ DAC ได้รับการปรับปรุง และโทเค็นที่แยกจากกันของมันก็กลายเป็นต้นแบบสำหรับระบบกำเนิดเช่น AudioLM และ MusicLM คาดหวังว่าผู้สืบทอดจะผลักดันไปสู่บิตเรตที่ต่ำลง โทเค็นที่มีโครงสร้างเชิงความหมายซึ่งเพิ่มเป็นสองเท่าของอินพุตไปยังเครื่องกำเนิดเสียงในรูปแบบภาษา และการปรับใช้บนอุปกรณ์ที่เข้มงวดมากขึ้นสำหรับการโทรสด เครื่องช่วยฟัง และการสตรีมที่มีแบนด์วิดท์และเวลาแฝงถูกจำกัดอย่างเข้มงวด
การใช้งานจริงในโลกแห่งความเป็นจริง
บีบอัดการโทรด้วยเสียงเป็น ~3 kbps ในขณะที่ให้เสียงที่ชัดเจนกว่าตัวแปลงสัญญาณแบบเดิมที่บิตเรตที่สูงกว่า
การสร้างโทเค็นเสียงแยกที่ป้อนโมเดลกำเนิด AudioLM และ MusicLM ของ Google
การสตรีมเสียงแบนด์วิธต่ำแบบเรียลไทม์บนอุปกรณ์มือถือพร้อมการเข้ารหัสและถอดรหัสบน CPU
การจัดเก็บหรือส่งสัญญาณเพลงและเสียงรอบข้างอย่างมีประสิทธิภาพในรูปแบบเดียวที่รองรับเนื้อหาทุกประเภท
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStream Neural Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ตัวแปลงสัญญาณเสียงประสาท
คำถามที่พบบ่อย
What is SoundStream Neural Codec?
SoundStream คือตัวแปลงสัญญาณเสียงแบบนิวรอลแบบครบวงจรของ Google ที่บีบอัดคำพูดและเพลงให้มีบิตเรตต่ำมากโดยยังคงคุณภาพไว้ เป็นเรื่องสำคัญเนื่องจากสามารถเอาชนะตัวแปลงสัญญาณแบบดั้งเดิมอย่าง Opus ได้ที่บิตเรตเดียวกัน และขับเคลื่อนโมเดลเสียงสมัยใหม่
องค์ประกอบสามข้อใดที่ประกอบเป็นสถาปัตยกรรม SoundStream
SoundStream สร้างขึ้นจากตัวเข้ารหัสแบบหมุนวน ซึ่งเป็นเวกเตอร์ควอนไทเซอร์ที่เหลือซึ่งแยกส่วนการฝังออก และตัวถอดรหัสแบบหมุนวน ซึ่งได้รับการฝึกฝนทั้งหมดตั้งแต่ต้นจนจบ
เทคนิคใดที่ทำให้โมเดล SoundStream เดียวให้บริการบิตเรตที่แตกต่างกันจำนวนมากโดยไม่ต้องฝึกอบรมใหม่
ในระหว่างการฝึก SoundStream จะสุ่มปล่อยเลเยอร์ควอไลเซอร์เพื่อให้คุณสามารถใช้ระดับ RVQ มากขึ้นหรือน้อยลงเพื่อให้ได้บิตเรตที่แตกต่างจากโมเดลหนึ่ง
ในการทดสอบการฟังของ Google มีรายงานว่า SoundStream ที่ 3 kbps มีประสิทธิภาพเหนือกว่าตัวแปลงสัญญาณใดที่ 12 kbps
SoundStream ที่ตรงกันเพียง 3 kbps หรือเอาชนะตัวแปลงสัญญาณ Opus ที่ใช้กันอย่างแพร่หลายซึ่งทำงานที่ 12 kbps ในการประเมินคุณภาพแบบอัตนัย
SoundStream ใช้สัญญาณการฝึกเพิ่มเติมประเภทใดเพื่อทำให้เสียงเอาท์พุตเป็นธรรมชาติ
นอกเหนือจากการสูญเสียในการฟื้นฟู SoundStream ยังใช้ตัวแบ่งแยกฝ่ายตรงข้าม (GAN) เพื่อให้การสร้างใหม่ฟังดูสมจริงมากกว่าที่จะปิดด้วยตัวเลขเท่านั้น
บิตเรตของ SoundStream เกี่ยวข้องกับควอนไทเซอร์อย่างไร
บิตเรตจะปรับขนาดตามจำนวนเลเยอร์ RVQ ที่ใช้งานอยู่ (อัตราเฟรมเวลาคูณบิตต่อโค้ดบุ๊ค) ดังนั้นการเพิ่มควอนไทเซอร์จะเพิ่มบิตเรตและคุณภาพ