ตัวแปลงสัญญาณเสียงประสาท
ตัวแปลงสัญญาณเสียงแบบนิวรอลใช้การเรียนรู้เชิงลึกเพื่อบีบอัดเสียงเป็นสตรีมเล็กๆ ของโทเค็นแยกกัน และสร้างใหม่ด้วยความเที่ยงตรงสูง
ภาพรวม
พวกเขาทั้งสองบดขยี้แบนด์วิธสำหรับการโทรและการสตรีม และจัดเตรียมคำศัพท์โทเค็นที่โมเดลภาษาเสียงพูด
เจาะลึก
ตัวแปลงสัญญาณเสียงแบบนิวรัลคือเครือข่ายนิวรัลของตัวเข้ารหัส-ตัวถอดรหัสที่ได้รับการฝึกให้บีบอัดเสียงและสร้างเสียงขึ้นมาใหม่ ตัวเข้ารหัสจะเปลี่ยนรูปคลื่นให้กลายเป็นค่าแฝงขนาดกะทัดรัด ควอนไทเซอร์จะสแนปซึ่งแฝงอยู่ในรายการในหนังสือโค้ดที่เรียนรู้ซึ่งผลิตโทเค็นแยกกัน และเครื่องถอดรหัสจะสร้างรูปคลื่นขึ้นมาใหม่ เทคนิคสำคัญคือ Residual Vector Quantization (RVQ) ซึ่งใช้โดย SoundStream ของ Google และ EnCodec ของ Meta: หนังสือโค้ดหลายเล่มจะถูกซ้อนกัน โดยแต่ละเล่มจะเข้ารหัสข้อผิดพลาดที่เหลือจากรายการก่อนหน้า ดังนั้นคุณจึงสามารถแลกเปลี่ยนบิตเรตกับคุณภาพได้โดยใช้ Codebook ไม่มากก็น้อย โมเดลเหล่านี้ให้คุณภาพที่น่าประทับใจด้วยบิตเรตที่ต่ำมาก ซึ่งบางครั้งก็ไม่กี่กิโลบิตต่อวินาที ซึ่งเหนือกว่าตัวแปลงสัญญาณแบบคลาสสิกอย่าง Opus หรือ MP3 สิ่งที่สำคัญที่สุดคือโทเค็นแบบแยกเป็นสิ่งที่โมเดลอย่าง VALL-E และ MusicGen สร้างขึ้นอย่างแน่นอน
ข้อมูลเชิงลึกทางเทคนิค
RVQ คือหัวใจของการออกแบบ สมุดโค้ดเล่มแรกจะบันทึกการประมาณแบบหยาบ และสมุดโค้ดเล่มต่อมาจะระบุปริมาณข้อผิดพลาดที่หลงเหลือ โดยจัดชั้นรายละเอียดปลีกย่อยให้ละเอียดยิ่งขึ้น การฝึกอบรมผสมผสานการสูญเสียการสร้างใหม่ ซึ่งมักจะเกิดขึ้นทั้งในโดเมนเวลาและสเปกตรัม พร้อมด้วยตัวแบ่งแยกที่ขัดแย้งกันซึ่งทำให้เอาต์พุตฟังดูสมจริง บวกกับการสูญเสียความมุ่งมั่นที่ทำให้เอาต์พุตของตัวเข้ารหัสใกล้กับรายการ Codebook ที่เลือก ผลลัพธ์ที่ได้คือการนำเสนอแบบลำดับชั้นที่ไม่ต่อเนื่องซึ่งสามารถบีบอัดได้และง่ายสำหรับหม้อแปลงดาวน์สตรีมในการสร้างแบบจำลอง
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของตัวแปลงสัญญาณเสียงแบบประสาท
ตัวแปลงสัญญาณกำลังมาบรรจบกันเพื่อให้ได้บิตเรตที่ต่ำกว่าด้วยหนังสือโค้ดที่น้อยลง ทำให้โทเค็นเสียงราคาถูกสำหรับการสร้างโมเดลภาษา การวิจัยกำลังผลักดันไปสู่การสตรีม รูปแบบที่มีความหน่วงต่ำสำหรับการสื่อสารแบบเรียลไทม์ และไปสู่ตัวแปลงสัญญาณแบบรวมที่จัดการคำพูด เพลง และเสียงทั่วไปในรุ่นเดียว เมื่อเสียงทั่วไประเบิดขึ้น ตัวแปลงสัญญาณจะได้รับการปฏิบัติเหมือนเป็นโทเค็นที่ใช้ร่วมกันสำหรับทั้งสาขามากขึ้น ดังนั้นการปรับปรุงที่นี่จึงกระเพื่อมไปยังโมเดลการอ่านออกเสียงข้อความและเพลงทุกรูปแบบที่สร้างขึ้นด้านบน
การใช้งานจริงในโลกแห่งความเป็นจริง
การบีบอัดเสียงสำหรับการโทรที่มีแบนด์วิธต่ำเป็นพิเศษและแอปสไตล์เครื่องส่งรับวิทยุ
จัดเตรียมรูปแบบโทเค็นแยกที่ VALL-E, AudioLM และ MusicGen สร้างขึ้น
การจัดเก็บและการสตรีมเสียงคุณภาพสูงที่มีประสิทธิภาพด้วยบิตเรต MP3 เพียงเล็กน้อย
การส่งเสียงพูดแบบเรียลไทม์ในสภาวะเครือข่ายที่มีสัญญาณรบกวนหรือถูกจำกัด
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Neural Audio Codecs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
SoundStream ตัวแปลงสัญญาณประสาท
คำถามที่พบบ่อย
ตัวแปลงสัญญาณเสียงประสาทคืออะไร?
ตัวแปลงสัญญาณเสียงแบบนิวรอลใช้การเรียนรู้เชิงลึกเพื่อบีบอัดเสียงเป็นสตรีมเล็กๆ ของโทเค็นแยกกัน และสร้างใหม่ด้วยความเที่ยงตรงสูง พวกเขาทั้งสองบดขยี้แบนด์วิธสำหรับการโทรและการสตรีม และจัดเตรียมคำศัพท์โทเค็นที่โมเดลภาษาเสียงพูด
ตัวแปลงสัญญาณเสียงแบบนิวรอลทำหน้าที่สองประการหลักอะไรบ้าง
ตัวแปลงสัญญาณประสาทคือเครือข่ายตัวเข้ารหัส-ตัวถอดรหัสที่บีบอัดรูปคลื่นให้เป็นโทเค็นแยกที่มีขนาดกะทัดรัด จากนั้นจึงสร้างเสียงจากโทเค็นเหล่านั้นขึ้นมาใหม่
เทคนิคการหาปริมาณใดที่เป็นศูนย์กลางของตัวแปลงสัญญาณเช่น SoundStream และ EnCodec
RVQ ซ้อน Codebooks หลายชุดโดยแต่ละชุดเข้ารหัสข้อผิดพลาดที่เหลืออยู่ของชุดก่อนหน้า ทำให้เกิดการแลกเปลี่ยนคุณภาพกับบิตเรต
ใน Residual Vector Quantization แต่ละ Codebook ที่ต่อเนื่องกันเข้ารหัสอะไร
สมุดโค้ดเล่มแรกให้ค่าประมาณแบบหยาบ และสมุดโค้ดเล่มหลังๆ จะคำนวณปริมาณข้อผิดพลาดที่เหลือ เพิ่มรายละเอียดปลีกย่อย
เหตุใดตัวแปลงสัญญาณเสียงแบบนิวรอลจึงมีความสำคัญสำหรับโมเดลเสียงเชิงสร้างสรรค์
โทเค็นแบบแยกที่สร้างโดยตัวแปลงสัญญาณจะกลายเป็นคำศัพท์ที่แบบจำลองภาษาเสียงทำนายและสร้าง
การใช้ codebooks มากขึ้นในตัวแปลงสัญญาณประสาทส่งผลต่อผลลัพธ์อย่างไร
การเพิ่ม codebooks จะเพิ่มบิตเรตแต่เก็บรายละเอียดได้มากขึ้น ปรับปรุงความเที่ยงตรง ใช้คุณภาพการค้าน้อยลงในการบีบอัด