คู่มือเสียง AI

โมเดลภาษา VALL-E และ Codec

VALL-E ปรับกรอบข้อความเป็นคำพูดใหม่เป็นปัญหาการสร้างแบบจำลองภาษาผ่านโทเค็นตัวแปลงสัญญาณเสียง ทำให้สามารถโคลนเสียงจากตัวอย่างเพียงสามวินาที

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

เจาะลึก

ประกาศโดย Microsoft ในต้นปี 2023 VALL-E ปฏิบัติต่อการสังเคราะห์คำพูดเหมือนกับการสร้างแบบจำลองภาษา แทนที่จะทำนายสเปกโตรแกรม ระบบจะทำนายโทเค็นอะคูสติกแบบแยกของตัวแปลงสัญญาณประสาท (EnCodec) ดังนั้นรุ่นจึงกลายเป็นการทำนายโทเค็นถัดไปเหนือคำศัพท์เสียง เมื่อบันทึกเสียงของผู้พูดที่มองไม่เห็นพร้อมข้อความเป้าหมายเป็นเวลา 3 วินาที VALL-E จะยังคงอยู่ในเสียงของผู้พูดนั้นต่อไป โดยรักษาเสียงต่ำและแม้แต่สภาพแวดล้อมทางเสียง ได้รับการฝึกฝนเกี่ยวกับคำพูดประมาณ 60,000 ชั่วโมง ซึ่งมากกว่าชุดข้อมูล TTS ทั่วไปอย่างมาก ซึ่งทำให้มีการโคลนแบบ Zero-Shot ที่แข็งแกร่ง เนื่องจากโทเค็นของตัวแปลงสัญญาณเป็นแบบเลเยอร์ (ผ่าน RVQ) VALL-E จึงใช้สองขั้นตอน: โมเดลแบบ autoregressive จะทำนายสตรีมโทเค็นแบบหยาบตัวแรกที่มีเงื่อนไขตามพร้อมท์ และโมเดลที่ไม่แบบ autoregressive จะเติมโทเค็นรายละเอียดที่เหลือ สูตรโคเดก-LM นี้สร้างแรงบันดาลใจให้กับผู้สืบทอดเช่น VALL-E 2 และโมเดลพื้นฐานคำพูดมากมาย

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับคือการถอดรหัสแบบไฮบริดเหนือโทเค็นตัวแปลงสัญญาณแบบลำดับชั้น ระยะ autoregressive จะทำนายโทเค็น codebook แรกที่สำคัญที่สุดทีละรายการ โดยจับฉันทลักษณ์และเนื้อหา หนังสือรหัสที่เหลือซึ่งเพิ่มรายละเอียดเสียงที่ดี จะถูกคาดการณ์แบบคู่ขนานโดยโมเดลที่ไม่ถอยอัตโนมัติซึ่งมีเงื่อนไขในสตรีมแรกและพรอมต์ของผู้พูด การแยกนี้ช่วยรักษาคุณภาพให้อยู่ในระดับสูงในขณะเดียวกันก็หลีกเลี่ยงต้นทุนในการสร้างโทเค็นทุกอันตามลำดับ และการใช้ตัวแปลงสัญญาณหมายความว่าสามารถสร้างแบบจำลองเสียงพูดและข้อความได้ด้วยกลไกของหม้อแปลงตัวเดียวกัน

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของโมเดลภาษา VALL-E และ Codec

โมเดลภาษา Codec กำลังผสานคำพูดเข้ากับโมเดลภาษาขนาดใหญ่ โดยชี้ไปที่ระบบที่เป็นหนึ่งเดียวซึ่งฟัง ให้เหตุผล และพูดในโมเดลเดียว คาดหวังความเสถียรที่ดีขึ้นและอาร์ติแฟกต์ที่น้อยลง การสร้างการสตรีมแบบเรียลไทม์ และการควบคุมอารมณ์และสไตล์ที่เข้มงวดยิ่งขึ้น การโคลนนิ่งอันทรงพลังแบบเดียวกันที่ทำให้ VALL-E มีประโยชน์สำหรับการเข้าถึงและการพากย์เสียงยังทำให้เกิดข้อกังวลเกี่ยวกับการปลอมแปลงเชิงลึกและการยินยอม ดังนั้นการใส่ลายน้ำ การป้องกันการยืนยันด้วยเสียง และรั้วกั้นนโยบายจึงกลายเป็นส่วนสำคัญของวิธีการปรับใช้ระบบเหล่านี้

การใช้งานจริงในโลกแห่งความเป็นจริง

การโคลนเสียงจากเสียงไม่กี่วินาทีสำหรับผู้ช่วยส่วนตัวหรือเครื่องมือช่วยการเข้าถึงที่ฟื้นฟูเสียงที่หายไป

การแปลและพากย์วิดีโอเป็นภาษาอื่นโดยยังคงรักษาเสียงของผู้พูดต้นฉบับ

การสร้างคำบรรยายที่แสดงออกและตรงกับบริบทซึ่งจะรักษาสภาพแวดล้อมทางเสียงของการบันทึกเสียง

ทำหน้าที่เป็นแกนหลักในการพูดในผู้ช่วยหลายรูปแบบที่ทั้งเข้าใจและสร้างเสียงพูด

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ความสามารถฉุกเฉินของโมเดลภาษาขนาดใหญ่

คำถามที่พบบ่อย

What is VALL-E and Codec Language Models?

VALL-E ปรับกรอบข้อความเป็นคำพูดใหม่เป็นปัญหาการสร้างแบบจำลองภาษาผ่านโทเค็นตัวแปลงสัญญาณเสียง ทำให้สามารถโคลนเสียงจากตัวอย่างเพียงสามวินาที มันแสดงให้เห็นว่า LLM ข้อความที่ขับเคลื่อนการทำนายโทเค็นถัดไปเดียวกันสามารถสร้างคำพูดที่เป็นธรรมชาติและแสดงออกอย่างน่าทึ่ง

แนวคิดหลักใดที่ทำให้ VALL-E แตกต่างจากระบบการอ่านออกเสียงข้อความรุ่นก่อนๆ

VALL-E ปรับกรอบ TTS ใหม่เป็นการทำนายโทเค็นถัดไปเหนือโทเค็นตัวแปลงสัญญาณเสียงแบบแยก โดยถือว่าการสร้างคำพูดเหมือนกับแบบจำลองภาษา

VALL-E ต้องใช้เสียงอ้างอิงเท่าใดในการโคลนเสียงของผู้พูดใหม่

VALL-E สามารถทำการโคลนเสียงแบบ Zero-shot จากตัวอย่างลำโพงที่มองไม่เห็นความยาวประมาณ 3 วินาที

VALL-E ใช้ตัวแปลงสัญญาณประสาทใดเพื่อสร้างโทเค็นเสียง

VALL-E สร้างจาก EnCodec ของ Meta โดยคาดการณ์โทเค็นเสียงที่แยกจากกันเพื่อสังเคราะห์คำพูด

เหตุใด VALL-E จึงใช้ทั้งระยะการถดถอยอัตโนมัติและไม่ถดถอยอัตโนมัติ

โทเค็น Codec มีลำดับชั้นผ่าน RVQ VALL-E คาดการณ์สตรีมหยาบแรกแบบถดถอยอัตโนมัติและโทเค็นรายละเอียดที่เหลือขนานกันเพื่อประสิทธิภาพ

VALL-E ได้รับการฝึกใช้ข้อมูลเสียงพูดประมาณเท่าใด ซึ่งทำให้สามารถทำการโคลนแบบ Zero-Shot ได้อย่างแข็งแกร่ง

VALL-E ได้รับการฝึกฝนเกี่ยวกับคำพูดประมาณ 60,000 ชั่วโมง ซึ่งมากกว่าชุดข้อมูล TTS ทั่วไปมาก ซึ่งช่วยเพิ่มลักษณะทั่วไปแบบ Zero-Shot