การสร้างเสียงแบบขนาน SoundStorm
SoundStorm คือโมเดลการสร้างเสียง Google ที่สร้างเสียงพูดและเสียงแบบขนานแทนที่จะเป็นโทเค็นทีละอัน ทำให้การสังเคราะห์เสียงคุณภาพสูงเร็วขึ้นอย่างมาก
ภาพรวม
It matters because it cuts generation latency for long clips from minutes to seconds without sacrificing fidelity.
เจาะลึก
SoundStorm เปิดตัวโดย Google ในปี 2023 สร้างเสียงที่แสดงเป็นโทเค็นอะคูสติกแบบแยกจากตัวแปลงสัญญาณประสาทที่เรียกว่า SoundStream รุ่นก่อนหน้านี้ เช่น AudioLM จะสร้างโทเค็นเหล่านี้แบบถดถอยอัตโนมัติ โดยคาดการณ์แต่ละโทเค็นตามลำดับ ซึ่งจะช้าสำหรับเสียงที่ยาว SoundStorm ใช้วิธีการมาสก์แบบไม่ถอยหลังอัตโนมัติแทน ซึ่งยืมมาจากโมเดลการสร้างภาพ เช่น MaskGIT มันเริ่มต้นด้วยโทเค็นที่ถูกปกปิดเป็นส่วนใหญ่ และเติมโทเค็นเหล่านั้นซ้ำๆ ในขั้นตอนการถอดรหัสหลายขั้นตอน โดยทำนายโทเค็นหลายรายการพร้อมกัน เมื่อปรับสภาพด้วยโทเค็นความหมาย (จากโมเดลอย่าง AudioLM หรือ SPEAR-TTS) มันสามารถสังเคราะห์บทสนทนาที่เป็นธรรมชาติ 30 วินาทีในเวลาประมาณครึ่งวินาทีบน TPU ซึ่งเร็วกว่าเส้นฐานแบบถอยหลังอัตโนมัติประมาณ 100 เท่า ในขณะเดียวกันก็จับคู่คุณภาพและความสม่ำเสมอของลำโพง
ข้อมูลเชิงลึกทางเทคนิค
SoundStorm จำลองลำดับชั้นของระดับเวกเตอร์ควอนตัมตกค้าง (RVQ) จาก SoundStream ในระหว่างการฝึก โทเค็นแบบสุ่มจะถูกปกปิด และโมเดลเรียนรู้ที่จะทำนายโทเค็นเหล่านั้น ในการอนุมาน ระบบจะทำการถอดรหัสแบบคู่ขนานตามความมั่นใจ โดยในการวนซ้ำแต่ละครั้ง ระบบจะคาดการณ์โทเค็นที่ถูกปกปิดทั้งหมด เก็บโทเค็นที่มีความมั่นใจมากที่สุด และมาสก์ส่วนที่เหลืออีกครั้ง โดยจะถอดรหัสระดับ RVQ แบบหยาบก่อน จากนั้นค่อยถอดรหัส เพื่อให้ได้เสียงเต็มรูปแบบในขั้นตอนที่น้อยกว่าการสร้างโทเค็นต่อโทเค็นมาก
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการสร้างเสียงแบบขนาน SoundStorm
การถอดรหัสแบบมาส์กคู่ขนานกำลังกลายเป็นเครื่องมือมาตรฐานสำหรับเสียงที่รวดเร็วและควบคุมได้ คาดว่าจะเพิ่มพลังให้กับตัวแทนการสนทนาแบบเรียลไทม์ การสังเคราะห์เสียงทันที และการสร้างพอดแคสต์หรือหนังสือเสียงในรูปแบบยาว ซึ่งเมื่อเวลาแฝงทำให้โมเดลการถดถอยอัตโนมัติทำไม่ได้ เมื่อรวมเข้ากับเงื่อนไขความหมายและลายน้ำที่แข็งแกร่งยิ่งขึ้น จะปรับปรุงความสมจริงของบทสนทนาและความสามารถในการตรวจสอบย้อนกลับ แนวคิดการปรับปรุงซ้ำแบบเดียวกันนี้มีแนวโน้มที่จะผสานเข้ากับแนวทางการแพร่กระจาย ซึ่งทำให้เส้นแบ่งระหว่างตัวแปลงสัญญาณโทเค็นและเครื่องกำเนิดเสียงต่อเนื่องไม่ชัดเจน
การใช้งานจริงในโลกแห่งความเป็นจริง
สร้างบทสนทนาพูด 30 วินาทีสำหรับผู้ช่วยเสียง AI ภายในไม่ถึงวินาที
การสังเคราะห์การสนทนาหลายรอบด้วยเสียงของผู้พูดที่สอดคล้องกันสำหรับการสร้างต้นแบบ
ขับเคลื่อนการอ่านออกเสียงข้อความที่มีความหน่วงต่ำในเอเจนต์เชิงโต้ตอบที่โมเดลการถดถอยอัตโนมัติล่าช้า
สร้างเสียงบรรยายในรูปแบบยาวได้อย่างรวดเร็วโดยการเติมโทเค็นเสียงแบบคู่ขนาน
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStorm Parallel Audio Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การกระจายเสียงแฝงที่เสถียร
คำถามที่พบบ่อย
What is SoundStorm Parallel Audio Generation?
SoundStorm คือโมเดลการสร้างเสียง Google ที่สร้างเสียงพูดและเสียงแบบขนานแทนที่จะเป็นโทเค็นทีละอัน ทำให้การสังเคราะห์เสียงคุณภาพสูงเร็วขึ้นอย่างมาก เป็นเรื่องสำคัญเนื่องจากจะลดเวลาแฝงในการสร้างคลิปที่ยาวจากนาทีเหลือเพียงวินาทีโดยไม่สูญเสียความเที่ยงตรง
นวัตกรรมสำคัญที่ทำให้ SoundStorm เร็วกว่า AudioLM คืออะไร?
SoundStorm เข้ามาแทนที่การสร้างโทเค็นต่อโทเค็นแบบ autoregressive ที่ช้า ด้วยการถอดรหัสแบบขนานที่ไม่ถอยอัตโนมัติ โดยคาดการณ์โทเค็นจำนวนมากพร้อมกัน
SoundStorm ปรับใช้เทคนิคใดจากการสร้างภาพ?
SoundStorm ยืมกลยุทธ์การถอดรหัสแบบมาสก์และเติมแบบอิงความมั่นใจ ซึ่งเป็นที่นิยมโดย MaskGIT ในการสังเคราะห์ภาพ
SoundStorm สร้างการนำเสนอแบบใด?
SoundStorm คาดการณ์โทเค็นเสียงแบบแยกที่สร้างโดยตัวแปลงสัญญาณ SoundStream ซึ่งต่อมาจะถูกถอดรหัสเป็นรูปแบบคลื่น
SoundStorm ใช้เวลานานเท่าใดโดยประมาณในการสร้างเสียง 30 วินาทีบน TPU
SoundStorm สามารถสังเคราะห์เสียง 30 วินาทีในเวลาประมาณ 0.5 วินาที ซึ่งเร็วกว่าพื้นฐานแบบถอยอัตโนมัติประมาณ 100 เท่า
SoundStorm ตัดสินใจได้อย่างไรว่าจะเก็บโทเค็นที่ทำนายไว้ในระหว่างการถอดรหัส
ในการวนซ้ำแต่ละครั้ง จะรักษาการทำนายโทเค็นความมั่นใจสูงสุดไว้ และมาสก์การทำนายที่ไม่แน่นอนอีกครั้งในการผ่านครั้งถัดไป