คู่มือเสียง AI

FastSpeech และ TTS แบบไม่ถอยหลังอัตโนมัติ

FastSpeech สร้างสเปกตรัมคำพูดทั้งหมดพร้อมกันแทนที่จะเป็นทีละเฟรม ทำให้การสังเคราะห์เร็วขึ้นและมีเสถียรภาพมากขึ้นอย่างมาก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It solved the slow, error-prone generation that plagued earlier autoregressive models like Tacotron.

เจาะลึก

โมเดล TTS ประสาทรุ่นก่อนๆ เช่น Tacotron 2 เป็นแบบถดถอยอัตโนมัติ โดยคาดการณ์แต่ละเฟรมเสียงที่ถูกกำหนดเงื่อนไขจากเฟรมก่อนหน้า ซึ่งจะช้าและมีแนวโน้มที่จะข้ามหรือพูดคำซ้ำเมื่อความสนใจผิดพลาด FastSpeech เปิดตัวโดย Microsoft และมหาวิทยาลัยเจ้อเจียงในปี 2019 พลิกสถานการณ์นี้ด้วยการทำนายเฟรมทั้งหมดในคราวเดียว เครือข่ายฟีดฟอร์เวิร์ดที่ใช้ Transformer ใช้หน่วยเสียง โดยคาดการณ์อย่างชัดเจนว่าแต่ละหน่วยเสียงควรมีอายุการใช้งานนานเท่าใดด้วยตัวควบคุมความยาว และขยายลำดับเป็นจำนวนเฟรมที่ถูกต้องก่อนที่จะสร้างสเปกโตรแกรมในรอบเดียว FastSpeech 2 ปรับปรุงเรื่องนี้โดยการคาดเดาระดับเสียงและพลังงานด้วย และโดยการฝึกฝนเป้าหมายที่มีระยะเวลาจากการบังคับการจัดตำแหน่ง แทนที่จะกลั่นจากแบบจำลองครูที่ช้า ทำให้ได้เสียงพูดที่เป็นธรรมชาติและควบคุมได้มากขึ้น

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับสำคัญคือตัวควบคุมความยาว เนื่องจากข้อความและเสียงมีความยาวต่างกัน FastSpeech จึงคาดการณ์ระยะเวลาสำหรับหน่วยเสียงแต่ละหน่วย และเพียงทำซ้ำสถานะที่ซ่อนอยู่ของหน่วยเสียงนั้นหลายครั้งเพื่อให้ตรงกับความยาวของสเปกโตรแกรม การจัดแนวที่ชัดเจนนี้เข้ามาแทนที่ความสนใจที่เปราะบาง การสร้างทุกเฟรมแบบขนานหมายความว่าเวลาในการอนุมานแทบจะไม่ขึ้นอยู่กับความยาวของประโยค และการลบการวนซ้ำอัตโนมัติจะช่วยลดข้อผิดพลาดแบบเรียงซ้อนของการข้ามและการซ้ำคำ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ FastSpeech และ TTS แบบไม่ถอยอัตโนมัติ

ขณะนี้การสังเคราะห์แบบไม่ถอยอัตโนมัติเป็นค่าเริ่มต้นสำหรับ TTS ที่ใช้งานจริง เนื่องจากมีความรวดเร็ว แข็งแกร่ง และควบคุมได้ ระบบในอนาคตผลักดันไปสู่การควบคุมฉันทลักษณ์ที่ละเอียดยิ่งขึ้น การสตรีมที่มีเวลาแฝงต่ำลงสำหรับแอปพลิเคชันถ่ายทอดสด และรูปแบบตั้งแต่ต้นทางถึงปลายทางที่ข้ามสเปกโตรแกรมระดับกลางไปโดยสิ้นเชิง โมเดลที่ไม่ใช่การถดถอยอัตโนมัติตามการแพร่กระจายและการไหลกำลังเพิ่มขึ้นเช่นกัน โดยผสมผสานความคล้ายคลึงกันของ FastSpeech เข้ากับคุณภาพการสร้างที่แข็งแกร่ง ในขณะที่การควบคุมระดับเสียงและระยะเวลาที่ชัดเจนยังคงมีคุณค่าสำหรับผลิตภัณฑ์เสียงที่สามารถแก้ไขได้และแสดงออก

การใช้งานจริงในโลกแห่งความเป็นจริง

แอพนำทางแบบเรียลไทม์สร้างเสียงเตือนแบบเลี้ยวต่อเลี้ยวทันทีโดยใช้การสังเคราะห์สไตล์ FastSpeech แบบขนาน

ระบบ IVR บริการลูกค้าแปลงข้อความแบบไดนามิกเป็นคำพูดในขนาดโดยไม่มีข้อผิดพลาดในการข้ามคำ

โปรแกรมอ่านหน้าจอการเข้าถึงจะสร้างเสียงพูดที่รวดเร็วและเชื่อถือได้สำหรับเอกสารขนาดยาวบนฮาร์ดแวร์ขนาดเล็ก

เครื่องมือเนื้อหาเสียงช่วยให้ผู้สร้างปรับแต่งระดับเสียงและอัตราการพูดได้โดยตรง ต้องขอบคุณตัวทำนายระดับเสียงและพลังงานที่ชัดเจนของ FastSpeech 2

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FastSpeech and Non-Autoregressive TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสังเคราะห์แบบถดถอยอัตโนมัติของเต่า TTS

คำถามที่พบบ่อย

What is FastSpeech and Non-Autoregressive TTS?

FastSpeech สร้างสเปกตรัมคำพูดทั้งหมดพร้อมกันแทนที่จะเป็นทีละเฟรม ทำให้การสังเคราะห์เร็วขึ้นและมีเสถียรภาพมากขึ้นอย่างมาก ช่วยแก้ปัญหารุ่นที่ช้าและเกิดข้อผิดพลาดได้ง่ายซึ่งรบกวนโมเดล autoregressive รุ่นก่อน ๆ เช่น Tacotron

'ไม่ถอยหลังอัตโนมัติ' หมายถึงอะไรในบริบทของ FastSpeech

การไม่ถดถอยอัตโนมัติหมายความว่าเฟรมถูกสร้างขึ้นแบบคู่ขนานในการส่งผ่านครั้งเดียว โดยไม่มีการปรับเงื่อนไขทีละรายการในเฟรมก่อนหน้า

ปัญหาใดของโมเดล autoregressive เช่น Tacotron 2 ที่ FastSpeech จัดการโดยเฉพาะ

ความสนใจแบบถดถอยอัตโนมัติอาจจัดแนวไม่ตรง ทำให้เกิดคำข้ามหรือซ้ำ และการถอดรหัสตามลำดับช้า FastSpeech แก้ไขทั้งสองอย่าง

บทบาทของ 'ตัวควบคุมความยาว' ใน FastSpeech คืออะไร

ตัวควบคุมความยาวจะขยายคุณลักษณะหน่วยเสียงตามระยะเวลาที่คาดการณ์ไว้ โดยจัดลำดับข้อความที่สั้นกว่าให้สอดคล้องกับสเปกโตรแกรมที่ยาวกว่า

FastSpeech 2 เพิ่มอะไรเมื่อเปรียบเทียบกับ FastSpeech ดั้งเดิม

FastSpeech 2 คาดการณ์ระดับเสียงและพลังงาน และใช้ระยะเวลาในการจัดตำแหน่งแบบบังคับแทนครูสอนที่ช้า ปรับปรุงความเป็นธรรมชาติและการควบคุม

เหตุใดเวลาในการอนุมานของ FastSpeech จึงแทบจะไม่เพิ่มขึ้นตามความยาวของประโยค

เนื่องจากการสร้างเป็นแบบขนาน การเพิ่มเฟรมมากขึ้นจึงไม่คูณขั้นตอนตามลำดับเหมือนกับการถอดรหัสอัตโนมัติ