คู่มือเสียง AI

คำพูดที่เป็นธรรมชาติและการแพร่กระจายแฝง TTS

NaturalSpeech เป็นกลุ่มงานวิจัยของ Microsoft TTS ที่มุ่งเป้าไปที่คุณภาพคำพูดในระดับมนุษย์ โดยเวอร์ชันต่อมาจะใช้การแพร่กระจายแบบแฝงเพื่อสร้างเสียงที่เข้มข้นและเป็นธรรมชาติ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It shows how diffusion models, famous for images, can produce expressive, controllable audio.

เจาะลึก

NaturalSpeech ดั้งเดิม (2022) เป็นระบบแรกที่รายงานว่ามีคุณภาพระดับมนุษย์ตามเกณฑ์มาตรฐาน LJSpeech ซึ่งตัดสินโดยผู้ฟังที่ไม่สามารถบอกได้อย่างน่าเชื่อถือจากการบันทึกจริง ใช้ตัวเข้ารหัสอัตโนมัติแบบแปรผันพร้อมคีย์เวิร์ดที่จับคู่อย่างระมัดระวังเพื่อปิดช่องว่างระหว่างการฝึกและการอนุมาน จากนั้น NaturalSpeech 2 จึงนำแนวทางการแพร่กระจายแบบแฝงมาใช้ โดยคำพูดจะถูกเข้ารหัสโดยตัวแปลงสัญญาณเสียงแบบนิวรัลให้เป็นเวกเตอร์แฝงแบบต่อเนื่อง และแบบจำลองการแพร่กระจายจะเรียนรู้ที่จะสร้างค่าแฝงเหล่านั้นจากข้อความ ซึ่งช่วยให้สามารถโคลนเสียงแบบ Zero-shot ที่แข็งแกร่งได้จากข้อความแจ้งสั้นๆ NaturalSpeech 3 นำเสนอการกระจายแบบแยกตัวประกอบ โดยแยกคำพูดออกเป็นคุณลักษณะที่ไม่พันกัน เช่น เนื้อหา ฉันทลักษณ์ จังหวะเสียง และรายละเอียดทางเสียง เพื่อให้แต่ละรายการสามารถสร้างแบบจำลองและควบคุมได้อย่างอิสระเพื่อความเที่ยงตรงและความยืดหยุ่นที่สูงขึ้น

ข้อมูลเชิงลึกทางเทคนิค

การแพร่กระจายแฝงทำงานโดยการเพิ่มเสียงรบกวนให้กับการแสดงคำพูดแฝงขนาดกะทัดรัด และฝึกเครือข่ายเพื่อย้อนกลับเสียงรบกวนนั้นทีละขั้นตอน แทนที่จะลดสัญญาณรบกวนของรูปคลื่นดิบหรือสเปกโตรแกรมแบบเต็ม NaturalSpeech 2 จะปฏิเสธค่าแฝงของโคเดกซึ่งมีมิติต่ำกว่าและง่ายต่อการสร้างแบบจำลอง การปรับเงื่อนไขข้อความและเสียงอ้างอิงจะควบคุมการแพร่กระจายแบบย้อนกลับ ดังนั้นค่าแฝงตัวอย่างสุดท้ายจึงถอดรหัสเป็นคำพูดที่ตรงกับเนื้อหาที่ร้องขอและข้อมูลประจำตัวของผู้พูด

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ TTS คำพูดที่เป็นธรรมชาติและการแพร่กระจายที่แฝงอยู่

TTS แบบกระจายและแยกตัวประกอบชี้ไปที่เสียงที่ไม่เพียงแต่เป็นธรรมชาติแต่ยังควบคุมทิศทางได้อย่างประณีต ทำให้ผู้ใช้สามารถปรับเสียงต่ำ อารมณ์ และเสียงฉันทลักษณ์ได้ตามแป้นหมุนอิสระ คาดหวังการสุ่มตัวอย่างที่รวดเร็วยิ่งขึ้นผ่านการกลั่นและการแพร่กระจายไม่กี่ขั้นตอน การโคลนแบบ Zero-shot ที่แข็งแกร่งขึ้นจากวินาทีของเสียง และการผสานรวมที่เข้มงวดยิ่งขึ้นกับโมเดลภาษาขนาดใหญ่สำหรับการจัดส่งแบบ Context-Aware ความก้าวหน้าเหล่านี้ยังเพิ่มความจำเป็นในการใส่ลายน้ำและการป้องกันการยินยอมเนื่องจากการโคลนที่มีความเที่ยงตรงสูงทำให้เกิดความเสี่ยงในการใช้งานในทางที่ผิดอย่างชัดเจน

การใช้งานจริงในโลกแห่งความเป็นจริง

สตูดิโอพากย์เสียงเลียนแบบเสียงของนักแสดงจากตัวอย่างสั้นๆ เพื่อแปลภาพยนตร์ โดยใช้การโคลนแบบ Zero-shot สไตล์ NaturalSpeech 2

แพลตฟอร์มหนังสือเสียงสร้างคำบรรยายในระดับมนุษย์ที่ผู้ฟังประสบปัญหาในการแยกความแตกต่างจากพรสวรรค์ด้านเสียงที่แท้จริง

เครื่องมือช่วยการเข้าถึงจะสร้างเสียงของบุคคลขึ้นมาใหม่จากการบันทึกเก่าๆ สำหรับผู้ที่สูญเสียคำพูด

ชุดการสร้างเนื้อหาช่วยให้ผู้แก้ไขสามารถปรับเสียงต่ำและเสียงฉันทลักษณ์ได้อย่างอิสระ โดยใช้ประโยชน์จากคุณลักษณะที่แยกตัวประกอบของ NaturalSpeech 3

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NaturalSpeech and Latent Diffusion TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การกระจายเสียงแฝงที่เสถียร

คำถามที่พบบ่อย

What is NaturalSpeech and Latent Diffusion TTS?

NaturalSpeech เป็นกลุ่มงานวิจัยของ Microsoft TTS ที่มุ่งเป้าไปที่คุณภาพคำพูดในระดับมนุษย์ โดยเวอร์ชันต่อมาจะใช้การแพร่กระจายแบบแฝงเพื่อสร้างเสียงที่เข้มข้นและเป็นธรรมชาติ โดยแสดงให้เห็นว่าโมเดลการแพร่กระจายซึ่งมีชื่อเสียงในด้านรูปภาพ สามารถสร้างเสียงที่แสดงออกและควบคุมได้อย่างไร

NaturalSpeech ดั้งเดิม (2022) รายงานว่าบรรลุเป้าหมายอะไร

NaturalSpeech ได้รับการรายงานว่าเป็นระบบแรกที่เข้าถึงคุณภาพระดับมนุษย์บน LJSpeech โดยผู้ฟังไม่สามารถแยกแยะความแตกต่างจากคำพูดจริงได้อย่างน่าเชื่อถือ

โมเดลการแพร่กระจายแฝงของ NaturalSpeech 2 สร้างขึ้นจากอะไรจริง ๆ

NaturalSpeech 2 แพร่กระจายผ่านค่าแฝงของตัวแปลงสัญญาณ ซึ่งมีขนาดกะทัดรัดและง่ายต่อการสร้างแบบจำลองมากกว่ารูปคลื่นดิบ จากนั้นถอดรหัสเป็นเสียง

โมเดลการแพร่กระจายสร้างข้อมูลในระดับสูงได้อย่างไร

การแพร่กระจายจะเพิ่มเสียงรบกวนในระหว่างการฝึกซ้อม และเรียนรู้ที่จะย้อนกลับ สร้างตัวอย่างโดยค่อยๆ ลดเสียงรบกวนจากเสียงรบกวนแบบสุ่ม

การแพร่กระจายแฝงให้ NaturalSpeech 2 มีความสามารถหลักอะไรบ้าง

ด้วยการปรับเงื่อนไขเสียงพูดสั้นๆ NaturalSpeech 2 สามารถโคลนเสียงของผู้พูดที่ไม่เคยได้รับการฝึกฝนอย่างชัดเจน

แนวคิดหลักของ 'การกระจายตัวประกอบ' ของ NaturalSpeech 3 คืออะไร

การแพร่กระจายแบบแยกตัวประกอบจะแยกเนื้อหา ฉันทลักษณ์ เสียงต่ำ และรายละเอียดทางเสียงให้ไม่พันกัน เพื่อให้แต่ละคุณลักษณะสามารถสร้างแบบจำลองและควบคุมแยกกันได้