ฉันทลักษณ์การสร้างแบบจำลอง
การสร้างแบบจำลองฉันทลักษณ์จะสอนให้เครื่องจักรทราบทำนองคำพูด จังหวะ ระดับเสียงสูงต่ำ ความเครียด และจังหวะที่อยู่เหนือคำ
ภาพรวม
It is what separates a flat robotic voice from one that sounds genuinely human.
เจาะลึก
ฉันทลักษณ์เป็นดนตรีของภาษา: การขึ้นลงของระดับเสียง (น้ำเสียง) ระยะเวลาของเสียง (ระยะเวลา) ความดัง (พลังงาน) และจุดที่เน้น สัญญาณเหล่านี้มีความหมายเฉพาะคำเท่านั้นที่ไม่มีความหมาย โดยส่งสัญญาณคำถามเทียบกับข้อความ การเสียดสี ความเร่งด่วน หรือคำใดที่สำคัญ ระบบแปลงข้อความเป็นคำพูดสมัยใหม่จำลองฉันทลักษณ์ด้วยโครงข่ายประสาทเทียมที่คาดเดารูปทรงของระดับเสียง ระยะเวลาหน่วยเสียง และพลังงานจากข้อความ Tacotron 2 เรียนรู้สิ่งนี้โดยปริยายผ่านความสนใจ ในขณะที่ FastSpeech 2 ทำให้ชัดเจนโดยการคาดเดาระยะเวลา ระดับเสียง และพลังงานเป็นคุณลักษณะที่สามารถฝึกแยกกันได้ ฉันทลักษณ์ที่ดีขึ้นอยู่กับบริบทที่ระบบไม่สามารถรับได้จากเครื่องหมายวรรคตอนเพียงอย่างเดียว ซึ่งเป็นเหตุผลว่าทำไมโมเดลจึงใช้ประโยคที่อยู่รอบๆ มากขึ้นและแม้แต่เสียงอ้างอิงเพื่อกำหนดโทนเสียงที่เหมาะสม
ข้อมูลเชิงลึกทางเทคนิค
ระดับเสียงจะถูกติดตามเป็นความถี่พื้นฐาน (F0) ของเสียง ซึ่งเป็นอัตราที่เส้นเสียงสั่น โมเดลอย่าง FastSpeech 2 จะเพิ่มอะแดปเตอร์ความแปรปรวนที่คาดการณ์ F0 พลังงาน และระยะเวลาต่อหน่วยเสียงเป็นสตรีมแยกกัน จากนั้นกำหนดเงื่อนไขให้กับตัวถอดรหัสสเปกโตรแกรม เนื่องจากข้อความไม่ได้กำหนดฉันทลักษณ์ (หนึ่งประโยคมีการอ่านที่ถูกต้องจำนวนมาก) นี่เป็นปัญหาแบบหนึ่งต่อกลุ่ม ดังนั้นระบบจึงใช้ค่าแฝงแบบแปรผันหรือตัวเข้ารหัสอ้างอิงเพื่อเลือกการจัดส่งที่เฉพาะเจาะจง แทนที่จะเฉลี่ยเป็นเสียงเดียว
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการสร้างแบบจำลองฉันทลักษณ์
Prosody กำลังมุ่งสู่การรับรู้บริบททั่วทั้งย่อหน้าและบทสนทนา ดังนั้นผู้บรรยายสามารถสร้างความตึงเครียดหรือแชทบอทสามารถเข้ากับอารมณ์ของผู้ใช้ได้ แบบจำลองคำพูดและภาษาขนาดใหญ่เป็นการเรียนรู้ฉันทลักษณ์ร่วมกับความหมาย ทำให้สามารถควบคุมปุ่มสำหรับการเน้น อารมณ์ และรูปแบบการพูดผ่านคำแนะนำที่เป็นข้อความธรรมดา พบกับหนังสือเสียง การพากย์ และผู้ช่วยที่นำเสนอเสียงที่แตกต่างกันไปตามธรรมชาติ พร้อมการควบคุมการเคลื่อนตัวและการหายใจได้ละเอียดยิ่งขึ้นเพื่อข้ามเส้นทางสุดท้ายของหุบเขาอันน่าพิศวง
การใช้งานจริงในโลกแห่งความเป็นจริง
ระบบคำบรรยายของหนังสือเสียงที่มีระดับเสียงและจังหวะที่แตกต่างกัน ดังนั้นบทต่างๆ จึงฟังดูสื่ออารมณ์มากกว่าเสียงเดียว
ผู้ช่วยเสมือนจะเพิ่มน้ำเสียงในตอนท้ายของคำถามใช่/ไม่ใช่ เพื่อให้ดูเหมือนเป็นคำถามอย่างชัดเจน
เครื่องมือพากย์ภาพยนตร์และวิดีโอที่ตรงกับการเน้นและจังหวะของการแสดงของนักแสดงต้นฉบับ
โปรแกรมอ่านหน้าจอสำหรับการเข้าถึงที่เน้นคำสำคัญเพื่อให้ผู้ใช้ที่ตาบอดเข้าใจประโยคได้เร็วขึ้น
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prosody Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างแบบจำลองการเรียงสับเปลี่ยน XLNet
คำถามที่พบบ่อย
What is Prosody Modeling?
การสร้างแบบจำลองฉันทลักษณ์จะสอนให้เครื่องจักรทราบทำนองคำพูด จังหวะ ระดับเสียงสูงต่ำ ความเครียด และจังหวะที่อยู่เหนือคำ เป็นสิ่งที่แยกเสียงหุ่นยนต์แบนออกจากเสียงที่ฟังดูเป็นมนุษย์อย่างแท้จริง
คุณลักษณะใดที่อธิบายฉันทลักษณ์ในคำพูดได้ดีที่สุด
ฉันทลักษณ์หมายถึงคุณสมบัติที่เหนือกว่าของคำพูด น้ำเสียง (ระดับเสียง) จังหวะและระยะเวลา ความเครียด และพลังงาน (ความดัง) ที่อยู่เหนือคำ
ในการสร้างแบบจำลองฉันทลักษณ์ ความถี่พื้นฐาน (F0) แสดงถึงอะไร?
F0 คือความถี่พื้นฐานของการเปล่งเสียง ซึ่งเป็นอัตราการสั่นของเส้นเสียง ซึ่งเราได้ยินเป็นระดับเสียงหรือทำนองของเสียง
FastSpeech 2 ปรับปรุงการควบคุมฉันทลักษณ์เหนือรุ่นก่อนหน้าได้อย่างไร
FastSpeech 2 นำเสนออะแดปเตอร์ความแปรปรวนที่คาดการณ์ระยะเวลา ระดับเสียง และพลังงานอย่างชัดเจน ทำให้สามารถควบคุมฉันทลักษณ์ได้โดยตรงและมีเสถียรภาพมากกว่าการให้ความสนใจโดยปริยายเพียงอย่างเดียว
เหตุใดการทำนายฉันทลักษณ์จากข้อความเพียงอย่างเดียวจึงถือเป็นปัญหาแบบหนึ่งต่อกลุ่ม
คำเดียวกันสามารถส่งได้หลายวิธีขึ้นอยู่กับเจตนาและอารมณ์ ดังนั้นแบบจำลองจะต้องเลือกจากการอ่านฉันทลักษณ์ที่ถูกต้องหลายรายการ แทนที่จะคำนวณคำตอบเดียว
ข้อใดที่ส่งสัญญาณโดยตรงที่สุดว่าประโยคภาษาอังกฤษที่พูดเป็นคำถามใช่หรือไม่ใช่
คำถามใช่/ไม่ใช่ในภาษาอังกฤษมักจะลงท้ายด้วยเสียงสูงต่ำ ซึ่งเป็นสัญญาณฉันทลักษณ์ที่แยกคำถามเหล่านี้ออกจากข้อความแม้จะมีคำที่เหมือนกันก็ตาม