คู่มือเสียง AI

การสังเคราะห์คำพูดทางอารมณ์

การสังเคราะห์คำพูดตามอารมณ์จะสร้างเสียงที่ฟังดูมีความสุข เศร้า โกรธ หรือสงบ ไม่ใช่แค่เข้าใจง่ายแต่รู้สึกได้อย่างน่าเชื่อถือ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It turns flat text-to-speech into delivery that conveys how something is meant, not only what is said.

เจาะลึก

การสังเคราะห์คำพูดทางอารมณ์จะขยายการอ่านออกเสียงข้อความ ดังนั้นผลลัพธ์จึงส่งผลกระทบตามที่ตั้งใจไว้ เช่น ความยินดี ความโกรธ ความกลัว หรือความอ่อนโยน อารมณ์จะแสดงออกมาด้วยเสียงผ่านฉันทลักษณ์ ระดับที่สูงขึ้นและแปรผันมากขึ้นสำหรับความตื่นเต้น จังหวะช้าลงและพลังงานลดลงสำหรับความเศร้า การโจมตีที่คมชัดยิ่งขึ้นสำหรับความโกรธ รวมถึงการเปลี่ยนแปลงคุณภาพเสียง เช่น ลมหายใจหรือความตึงเครียด ระบบเรียนรู้รูปแบบเหล่านี้จากกลุ่มคำพูดตามอารมณ์ที่มีป้ายกำกับ และให้ผู้ใช้เลือกอารมณ์ ซึ่งมักจะใช้ปุ่มปรับความเข้มข้น การออกแบบมีตั้งแต่ป้ายอารมณ์ที่แยกจากกันซึ่งป้อนเป็นการฝัง ไปจนถึงพิกัดวาเลนซ์-เร้าอารมณ์อย่างต่อเนื่อง และการถ่ายโอนรูปแบบเสียงอ้างอิง ส่วนที่ยากคือข้อมูลทางอารมณ์ที่หายากและสมดุล ทำให้สามารถควบคุมความเข้มข้นได้โดยไม่บิดเบือนคำพูด และหลีกเลี่ยงภาพการ์ตูนล้อเลียนที่เกินความรู้สึกของเป้าหมาย

ข้อมูลเชิงลึกทางเทคนิค

มีแผนการควบคุมทั่วไปสองแผน โมเดลแบบแบ่งหมวดหมู่จะแนบการฝังการเรียนรู้สำหรับแต่ละอารมณ์ที่มีป้ายกำกับเข้ากับซินธิไซเซอร์ เช่น สวิตช์ แบบจำลองมิติจะใช้แกนวาเลนต์ต่อเนื่อง (น่าพอใจและไม่พึงประสงค์) และความเร้าอารมณ์ (สงบและตื่นเต้น) แทน เพื่อให้อารมณ์ผสมผสานและปรับขนาดได้อย่างราบรื่น หลายระบบเพิ่มตัวเข้ารหัสอ้างอิง (แนวทางโทเค็นสไตล์สากล) ที่แยกสไตล์ทางอารมณ์จากคลิปตัวอย่าง ความเข้มมักถูกจัดการโดยการปรับขนาดอารมณ์ที่ฝังอยู่หรือสอดแทรกไปสู่การเรนเดอร์ที่เป็นกลาง

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการสังเคราะห์คำพูดทางอารมณ์

ระบบในอนาคตจะอ่านอารมณ์จากบริบท แทนที่จะต้องใช้แท็กที่ชัดเจน โดยเลือกโทนเสียงที่เหมาะสมสำหรับจังหวะของเรื่องราวหรือความทุกข์ของผู้ใช้โดยอัตโนมัติ โมเดลต่อเนื่องขนาดใหญ่เริ่มปฏิบัติตามคำสั่งที่เป็นภาษาธรรมชาติ เช่น 'พูดเบาๆ แต่กังวล' ทำให้เกิดอารมณ์ที่ละเอียดอ่อน ผสมปนเป และเปลี่ยนแปลงไปในคำพูดเดียว คาดหวังตัวละครในเกมที่เหมือนจริงมากขึ้น เสียงสนับสนุนที่เห็นอกเห็นใจ และเสียงด้านการดูแลสุขภาพ และผู้ช่วยเหลือส่วนบุคคล ควบคู่ไปกับการให้ความสำคัญกับการยินยอม การเปิดเผย และการป้องกันการบิดเบือนทางอารมณ์ที่บิดเบือนมากขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

ตัวละครในวิดีโอเกมซึ่งมีเส้นแบ่งระหว่างความกลัว ความโกรธ และความโล่งใจเพื่อให้เข้ากับเรื่องราวที่กำลังเปิดเผย

แชทบอทด้านสุขภาพจิตและสหายที่ตอบสนองด้วยน้ำเสียงอบอุ่นและสงบเมื่อผู้ใช้ส่งเสียงวิตก

ภาพยนตร์แอนิเมชันและการพากย์ที่ใช้เสียงสังเคราะห์ในการแสดงอารมณ์ตามความต้องการ

หนังสือเสียงและการบรรยายผ่านอีเลิร์นนิงที่สื่อถึงความตื่นเต้นหรือความเคร่งขรึมเพื่อให้ผู้ฟังมีส่วนร่วม

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Emotional Speech Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

คุณภาพการสังเคราะห์เสียงพูด

คำถามที่พบบ่อย

What is Emotional Speech Synthesis?

การสังเคราะห์คำพูดตามอารมณ์จะสร้างเสียงที่ฟังดูมีความสุข เศร้า โกรธ หรือสงบ ไม่ใช่แค่เข้าใจง่ายแต่รู้สึกได้อย่างน่าเชื่อถือ เปลี่ยนการอ่านออกเสียงข้อความแบบเรียบๆ เป็นการถ่ายทอดที่สื่อถึงความหมายของบางสิ่ง ไม่ใช่แค่สิ่งที่พูดเท่านั้น

การสังเคราะห์คำพูดทางอารมณ์จะเปลี่ยนลักษณะของเสียงที่สร้างขึ้นเป็นหลัก

การสังเคราะห์อารมณ์จะคงคำพูดไว้แต่จะเปลี่ยนการถ่ายทอด การใช้ฉันทลักษณ์ และคุณภาพเสียง ดังนั้นคำพูดจึงสื่อถึงความรู้สึกเช่นความสุขหรือความเศร้า

ในแบบจำลองมิติของอารมณ์ แกนวาเลนซ์และแกนเร้าอารมณ์จับอะไร?

วาเลนซ์วัดว่าอารมณ์นั้นน่าพึงพอใจหรือไม่สบายเพียงใด ในขณะที่ความเร้าอารมณ์จะวัดว่าอารมณ์สงบหรือตื่นเต้นเพียงใด โดยปล่อยให้อารมณ์ผสมผสานและปรับขนาดได้อย่างต่อเนื่อง

รูปแบบเสียงใดที่เหมาะกับคำพูดเศร้าๆ มากที่สุด?

ความโศกเศร้ามักจะเชื่อมโยงกับอัตราการพูดที่ช้าลง พลังงานที่ลดลง และระดับเสียงที่แคบลงและต่ำกว่า ในขณะที่ความตื่นเต้นจะเพิ่มระดับเสียงและจังหวะ

โดยทั่วไปแล้วแบบจำลองอารมณ์เชิงหมวดหมู่จะบอกเครื่องสังเคราะห์เสียงว่าควรใช้อารมณ์ใด

ระบบการจัดหมวดหมู่จะแนบการเรียนรู้ที่ฝังไว้สำหรับอารมณ์ความรู้สึกที่แยกจากกันแต่ละอารมณ์ (เช่น สวิตช์) เพื่อกำหนดเงื่อนไขให้กับซินธิไซเซอร์บนเอฟเฟกต์ที่เลือก

อะไรคือความท้าทายในทางปฏิบัติที่สำคัญในการสร้างระบบคำพูดตามอารมณ์?

การรวบรวมอารมณ์คุณภาพสูงและสมดุลนั้นยาก และการเพิ่มความเข้มข้นขึ้นหรือลงโดยไม่ออกเสียงผิดเพี้ยนหรือเน้นภาพล้อเลียนมากเกินไปก็เป็นเรื่องยาก