คู่มือเสียง AI

การแปลงกราฟเป็นฟอนิม

การแปลงกราฟเป็นฟอนิม (G2P) จะแปลตัวอักษรที่เขียนเป็นเสียงที่ระบบเสียงพูดควรออกเสียงจริงๆ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the bridge that lets text-to-speech say 'read' correctly in past versus present tense and handle words it has never seen before.

เจาะลึก

กราฟคือตัวอักษรที่คุณพิมพ์ หน่วยเสียงเป็นหน่วยเสียงที่แตกต่างกันของภาษา (ภาษาอังกฤษมีประมาณ 40 หน่วย) ในภาษาต่างๆ เช่น ภาษาอังกฤษ การสะกดคำเป็นแนวทางในการออกเสียงที่ไม่น่าเชื่อถืออย่างฉาวโฉ่ ดังนั้น G2P จึงเป็นองค์ประกอบส่วนหน้าหลักของ TTS และมีประโยชน์ในการรู้จำเสียงพูดอัตโนมัติ ระบบคลาสสิกอาศัยพจนานุกรมการออกเสียงขนาดใหญ่ เช่น CMUdict จากนั้นจึงกลับไปใช้กฎเกณฑ์หรือแบบจำลองทางสถิติสำหรับคำที่ไม่มีคำศัพท์ G2P สมัยใหม่ถือว่าปัญหาเป็นการแปลตามลำดับ: ตัวเข้ารหัสหรือตัวถอดรหัสประสาทหรือหม้อแปลงจะอ่านสตริงตัวอักษรและส่งเสียงสตริงฟอนิม ซึ่งมักจะอยู่ในรูปแบบ ARPAbet หรือ IPA สิ่งสำคัญที่สุดคือ G2P ที่ดีสามารถแก้ไขคำที่ต่างกันได้ — การสะกดเหมือนกัน เสียงที่แตกต่างกัน เช่น 'lead' ที่เป็นโลหะและ 'lead' คำกริยา — โดยใช้บริบทโดยรอบและข้อมูลส่วนหนึ่งของคำพูด

ข้อมูลเชิงลึกทางเทคนิค

โมเดล G2P แบบนิวรัลเข้ารหัสลำดับอักขระและถอดรหัสหน่วยเสียงทีละรายการ โดยเรียนรู้การจัดตำแหน่ง เช่น 'ph' ไปจนถึงเสียง /f/ หรือตัวอักษรเงียบที่ไม่จับคู่อะไรเลย เนื่องจากความยาวอินพุตและเอาต์พุตแตกต่างกัน ความสนใจหรือการจัดตำแหน่ง CTC จึงถูกนำมาใช้แทนการแมปแบบหนึ่งต่อหนึ่งแบบตายตัว เครื่องหมายความเครียด (เช่นเดียวกับใน AH0 ของ ARPAbet กับ AH1) ก็ได้รับการทำนายเช่นกัน การค้นหาพจนานุกรมจัดการกับคำทั่วไปเพื่อความแม่นยำ ในขณะที่แบบจำลองประสาทจะสรุปชื่อ แบรนด์ และการสะกดแบบใหม่

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการแปลงกราฟเป็นฟอนิม

G2P กำลังมุ่งสู่โมเดลหลายภาษาและการสลับรหัสที่จัดการข้อความภาษาผสมและคำที่ยืมมาในการส่งผ่านครั้งเดียว บวกกับการแยกความกำกวมที่ดีขึ้นของคำที่แตกต่างโดยใช้บริบทแบบเต็มประโยคจากโมเดลภาษา ขณะนี้ระบบ TTS แบบ end-to-end บางระบบเรียนรู้การออกเสียงโดยปริยายและข้ามหน่วยเสียงที่ชัดเจน แต่การออกแบบแบบผสมที่ยังคงเปิดเผยหน่วยเสียงยังคงได้รับความนิยมในการควบคุมและแก้ไขคำที่หายาก คาดหวังการบูรณาการที่เข้มงวดยิ่งขึ้นกับโมเดลภาษาขนาดใหญ่เพื่อการออกเสียงตามบริบทและการครอบคลุมภาษาที่มีทรัพยากรต่ำในวงกว้างมากขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

ปล่อยให้เสียงการอ่านออกเสียงข้อความออกเสียงชื่อ สถานที่ และคำของแบรนด์ที่ไม่คุ้นเคยอย่างถูกต้องซึ่งไม่ได้อยู่ในพจนานุกรม

การแยกแยะความแตกต่างระหว่างคำว่า 'tear' (ฉีก) กับ 'tear' (ร้องไห้) ตามบริบทของประโยค

การสร้างพจนานุกรมการออกเสียงสำหรับภาษาที่มีทรัพยากรต่ำซึ่งไม่มีพจนานุกรมขนาดใหญ่

ช่วยให้การรู้จำเสียงพูดและแอปการเรียนรู้ภาษาแบบตอบรับการออกเสียงและการตอบสนองจับคู่การสะกดกับเสียงที่คาดหวัง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grapheme-to-Phoneme Conversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Grapheme-to-Phoneme Conversion?

การแปลงกราฟเป็นฟอนิม (G2P) จะแปลตัวอักษรที่เขียนเป็นเสียงที่ระบบเสียงพูดควรออกเสียงจริงๆ เป็นสะพานเชื่อมที่ช่วยให้การอ่านออกเสียงข้อความพูดว่า 'อ่าน' ได้อย่างถูกต้องในอดีตกาลเทียบกับปัจจุบัน และจัดการกับคำที่ไม่เคยเห็นมาก่อน

ในการแปลงกราฟเป็นฟอนิม 'หน่วยเสียง' คืออะไร

หน่วยเสียงเป็นหน่วยเสียงที่มีคอนทราสต์ที่เล็กที่สุด (ภาษาอังกฤษมีประมาณ 40 หน่วย) กราฟคือตัวอักษรที่เขียน

เหตุใด G2P จึงยากเป็นพิเศษสำหรับภาษาอังกฤษ

การสะกดการันต์ภาษาอังกฤษไม่สม่ำเสมอ — ตัวอักษรและการผสมตัวอักษรแมปกับเสียงที่ไม่สอดคล้องกัน ทำให้การออกเสียงตามกฎไม่น่าเชื่อถือ

'heteronym' ที่ G2P ต้องแก้ไขคืออะไร

คำพ้องความหมายเช่น 'lead' (โลหะ) กับ 'lead' (เพื่อเป็นแนวทาง) แบ่งปันการสะกดคำ แต่มีเสียงต่างกัน บริบทและส่วนของคำพูดทำให้พวกเขากระจ่างขึ้น

ทรัพยากรใดคือพจนานุกรมการออกเสียงภาษาอังกฤษแบบคลาสสิกที่ใช้ในระบบ G2P

พจนานุกรมการออกเสียงของ Carnegie Mellon (CMUdict) ให้การถอดเสียงหน่วยเสียง ARPAbet สำหรับคำภาษาอังกฤษหลายคำ

โดยทั่วไปโมเดล G2P ของระบบประสาทสมัยใหม่จะวางกรอบงานอย่างไร

Neural G2P ใช้สถาปัตยกรรมตัวเข้ารหัส-ตัวถอดรหัสหรือหม้อแปลงไฟฟ้าเพื่อแปลลำดับอักขระเป็นลำดับฟอนิม โดยจัดการความยาวที่แตกต่างกันผ่านความสนใจหรือ CTC