การทำให้ข้อความเป็นมาตรฐานสำหรับคำพูด
การทำให้ข้อความเป็นมาตรฐานเป็นขั้นตอนส่วนหน้าที่เขียนข้อความดิบที่เขียนใหม่ให้เป็นคำพูดที่พูดออกมาทั้งหมดก่อนที่ระบบคำพูดจะพูด
ภาพรวม
It is what turns '$5' into 'five dollars' and '12/5/2024' into a spoken date, and getting it wrong is one of the most jarring TTS failures.
เจาะลึก
ข้อความที่เขียนเต็มไปด้วยคำที่ไม่เป็นมาตรฐาน เช่น ตัวเลข สกุลเงิน วันที่ เวลา ตัวย่อ URL และสัญลักษณ์ที่ไม่มีใครออกเสียงตามตัวอักษร การทำให้ข้อความเป็นมาตรฐาน (บางครั้งเรียกว่า TN front-end) จะขยายสิ่งเหล่านี้ให้อยู่ในรูปแบบการพูด ดังนั้นโมเดลดาวน์สตรีมจึงรู้ว่าควรพูดอะไรจริงๆ - '$5' กลายเป็น '5 ดอลลาร์' 'Dr.' กลายเป็น 'หมอ' หรือ 'ขับรถ' ขึ้นอยู่กับบริบท และ 'IV' อาจเป็น 'สี่' 'ทางหลอดเลือดดำ' หรือตัวอักษร 'I-V' ระบบแบบดั้งเดิมใช้กฎที่เขียนด้วยมือและทรานสดิวเซอร์สถานะจำกัดแบบถ่วงน้ำหนัก (WFST) ซึ่งมีความน่าเชื่อถือและสามารถตรวจสอบได้ แนวทางที่ใหม่กว่าใช้แบบจำลองลำดับต่อลำดับของระบบประสาท แต่ TN ของระบบประสาทบริสุทธิ์อาจทำให้เกิดข้อผิดพลาดที่เป็นอันตรายได้ (พูดตัวเลขผิด) ดังนั้นระบบการผลิตจึงมักใช้การออกแบบแบบไฮบริดโดยมีกฎเกณฑ์เป็นราวกั้น ความอ่อนไหวต่อบริบทเป็นส่วนที่ยาก: โทเค็นเดียวกันจะพูดแตกต่างกันไปขึ้นอยู่กับสภาพแวดล้อม
ข้อมูลเชิงลึกทางเทคนิค
การทำให้เป็นมาตรฐานแบบคลาสสิกก่อนอื่น โทเค็นและจัดประเภทแต่ละโทเค็นเป็นคลาสสัญศาสตร์ (คาร์ดินัล ทศนิยม วันที่ เงิน หน่วยวัด ตัวย่อ) จากนั้นใช้โปรแกรมแปลงเสียงเฉพาะคลาส ซึ่งมักสร้างเป็นทรานสดิวเซอร์สถานะจำกัดแบบถ่วงน้ำหนักที่รวดเร็วและตรวจสอบได้อย่างสมบูรณ์ โทเค็นที่คลุมเครือจะแก้ความกำกวมโดยใช้บริบทท้องถิ่นและตัวชี้นำส่วนหนึ่งของคำพูด ระบบประสาทและไฮบริดกำหนดกรอบเป็นการเขียนข้อความเป็นข้อความใหม่ แต่จำกัดเอาต์พุต เช่น ครอบคลุมไวยากรณ์หรือ 'การแท็กแล้วขยาย' เพื่อป้องกันข้อผิดพลาดที่ยอมรับไม่ได้ เช่น การอ่านปีเป็นหมายเลขโทรศัพท์
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการทำให้ข้อความเป็นมาตรฐานสำหรับคำพูด
การทำให้เป็นมาตรฐานกำลังมีแนวโน้มไปสู่ลูกผสมของระบบประสาทและกฎที่รักษาความปลอดภัยของไวยากรณ์สถานะจำกัดในขณะที่ใช้แบบจำลองที่เรียนรู้เพื่อแก้ไขบริบท รวมถึงแบบจำลองภาษาขนาดใหญ่ที่จัดการกับข้อความที่ยุ่งเหยิงในโลกแห่งความเป็นจริงและหลายภาษาในคราวเดียว การวิจัยมุ่งเน้นไปที่การขจัดข้อผิดพลาด 'ที่ไม่สามารถกู้คืนได้' และใน TN หลายภาษา ซึ่งรูปแบบตัวเลข วันที่ และสกุลเงินแตกต่างกันอย่างมาก เนื่องจาก TTS จากต้นทางถึงปลายทางดูดซับฟังก์ชันส่วนหน้ามากขึ้น คาดว่าการทำให้เป็นมาตรฐานจะยังคงเป็นขั้นตอนที่ควบคุมได้และตรวจสอบได้อย่างแม่นยำ เนื่องจากข้อผิดพลาดที่นี่สังเกตได้ชัดเจนและมีค่าใช้จ่ายสูง
การใช้งานจริงในโลกแห่งความเป็นจริง
อ่านออกเสียง "$1,250.50" เป็น "หนึ่งพันสองร้อยห้าสิบดอลลาร์ห้าสิบเซ็นต์" ในระบบสั่งงานด้วยเสียงของธนาคาร
ขยายคำย่อเพื่อให้ 'เซนต์' พูดเป็น 'ถนน' หรือ 'นักบุญ' ขึ้นอยู่กับบริบทในข้อความแจ้งการนำทาง
พูดวันที่ เวลา และหมายเลขโทรศัพท์อย่างถูกต้องในแอปปฏิทินและการแจ้งเตือน
การแปลงสัญลักษณ์และหน่วย เช่น '5 กม.' หรือ '%' เป็นคำพูดสำหรับโปรแกรมอ่านหน้าจอและเครื่องมือช่วยการเข้าถึง
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text Normalization for Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ข้อความเป็นคำพูด
คำถามที่พบบ่อย
What is Text Normalization for Speech?
การทำให้ข้อความเป็นมาตรฐานเป็นขั้นตอนส่วนหน้าที่เขียนข้อความดิบที่เขียนใหม่ให้เป็นคำพูดที่พูดออกมาทั้งหมดก่อนที่ระบบคำพูดจะพูด มันคือสิ่งที่เปลี่ยน '5 ดอลลาร์' ให้เป็น '5 ดอลลาร์' และ '5/12/2567' ให้เป็นวันที่พูด และการเข้าใจผิดเป็นหนึ่งในความล้มเหลวของ TTS ที่สั่นสะเทือนที่สุด
การทำให้ข้อความเป็นมาตรฐานสำหรับคำพูดทำอะไรเป็นหลัก?
การทำให้เป็นมาตรฐานจะขยายโทเค็นที่ไม่ได้มาตรฐาน เช่น ตัวเลข วันที่ และตัวย่อ ให้อยู่ในรูปแบบคำพูดที่เป็นวาจาก่อนการสังเคราะห์
ระบบที่ดีควรทำให้คำพูด '$ 5' เป็นปกติได้อย่างไร
สกุลเงินจำเป็นต้องเรียงลำดับใหม่และพูดสัญลักษณ์ ดังนั้น '$5' จึงถูกเรียกว่า 'ห้าดอลลาร์' ไม่ใช่จากซ้ายไปขวาอย่างแท้จริง
เหตุใดการทำให้โทเค็นเป็นมาตรฐานเช่น 'ดร.' หรือ 'IV' หากิน?
'ดร.' อาจเป็น 'แพทย์' หรือ 'ขับรถ' และ 'IV' อาจเป็น 'สี่' 'ทางหลอดเลือดดำ' หรือตัวอักษร - บริบทเป็นตัวกำหนดวาจาที่ถูกต้อง
เทคโนโลยีดั้งเดิมใดที่ใช้กันอย่างแพร่หลายในการสร้างกฎการทำให้เป็นมาตรฐานที่เชื่อถือได้และตรวจสอบได้
WFST เข้ารหัสไวยากรณ์ที่จัดทำขึ้นด้วยมือที่รวดเร็วและสามารถตรวจสอบได้อย่างสมบูรณ์ ทำให้เป็นตัวเลือกที่มีมายาวนานสำหรับการผลิต TN
เหตุใดระบบการผลิตจึงมักหลีกเลี่ยงการทำให้ข้อความประสาทบริสุทธิ์เป็นมาตรฐาน
TN ของระบบประสาทที่ไม่มีข้อจำกัดสามารถสร้างเอาต์พุตที่ผิดพลาดได้อย่างมั่นใจแต่เป็นอันตราย (เช่น ตัวเลขที่ไม่ถูกต้อง) ดังนั้นกฎจึงทำหน้าที่เป็นราวกั้นในระบบไฮบริด