भाषण के लिए पाठ सामान्यीकरण
पाठ सामान्यीकरण एक फ्रंट-एंड चरण है जो भाषण प्रणाली के कहने से पहले कच्चे लिखित पाठ को पूरी तरह से बोले गए शब्दों में फिर से लिखता है।
सिंहावलोकन
It is what turns '$5' into 'five dollars' and '12/5/2024' into a spoken date, and getting it wrong is one of the most jarring TTS failures.
गहरा गोता
लिखित पाठ गैर-मानक शब्दों से भरा है: संख्याएं, मुद्रा, तिथियां, समय, संक्षिप्ताक्षर, यूआरएल और प्रतीक जिनका कोई भी शाब्दिक उच्चारण नहीं करता है। पाठ सामान्यीकरण (जिसे कभी-कभी टीएन फ्रंट-एंड भी कहा जाता है) इन्हें उनके मौखिक रूप में विस्तारित करता है ताकि एक डाउनस्ट्रीम मॉडल को पता चले कि वास्तव में क्या कहना है - '$5' 'पांच डॉलर' बन जाता है, 'डॉ.' संदर्भ के आधार पर 'डॉक्टर' या 'ड्राइव' बन जाता है, और 'IV' 'चार,' 'अंतःशिरा,' या 'I-V' अक्षर हो सकता है। पारंपरिक प्रणालियाँ हाथ से लिखे नियमों और भारित परिमित-राज्य ट्रांसड्यूसर (डब्ल्यूएफएसटी) का उपयोग करती हैं, जो विश्वसनीय और श्रव्य हैं। नए दृष्टिकोण तंत्रिका अनुक्रम-से-अनुक्रम मॉडल का उपयोग करते हैं, लेकिन शुद्ध तंत्रिका टीएन खतरनाक त्रुटियां (गलत संख्या कहकर) उत्पन्न कर सकता है, इसलिए उत्पादन प्रणालियां अक्सर रेलिंग के रूप में नियमों के साथ हाइब्रिड डिजाइन का उपयोग करती हैं। संदर्भ-संवेदनशीलता कठिन हिस्सा है: एक ही टोकन अपने परिवेश के आधार पर अलग-अलग शब्दों में व्यक्त होता है।
तकनीकी अंतर्दृष्टि
क्लासिक सामान्यीकरण पहले प्रत्येक टोकन को एक सांकेतिक वर्ग (कार्डिनल, दशमलव, तिथि, धन, माप, संक्षिप्तीकरण) में टोकनाइज़ और वर्गीकृत करता है, फिर एक वर्ग-विशिष्ट वर्बलाइज़र लागू करता है, जिसे अक्सर एक भारित परिमित-राज्य ट्रांसड्यूसर के रूप में बनाया जाता है जो तेज़ और पूरी तरह से निरीक्षण योग्य होता है। स्थानीय संदर्भ और भाषण के आंशिक संकेतों का उपयोग करके अस्पष्ट टोकन को स्पष्ट किया जाता है। न्यूरल और हाइब्रिड सिस्टम इसे टेक्स्ट-टू-टेक्स्ट पुनर्लेखन के रूप में तैयार करते हैं, लेकिन आउटपुट को बाधित करते हैं - उदाहरण के लिए, व्याकरण को कवर करना या 'टैगिंग फिर विस्तार' - एक फोन नंबर के रूप में एक वर्ष को पढ़ने जैसी अस्वीकार्य गलतियों को रोकने के लिए।
सामरिक प्रभाव
पहुंच और पहुंच
यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।
लागत और बजट
मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।
गति और पैमाना
ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।
भाषण के लिए पाठ सामान्यीकरण का भविष्य
सामान्यीकरण तंत्रिका-और-नियम संकर की ओर बढ़ रहा है जो संदर्भ को हल करने के लिए सीखे गए मॉडल का उपयोग करते समय परिमित-राज्य व्याकरण की सुरक्षा रखता है, साथ ही बड़े भाषा मॉडल जो गंदे, वास्तविक दुनिया के पाठ और एक साथ कई भाषाओं को संभालते हैं। अनुसंधान 'अपूरणीय' त्रुटियों को दूर करने और बहुभाषी टीएन पर केंद्रित है जहां संख्या, तिथि और मुद्रा परंपराएं व्यापक रूप से भिन्न हैं। चूंकि एंड-टू-एंड टीटीएस अधिक फ्रंट-एंड फ़ंक्शंस को अवशोषित करता है, उम्मीद है कि सामान्यीकरण एक नियंत्रणीय, श्रव्य चरण बना रहेगा क्योंकि यहां गलतियाँ बहुत ध्यान देने योग्य और महंगी हैं।
वास्तविक विश्व कार्यान्वयन
बैंकिंग वॉयस असिस्टेंट में '$1,250.50' को 'एक हजार दो सौ पचास डॉलर और पचास सेंट' के रूप में जोर से पढ़ना।
संक्षिप्ताक्षरों का विस्तार इसलिए 'सेंट' नेविगेशन संकेतों में संदर्भ के आधार पर इसे 'सड़क' या 'संत' के रूप में बोला जाता है।
कैलेंडर और अनुस्मारक ऐप्स में दिनांक, समय और फ़ोन नंबरों को सही ढंग से मौखिक करना।
स्क्रीन रीडर और एक्सेसिबिलिटी टूल के लिए '5 किमी' या '%' जैसे प्रतीकों और इकाइयों को बोले गए शब्दों में परिवर्तित करना।
जोखिम और रेलिंग
सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।
उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।
स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।
कार्यान्वयन रोडमैप
वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।
विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।
परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।
जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text Normalization for Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
भाषण के पाठ
अक्सर पूछे जाने वाले प्रश्नों
What is Text Normalization for Speech?
पाठ सामान्यीकरण एक फ्रंट-एंड चरण है जो भाषण प्रणाली के कहने से पहले कच्चे लिखित पाठ को पूरी तरह से बोले गए शब्दों में फिर से लिखता है। यह वही है जो '$5' को 'पांच डॉलर' में और '12/5/2024' को बोली जाने वाली तारीख में बदल देता है, और इसे गलत समझना सबसे परेशान करने वाली टीटीएस विफलताओं में से एक है।
भाषण के लिए पाठ सामान्यीकरण मुख्य रूप से क्या करता है?
सामान्यीकरण संश्लेषण से पहले गैर-मानक टोकन जैसे संख्याओं, तिथियों और संक्षिप्ताक्षरों को उनके मौखिक रूप में विस्तारित करता है।
एक अच्छे सिस्टम को भाषण के लिए '$5' को कैसे सामान्य बनाना चाहिए?
मुद्रा को प्रतीक को पुन: व्यवस्थित करने और मौखिक रूप से बताने की आवश्यकता होती है, इसलिए '$5' को 'पांच डॉलर' के रूप में बोला जाता है, शाब्दिक रूप से बाएं से दाएं नहीं।
'डॉ.' जैसे टोकन को सामान्य क्यों किया जा रहा है? या 'IV' मुश्किल?
'डॉ।' 'डॉक्टर' या 'ड्राइव' हो सकता है और 'IV' 'चार', 'अंतःशिरा' या अक्षर हो सकता है - संदर्भ सही मौखिकीकरण निर्धारित करता है।
विश्वसनीय, श्रव्य सामान्यीकरण नियम बनाने के लिए किस पारंपरिक तकनीक का व्यापक रूप से उपयोग किया जाता है?
डब्लूएफएसटी हाथ से तैयार किए गए व्याकरणों को एनकोड करते हैं जो तेज़ और पूरी तरह से निरीक्षण योग्य होते हैं, जिससे वे टीएन के उत्पादन के लिए एक लंबे समय से चली आ रही पसंद बन जाते हैं।
उत्पादन प्रणालियाँ अक्सर शुद्ध तंत्रिका पाठ सामान्यीकरण से क्यों बचती हैं?
अनियंत्रित तंत्रिका टीएन आत्मविश्वासपूर्ण लेकिन खतरनाक रूप से गलत आउटपुट (उदाहरण के लिए, एक गलत आंकड़ा) उत्पन्न कर सकता है, इसलिए नियम हाइब्रिड सिस्टम में रेलिंग के रूप में कार्य करते हैं।