सुनें, भाग लें और जादू करें
सुनो, उपस्थित रहो और जादू करो (एलएएस) एक ऐतिहासिक 2015 तंत्रिका नेटवर्क है जो बिना हाथ से निर्मित उच्चारण शब्दकोश या अलग भाषा मॉडल के, भाषण को सीधे पात्रों में स्थानांतरित करता है।
सिंहावलोकन
It showed that a single end-to-end model could do speech recognition.
गहरा गोता
2015 में Google शोधकर्ताओं चैन, जेटली, ले और विन्याल्स द्वारा पेश किया गया सुनो, उपस्थित रहो और जादू करो, पहले सच्चे एंड-टू-एंड भाषण पहचानकर्ताओं में से एक था। इसके दो भाग हैं: एक 'श्रोता', एक पिरामिडनुमा द्विदिशात्मक LSTM जो समय आयाम को सिकोड़ते हुए ऑडियो को एन्कोड करता है, और एक 'स्पेलर', एक ध्यान-आधारित LSTM डिकोडर जो एक समय में एक अक्षर उत्सर्जित करता है। ध्यान तंत्र स्पेलर को प्रत्येक आउटपुट अक्षर के लिए ऑडियो के प्रासंगिक स्लाइस पर ध्यान केंद्रित करने देता है। पुरानी एचएमएम-डीएनएन पाइपलाइनों के विपरीत, एलएएस को किसी ध्वनि शब्दकोश, किसी मजबूर संरेखण और किसी अलग से प्रशिक्षित भाषा मॉडल की आवश्यकता नहीं है; यह लिखित ऑडियो से संयुक्त रूप से वर्तनी, शब्द सीमाएँ और ध्वनिकी सीखता है। इसने सीधे तौर पर आधुनिक अनुक्रम-दर-अनुक्रम और ध्यान-आधारित एएसआर प्रणालियों को प्रेरित किया।
तकनीकी अंतर्दृष्टि
एलएएस एक एनकोडर-डिकोडर को ध्यान के साथ जोड़ता है। पिरामिडल एलएसटीएम एनकोडर तीन परतों में से प्रत्येक पर समय रिज़ॉल्यूशन को आधा कर देता है, एक लंबे ध्वनिक अनुक्रम को एक प्रबंधनीय लंबाई में काट देता है ताकि ध्यान आकर्षित हो सके। प्रत्येक डिकोडिंग चरण में स्पेलर सभी एनकोडर स्थितियों पर ध्यान भार की गणना करता है, उन्हें एक संदर्भ वेक्टर में मिश्रित करता है, और अगले चरित्र की भविष्यवाणी करता है। प्रशिक्षण सही चरित्र अनुक्रम की संभावना को अधिकतम करता है; एक शेड्यूल-सैंपलिंग ट्रिक ट्रेन/परीक्षण बेमेल को कम करती है।
सामरिक प्रभाव
पहुंच और पहुंच
यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।
लागत और बजट
मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।
गति और पैमाना
ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।
सुनने, उपस्थित होने और जादू करने का भविष्य
एलएएस अब ऐतिहासिक है, लेकिन इसका डीएनए हर आधुनिक एएसआर प्रणाली में चलता है। इसका ध्यान-आधारित एनकोडर-डिकोडर विचार ट्रांसफार्मर और कन्फॉर्मर पहचानकर्ताओं में विकसित हुआ, जबकि आरएनएन-ट्रांसड्यूसर पावर ऑन-डिवाइस श्रुतलेख जैसे संबंधित दृष्टिकोण। भविष्य की प्रणालियाँ इस अंत-से-अंत प्रक्षेपवक्र को जारी रखती हैं, एकल बहुभाषी मॉडल में अनुवाद और समझ के साथ मान्यता को जोड़ती हैं, और स्ट्रीमिंग, कम-विलंबता प्रतिलेखन की ओर धकेलती हैं जो कि एलएएस, गैर-स्ट्रीमिंग होने के कारण, मूल रूप से प्रदान नहीं कर सकता है।
वास्तविक विश्व कार्यान्वयन
उच्चारण शब्दकोश के बिना बोली जाने वाली अंग्रेजी को सीधे अक्षरों में लिपिबद्ध करना
ध्यान-आधारित ध्वनि श्रुतलेख और कैप्शनिंग प्रणालियों के लिए वैचारिक आधार के रूप में कार्य करना
अकादमिक भाषण-पहचान पाठ्यक्रम और बेंचमार्क के लिए शुरू से अंत तक प्रशिक्षण का प्रदर्शन
प्रेरक अनुक्रम-से-अनुक्रम मॉडल बाद में भाषण अनुवाद पाइपलाइनों में उपयोग किए गए
जोखिम और रेलिंग
सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।
उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।
स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।
कार्यान्वयन रोडमैप
वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।
विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।
परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।
जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
संगीत ऑटो-टैगिंग
अक्सर पूछे जाने वाले प्रश्नों
What is Listen Attend and Spell?
सुनो, उपस्थित रहो और जादू करो (एलएएस) एक ऐतिहासिक 2015 तंत्रिका नेटवर्क है जो बिना हाथ से निर्मित उच्चारण शब्दकोश या अलग भाषा मॉडल के, भाषण को सीधे पात्रों में स्थानांतरित करता है। इससे पता चला कि एक एकल एंड-टू-एंड मॉडल वाक् पहचान कर सकता है।
एलएएस मॉडल के दो मुख्य घटक क्या हैं?
एलएएस में एक 'श्रोता' एनकोडर होता है जो ऑडियो को संसाधित करता है और एक 'स्पेलर' ध्यान-आधारित डिकोडर होता है जो वर्ण उत्सर्जित करता है।
एलएएस आउटपुट में स्पेलर क्या करता है?
स्पेलर एक डिकोडर है जो सीधे वर्तनी सीखते हुए, वर्ण दर वर्ण प्रतिलेखन तैयार करता है।
LAS एनकोडर को 'पिरामिडल' क्यों कहा जाता है?
पिरामिडनुमा बीएलएसटीएम की प्रत्येक परत अनुक्रम की लंबाई को आधा कर देती है, जिससे लंबे ऑडियो अनुक्रम को छोटा कर दिया जाता है ताकि ध्यान कम्प्यूटेशनल रूप से संभव हो सके।
एलएएस को किस पुराने घटक की विशेष रूप से आवश्यकता नहीं है?
क्लासिक एचएमएम-डीएनएन पाइपलाइनों के विपरीत, एलएएस बिना किसी फोनेम डिक्शनरी या मजबूर संरेखण के सीधे ऑडियो-टू-टेक्स्ट जोड़े से सीखता है।
कौन सा तंत्र स्पेलर को प्रत्येक चरित्र के लिए ऑडियो के प्रासंगिक भाग पर ध्यान केंद्रित करने देता है?
एक ध्यान तंत्र एनकोडर स्थितियों पर भार की गणना करता है, जिससे एक संदर्भ वेक्टर बनता है जिसका उपयोग डिकोडर प्रत्येक चरण में करता है।