एप्लीकेशन गाइड

लिप रीडिंग और विज़ुअल स्पीच रिकग्निशन में एआई

विज़ुअल स्पीच रिकग्निशन होठों को पढ़ने के लिए एआई का उपयोग करता है, किसी व्यक्ति के मुंह, जबड़े और चेहरे की गति से बोले गए शब्दों की भविष्यवाणी करता है, कभी-कभी बिना किसी ऑडियो के।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

यह शोर वाले वातावरण, पहुंच और अधिक मजबूत वाक् पहचान के लिए ध्वनि के साथ संयोजन के लिए मायने रखता है।

गहरा गोता

होठों को पढ़ना इंसानों के लिए भी कठिन है क्योंकि कई ध्वनियाँ होठों पर एक जैसी लगती हैं। उदाहरण के लिए, /p/, /b/, और /m/ ध्वनियाँ एक एकल 'विज़मे' समूह बनाती हैं जो दृष्टिगत रूप से अप्रभेद्य है, इसलिए संदर्भ आवश्यक है। AI मॉडल जैसे Google डीपमाइंड के लिपनेट और बाद के 'वॉच, अटेंड एंड स्पेल' सिस्टम मुंह-क्षेत्र के वीडियो फ्रेम के अनुक्रमों को पात्रों या शब्दों में मैप करना सीखते हैं, कभी-कभी बेंचमार्क डेटासेट पर पेशेवर मानव लिप रीडर से बेहतर प्रदर्शन करते हैं। सबसे मजबूत सिस्टम ऑडियो-विजुअल हैं: वे होठों के वीडियो को ऑडियो सिग्नल के साथ जोड़ते हैं ताकि जब शोर ध्वनि को खराब कर दे, तो दृश्य धारा उस अंतर को भर देती है। खराब रोशनी, सिर घुमाने, हाथ या मास्क जैसी रुकावटों और अपरिचित स्पीकर के कारण प्रदर्शन अभी भी तेजी से गिरता है।

तकनीकी अंतर्दृष्टि

एक विशिष्ट मॉडल मुंह के चारों ओर एक तंग क्षेत्र को क्रॉप करता है, फिर लघु गति पैटर्न को पकड़ने के लिए 3 डी कनवल्शनल फ्रंट एंड के माध्यम से फ्रेम अनुक्रम को पास करता है, इसके बाद एक ट्रांसफार्मर या आवर्तक नेटवर्क होता है जो लंबे समय तक अस्थायी संदर्भ को मॉडल करता है। सीटीसी या ध्यान-आधारित अनुक्रम-दर-अनुक्रम विधियों का उपयोग करके आउटपुट को टेक्स्ट में डिकोड किया जाता है। श्रव्य-दृश्य संलयन दो तौर-तरीकों को जोड़ता है ताकि प्रत्येक दूसरे की कमजोरियों की भरपाई कर सके।

सामरिक प्रभाव

विकल्प बनाएं

एप्लिकेशन-स्तरीय डिज़ाइन यह निर्धारित करता है कि AI वास्तविक परिणामों में सुधार करता है या नहीं।

टीम और वर्कफ़्लो

अच्छा वर्कफ़्लो एकीकरण उत्पादकता लाभ पैदा करता है जिस पर उपयोगकर्ता भरोसा कर सकते हैं।

जोखिम और सुरक्षा

अच्छी तरह से उपयोग के मामले परिवर्तन की थकान और कार्यान्वयन जोखिम को कम करते हैं।

लिप रीडिंग और विज़ुअल स्पीच रिकग्निशन में एआई का भविष्य

उम्मीद करें कि लिप रीडिंग को एक स्टैंडअलोन टूल के बजाय ज्यादातर ऑडियो सिस्टम के सहायक के रूप में एम्बेड किया जाएगा, आवाज सहायकों में सुधार किया जाएगा और ऊंचे स्थानों पर कैप्शनिंग की जाएगी। स्पीकर-स्वतंत्र मॉडल, कम रोशनी में मजबूती और गोपनीयता के लिए ऑन-डिवाइस प्रोसेसिंग पर काम जारी है। क्योंकि गुप्त लिप रीडिंग स्पष्ट निगरानी चिंताओं को जन्म देती है, शासन और सहमति मानदंड संभवतः ऐसे आकार लेंगे जहां इसे प्रौद्योगिकी के साथ-साथ स्वयं भी लागू किया जा सकता है।

वास्तविक विश्व कार्यान्वयन

शोरगुल वाली कार या भीड़ भरे कमरे में ऑडियो के साथ-साथ स्पीकर के होठों को पढ़कर ध्वनि-सहायक की सटीकता को बढ़ाना

मुंह की हरकतों को पढ़कर उन लोगों की वाणी बहाल करने में मदद करना जिनकी आवाज खो गई है

जब माइक्रोफ़ोन भारी पृष्ठभूमि शोर उठाता है तो स्वचालित कैप्शन में सुधार करना

मूक या दबी हुई फ़ुटेज से संवाद पुनर्प्राप्त करने का प्रयास करने वाला फोरेंसिक या अभिलेखीय विश्लेषण

जोखिम और रेलिंग

किसी टूटी हुई प्रक्रिया को स्वचालित करने से मौजूदा समस्याएँ बढ़ सकती हैं।

टीमें अति-स्वचालित हो सकती हैं और आवश्यक मानवीय निर्णय को हटा सकती हैं।

यदि आउटपुट का लगातार मूल्यांकन नहीं किया गया तो गुणवत्ता में गिरावट आ सकती है।

कार्यान्वयन रोडमैप

1

वर्तमान वर्कफ़्लो को मैप करें और उच्चतम-घर्षण चरण की पहचान करें।

2

पूर्ण स्वचालन से पहले मानव चौकियों को परिभाषित करें।

3

उपयोगकर्ताओं को संकेतों, वृद्धि पथों और गुणवत्ता मानकों पर प्रशिक्षित करें।

4

निरंतर मूल्य की पुष्टि के लिए कार्य-स्तर के परिणामों को ट्रैक करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

लिप रीडिंग और विज़ुअल स्पीच रिकग्निशन में AI क्या है?

विज़ुअल स्पीच रिकग्निशन होठों को पढ़ने के लिए एआई का उपयोग करता है, किसी व्यक्ति के मुंह, जबड़े और चेहरे की गति से बोले गए शब्दों की भविष्यवाणी करता है, कभी-कभी बिना किसी ऑडियो के। यह शोर वाले वातावरण, पहुंच और अधिक मजबूत वाक् पहचान के लिए ध्वनि के साथ संयोजन के लिए मायने रखता है।

'विज़मे' क्या है?

/p/, /b/, और /m/ जैसी ध्वनियां एक ही शब्द का निर्माण करती हैं क्योंकि मुंह एक जैसा दिखता है, यही कारण है कि होंठ पढ़ना संदर्भ के बिना अस्पष्ट है।

ऑडियो-विज़ुअल मॉडल अक्सर लिप-ओनली या केवल-ऑडियो मॉडल की तुलना में अधिक मजबूत क्यों होते हैं?

फ़्यूज़िंग वीडियो और ऑडियो प्रत्येक मोड को दूसरे के लिए क्षतिपूर्ति करने देता है, इतना तेज़ शोर जो ऑडियो को बर्बाद कर देता है उसे होठों से ऑफसेट किया जा सकता है।

लिप-रीडिंग मॉडल में 3डी कनवल्शनल फ्रंट एंड क्या पकड़ने में मदद करता है?

3डी कन्वोल्यूशन कई फ़्रेमों को एक साथ संसाधित करते हैं, यह कैप्चर करते हैं कि कैसे मुंह एक स्थिर छवि के बजाय कम समय में चलता है।

कौन सी स्थिति होंठ-पढ़ने की सटीकता को सबसे अधिक ख़राब करती है?

कुछ भी जो मुंह के क्षेत्र को छुपाता है या विकृत करता है, जैसे अवरोध या खराब रोशनी, सटीकता को तेजी से कम कर देता है।