دليل التطبيقات

الذكاء الاصطناعي في قراءة الشفاه والتعرف على الكلام البصري

يستخدم التعرف المرئي على الكلام الذكاء الاصطناعي لقراءة الشفاه، والتنبؤ بالكلمات المنطوقة من حركة فم الشخص وفكه ووجهه، وأحيانًا بدون أي صوت.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.

الغوص العميق

تعتبر قراءة الشفاه أمرًا صعبًا حتى بالنسبة للبشر لأن العديد من الأصوات تبدو متطابقة على الشفاه. على سبيل المثال، تشكل الأصوات /p/ و/b/ و/m/ مجموعة "viseme" واحدة لا يمكن تمييزها بصريًا، لذا فإن السياق ضروري. تتعلم نماذج الذكاء الاصطناعي مثل Google DeepMind’s LipNet وأنظمة "المشاهدة والحضور والتهجئة" اللاحقة كيفية تعيين تسلسلات إطارات الفيديو في منطقة الفم إلى أحرف أو كلمات، وتتفوق في بعض الأحيان على قارئي الشفاه البشرية المحترفين في مجموعات البيانات المعيارية. أقوى الأنظمة هي الأنظمة السمعية والبصرية: فهي تدمج فيديو الشفاه مع الإشارة الصوتية بحيث عندما يفسد الضجيج الصوت، فإن التدفق البصري يملأ الفجوة. لا يزال الأداء ينخفض ​​بشكل حاد مع الإضاءة الضعيفة، ودوران الرأس، والانسدادات مثل الأيدي أو الأقنعة، ومكبرات الصوت غير المألوفة.

البصيرة الفنية

يقوم النموذج النموذجي بقص منطقة ضيقة حول الفم، ثم يمرر تسلسل الإطار من خلال واجهة أمامية تلافيفية ثلاثية الأبعاد لالتقاط أنماط الحركة القصيرة، متبوعة بمحول أو شبكة متكررة تمثل سياقًا زمنيًا أطول. يتم فك تشفير الإخراج إلى نص باستخدام CTC أو أساليب التسلسل إلى التسلسل القائمة على الاهتمام. يجمع الاندماج السمعي البصري بين الطريقتين بحيث يمكن لكل منهما التعويض عن نقاط الضعف لدى الآخر.

التأثير الاستراتيجي

خيارات البناء

يحدد التصميم على مستوى التطبيق ما إذا كان الذكاء الاصطناعي سيحسن النتائج الحقيقية.

الفريق وسير العمل

يؤدي التكامل الجيد لسير العمل إلى تحقيق مكاسب إنتاجية يمكن للمستخدمين الوثوق بها.

المخاطر والسلامة

تعمل حالات الاستخدام ذات النطاق الجيد على تقليل إجهاد التغيير ومخاطر التنفيذ.

مستقبل الذكاء الاصطناعي في قراءة الشفاه والتعرف على الكلام المرئي

توقع أن يتم تضمين قراءة الشفاه في الغالب كمساعد للأنظمة الصوتية بدلاً من كونها أداة مستقلة، مما يؤدي إلى تحسين المساعدين الصوتيين والتعليق في الأماكن الصاخبة. يستمر العمل على النماذج المستقلة عن السماعات، والمتانة في الإضاءة المنخفضة، والمعالجة على الجهاز من أجل الخصوصية. ونظرًا لأن القراءة السرية للشفاه تثير مخاوف واضحة تتعلق بالمراقبة، فمن المرجح أن تشكل معايير الإدارة والموافقة المكان الذي يمكن نشرها فيه بقدر ما تحدده التكنولوجيا نفسها.

التنفيذ في العالم الحقيقي

تعزيز دقة المساعد الصوتي في السيارة الصاخبة أو الغرفة المزدحمة من خلال قراءة شفاه المتحدث بجانب الصوت

المساعدة في استعادة الكلام للأشخاص الذين فقدوا صوتهم من خلال قراءة حركات الفم

تحسين التسميات التوضيحية التلقائية عندما يلتقط الميكروفون ضجيجًا كبيرًا في الخلفية

يحاول التحليل الجنائي أو الأرشيفي استعادة الحوار من اللقطات الصامتة أو المكتومة

المخاطر والدرابزين

يمكن أن تؤدي أتمتة عملية معطلة إلى تضخيم المشاكل الموجودة.

قد تقوم الفرق بالإفراط في أتمتة وإزالة الحكم البشري المطلوب.

يمكن أن تنحرف الجودة إذا لم يتم تقييم المخرجات بشكل مستمر.

خارطة طريق التنفيذ

1

قم بتخطيط سير العمل الحالي وحدد خطوة الاحتكاك الأعلى.

2

تحديد نقاط التفتيش البشرية قبل الأتمتة الكاملة.

3

تدريب المستخدمين على المطالبات ومسارات التصعيد ومعايير الجودة.

4

تتبع النتائج على مستوى المهمة لتأكيد القيمة المستدامة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التعرف على عواطف الكلام

الأسئلة المتداولة

What is AI in Lip Reading and Visual Speech Recognition?

يستخدم التعرف المرئي على الكلام الذكاء الاصطناعي لقراءة الشفاه، والتنبؤ بالكلمات المنطوقة من حركة فم الشخص وفكه ووجهه، وأحيانًا بدون أي صوت. إنه أمر مهم بالنسبة للبيئات الصاخبة، وإمكانية الوصول، والدمج مع الصوت للتعرف على الكلام بشكل أكثر قوة.

ما هو "visme"؟

أصوات مثل /p/، /b/، و /m/ تشكل صوتًا واحدًا لأن الفم يبدو متماثلًا، ولهذا السبب تكون قراءة الشفاه غامضة بدون سياق.

لماذا غالبًا ما تكون النماذج السمعية والبصرية أكثر قوة من النماذج المخصصة للشفاه فقط أو النماذج الصوتية فقط؟

يتيح دمج الفيديو والصوت لكل طريقة التعويض عن الأخرى، لذلك يمكن تعويض الضوضاء العالية التي تفسد الصوت عن طريق الشفاه.

ما الذي تساعد الواجهة الأمامية التلافيفية ثلاثية الأبعاد في نموذج قراءة الشفاه على التقاطه؟

تعالج التلافيفات ثلاثية الأبعاد عدة إطارات معًا، وتلتقط كيفية تحرك الفم خلال فترات زمنية قصيرة بدلاً من صورة ثابتة واحدة.

ما هي الحالة التي تقلل من دقة قراءة الشفاه؟

أي شيء يخفي أو يشوه منطقة الفم، مثل الانسداد أو الإضاءة السيئة، يقلل بشكل كبير من الدقة.