دليل الذكاء الاصطناعي المرئي

التعرف البصري على الحروف

يعمل نظام التعرف الضوئي على الحروف (OCR) على تحويل صور النص - المستندات الممسوحة ضوئيًا، وصور اللافتات، وملفات PDF - إلى نص يمكن قراءته وتحريره بواسطة الآلة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is the bridge that makes the printed and handwritten world searchable and computable.

الغوص العميق

يقوم OCR بتحويل وحدات البكسل التي تشبه الحروف إلى رموز أحرف فعلية يمكن للكمبيوتر تخزينها وتحريرها. تم عمل تقنية التعرف الضوئي على الحروف الكلاسيكية على مراحل: تنظيف الصورة وإزالة انحرافها، والعثور على مناطق النص، وتقسيمها إلى خطوط وحروف رسومية فردية، ثم تصنيف كل حرف رسومي عن طريق مطابقة شكله مع الأنماط المعروفة. يعتبر التعرف الضوئي على الحروف (OCR) الحديث عصبيًا إلى حد كبير: حيث تقرأ الشبكة التلافيفية الميزات المرئية، ويتنبأ نموذج التسلسل (غالبًا مع فقدان CTC أو وحدة فك التشفير القائمة على الاهتمام) بسلاسل كاملة دون الحاجة إلى تجزئة الأحرف بشكل مثالي. يتعامل هذا مع الحروف المتصلة والمتداخلة والخطوط المتنوعة بشكل أفضل بكثير. تصل الآن محركات مثل Tesseract، بالإضافة إلى الخدمات السحابية من Google وAmazon وMicrosoft، إلى دقة عالية جدًا في الطباعة النظيفة وتتعامل مع عشرات اللغات والنصوص البرمجية.

البصيرة الفنية

وكان الاختراق الرئيسي هو التصنيف الزمني الاتصالي (CTC). كان على الأنظمة القديمة أن تقوم بتقطيع الكلمة إلى أحرف منفصلة قبل التعرف عليها، وهي عرضة للخطأ عندما تتلامس الحروف أو تلطخ. يتيح CTC للشبكة المتكررة أو المحولة إخراج احتمالية لكل حرف في كل شريحة أفقية من الصورة، ثم طي التكرارات والفراغات لإنتاج الكلمة النهائية. يؤدي هذا إلى إزالة خطوة التجزئة الهشة ويسمح للنموذج بمعرفة المحاذاة بين وحدات البكسل والأحرف تلقائيًا من أزواج الصور والنص المُسمى.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل التعرف البصري على الحروف

يتم دمج تقنية التعرف الضوئي على الحروف (OCR) في نماذج "الذكاء الاصطناعي للمستندات" ونماذج لغة الرؤية الأوسع التي تقرأ الصفحة وتجيب على الأسئلة المتعلقة بها مباشرةً، مع تخطي خطوة منفصلة لاستخراج النص. توقع معالجة أقوى للكتابة اليدوية الفوضوية والمحفوظات التاريخية وصور الهاتف منخفضة الدقة والتخطيطات المعقدة مثل الجداول والنماذج والإيصالات. ستستمر التغطية متعددة اللغات ومنخفضة الموارد في التوسع، وسيصبح التعرف الضوئي على الحروف على الجهاز أسرع، مما يتيح ترجمة لافتات الشوارع في الوقت الفعلي والتقاط فوري لأي نص تراه الكاميرا.

التنفيذ في العالم الحقيقي

تطبيقات الخدمات المصرفية عبر الهاتف المحمول التي تقرأ حقول حساب الشيك الورقي والتوجيه والمبلغ حتى يتمكن المستخدمون من الإيداع عن طريق الصورة

Google تتيح لك Lens وApple Live Text نسخ نص من صورة أو ترجمة قائمة أجنبية في الوقت الفعلي

رقمنة أرشيفات الصحف والمكتبات التاريخية بحيث يصبح النص الكامل قابلاً للبحث عن طريق الكلمات الرئيسية

المعالجة الآلية للفواتير والإيصالات في برنامج المحاسبة الذي يستخرج البائع والتاريخ والإجماليات

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التعرف على العمل

الأسئلة المتداولة

What is Optical Character Recognition?

يعمل نظام التعرف الضوئي على الحروف (OCR) على تحويل صور النص - المستندات الممسوحة ضوئيًا، وصور اللافتات، وملفات PDF - إلى نص يمكن قراءته وتحريره بواسطة الآلة. إنه الجسر الذي يجعل العالم المطبوع والمكتوب بخط اليد قابلاً للبحث والحساب.

ما هي الوظيفة الأساسية للتعرف الضوئي على الحروف؟

تتمثل مهمة التعرف الضوئي على الحروف (OCR) في تحويل وحدات البكسل التي تصور الحروف إلى رموز نصية فعلية يمكن للكمبيوتر تخزينها والبحث فيها وتحريرها.

ما هي التقنية التي تتيح للتعرف الضوئي على الحروف (OCR) الحديث على تجنب تقطيع الكلمة إلى أحرف منفصلة قبل التعرف عليها؟

يتيح CTC للشبكة توقع الأحرف عبر شرائح الصورة وطي النتيجة، مما يؤدي إلى إزالة خطوة التجزئة الهشة لكل حرف.

لماذا تعد عملية "إزالة الانحراف" خطوة شائعة في المعالجة المسبقة في خطوط أنابيب التعرف الضوئي على الحروف؟

غالبًا ما يتم تدوير الصفحات الممسوحة ضوئيًا أو المصورة قليلاً؛ تعمل ميزة إزالة الانحراف على محاذاة النص أفقيًا، مما يؤدي إلى تحسين دقة التعرف.

أي من هذه المحركات يعد محرك التعرف الضوئي على الحروف (OCR) مفتوح المصدر والمستخدم على نطاق واسع؟

Tesseract هو محرك OCR مفتوح المصدر شائع يدعم العديد من اللغات؛ والبعض الآخر يخدم أغراضًا غير ذات صلة.

لماذا يعد النص المكتوب بخط اليد أصعب بشكل عام في التعرف الضوئي على الحروف مقارنة بالنص المطبوع؟

تتميز الكتابة اليدوية بتباين كبير في الشكل والميل والتباعد، وتتصل الحروف المتصلة، مما يجعل التجزئة والتصنيف أكثر صعوبة.