دليل الأساسيات

التعلم شبه الخاضع للإشراف

يتدرب التعلم شبه الخاضع للإشراف على كمية صغيرة من البيانات المصنفة بالإضافة إلى مجموعة كبيرة من البيانات غير المسماة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It hits a sweet spot when labels are scarce or costly but raw data is plentiful, often matching fully supervised accuracy at a fraction of the labeling effort.

الغوص العميق

في العديد من الإعدادات الحقيقية، يمكنك جمع جبال من البيانات، ولكن لا يمكنك سوى تسمية شريحة صغيرة منها. يعمل التعلم شبه الخاضع للإشراف على سد الفجوة من خلال السماح للبيانات غير المسماة بتوجيه النموذج أيضًا. هناك فكرتان أساسيتان تقويانه. أولاً، وضع العلامات الزائفة (التدريب الذاتي): يقوم النموذج بتسمية الأمثلة غير المسماة التي يثق بها كثيرًا ثم يعيد التدريب عليها كما لو كانت تلك التخمينات صحيحة. ثانيًا، تنظيم الاتساق: يجب أن يعطي النموذج نفس التنبؤ لمثال حتى بعد اضطرابه أو زيادته قليلاً، بحيث يمكن للبيانات غير المسماة فرض مخرجات مستقرة ومعقولة. تجمع طرق مثل FixMatch بين الاثنين معًا. يكمن وراء كل ذلك "افتراض المجموعة"، وهي فكرة أن النقاط المتجمعة معًا في مساحة الميزة ربما تشترك في التسمية، لذا فإن النقاط غير المسماة تزيد من حدة القرار.

البصيرة الفنية

FixMatch هو رسم توضيحي نظيف. لكل صورة غير مسماة، يتم إنشاء نسخة معززة بشكل ضعيف ونسخة معززة بقوة. إنه يتنبأ بالضعيف، وإذا تجاوزت الثقة عتبة معينة، يصبح هذا التنبؤ تسمية زائفة. يتم بعد ذلك تدريب النموذج بحيث يتطابق توقعه على النسخة المعززة بشدة مع تلك التسمية الزائفة. وهذا يدمج العلامات الزائفة مع تنظيم الاتساق. عتبة الثقة مهمة: قبول الكثير من التخمينات منخفضة الثقة وتعزيز التسميات الزائفة الخاطئة نفسها، وهو وضع الفشل يسمى التحيز التأكيدي.

التأثير الاستراتيجي

قرارات أوضح

يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.

التكلفة والميزانية

يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.

الفريق وسير العمل

تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.

مستقبل التعلم شبه الخاضع للإشراف

يمتزج التعلم شبه الخاضع للإشراف بشكل متزايد مع التدريب المسبق الخاضع للإشراف الذاتي: التدريب المسبق على البيانات غير المسماة، ثم الضبط الدقيق شبه الخاضع للإشراف باستخدام بعض التسميات. يستمر هذا المزيج في تقليل مقدار التعليقات التوضيحية المطلوبة في المجالات التي يتطلب فيها وضع العلامات خبراء، مثل التصوير الطبي. توقع تقديرًا أقوى لعدم اليقين لتصفية التصنيفات الزائفة غير الموثوقة، واستخدامًا أوسع في حلقات التعلم النشط التي تطلب من البشر تسمية الأمثلة الأكثر إفادة فقط، واستمرار الاعتماد في أي مكان تكون فيه البيانات وفيرة ولكن تعليقات الخبراء هي عنق الزجاجة.

التنفيذ في العالم الحقيقي

تدريب نموذج التصوير الطبي على بضع مئات من عمليات الفحص التي تحمل علامة أخصائي الأشعة بالإضافة إلى الآلاف من عمليات الفحص غير المسماة للكشف عن الأورام

إنشاء صفحة ويب أو مصنف بريد إلكتروني من مجموعة صغيرة ذات علامات وملايين المستندات غير المسماة

تحسين التعرف على الكلام باستخدام الصوت المكتوب المحدود بالإضافة إلى كميات كبيرة من التسجيلات غير المكتوبة

وضع علامات على المنتجات في كتالوج التجارة الإلكترونية حيث يحتوي جزء صغير فقط من الصور على فئات تم التحقق منها بواسطة الإنسان

المخاطر والدرابزين

قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.

يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.

غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.

خارطة طريق التنفيذ

1

ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.

2

اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.

3

قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.

4

قم بالتوثيق حيث يساعد التعلم شبه الخاضع للإشراف وأين تكون الأساليب الأبسط أفضل.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Semi-Supervised Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تنظيم الاتساق في التعلم شبه الخاضع للإشراف

الأسئلة المتداولة

What is Semi-Supervised Learning?

يتدرب التعلم شبه الخاضع للإشراف على كمية صغيرة من البيانات المصنفة بالإضافة إلى مجموعة كبيرة من البيانات غير المسماة. إنها تصل إلى نقطة جيدة عندما تكون التسميات نادرة أو مكلفة ولكن البيانات الأولية وفيرة، وغالبًا ما تتطابق مع الدقة الخاضعة للإشراف الكامل بجزء صغير من جهد وضع العلامات.

ما هو "الوسم الزائف" (التدريب الذاتي)؟

يقوم النموذج بتعيين تسميات للنقاط غير المسماة عالية الثقة ويعاملها كبيانات تدريب، مما يؤدي إلى توسيع مجموعته المسماة.

ما هو "الافتراض العنقودي" الذي يكمن وراء العديد من الأساليب شبه الخاضعة للإشراف؟

ويفترض أن حدود القرار تقع في مناطق منخفضة الكثافة، لذا فإن النقاط المجمعة معًا ربما تنتمي إلى نفس الفئة.

كيف يجمع FixMatch بين الفكرتين الرئيسيتين؟

يقوم FixMatch بإنشاء تسمية زائفة من تنبؤ واثق بالزيادة الضعيفة، ثم يفرض الاتساق على زيادة قوية لنفس المدخلات.

ما هو "التحيز التأكيدي" كوضع فشل في وضع العلامات الزائفة؟

إذا تم قبول التسميات الزائفة غير الصحيحة، فإن النموذج يتدرب على أخطائه ويعززها، ولهذا السبب يتم استخدام عتبات الثقة.