التعلم تحت الإشراف الذاتي
يقوم التعلم الخاضع للإشراف الذاتي بتدريب النماذج على البيانات غير المسماة عن طريق اختراع مهمة تكون إجابتها مخفية داخل البيانات نفسها.
نظرة عامة
It is how modern language and vision foundation models learn from the raw internet without armies of human labelers.
الغوص العميق
يعد تصنيف البيانات يدويًا بطيئًا ومكلفًا، ومع ذلك فإن العالم مليء بالنصوص والصور والصوت والفيديو غير المصنفة. ويفتحها التعلم الخاضع للإشراف الذاتي عن طريق إنشاء "مهام ذريعة" حيث توفر البيانات إجابتها الخاصة. المثال الكلاسيكي هو نمذجة اللغة المقنعة، التي يستخدمها بيرت: إخفاء بعض الكلمات في الجملة وتدريب النموذج على التنبؤ بها من السياق. تتنبأ نماذج نمط GPT بالكلمة التالية. في الرؤية، تُظهر الأساليب التفاضلية مثل SimCLR للنموذج محصولين معززين من نفس الصورة وتعلمه أنهما ينتميان معًا بينما تفصل الصور المختلفة عن بعضها البعض. إن حل هذه الألغاز ذاتية الصنع يجبر النموذج على بناء تمثيلات داخلية غنية للمعنى والبنية. ثم تنتقل هذه التمثيلات بقوة إلى المهام النهائية الحقيقية مع القليل من البيانات المصنفة أو معدومة.
البصيرة الفنية
الحيلة هي توليد إشارة إشراف مجاناً. في النمذجة المقنعة، يكون الرمز المخفي هو الملصق، لذلك يمكن حساب الخسارة دون أي تعليق توضيحي بشري. في التعلم المتباين، تشكل زيادتان لصورة واحدة "زوجًا إيجابيًا" يجب أن يكون قريبًا في مساحة التضمين، في حين تكون الصور الأخرى "سلبية" مدفوعة بعيدًا. وفي كلتا الحالتين، يتم تحسين النموذج على تسميات مشتقة تمامًا من بنية البيانات الخاصة، وتعلم الميزات العامة التي تحتاج فيما بعد إلى ضبط دقيق فقط.
التأثير الاستراتيجي
قرارات أوضح
يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.
التكلفة والميزانية
يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.
الفريق وسير العمل
تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.
مستقبل التعلم الخاضع للإشراف الذاتي
إن التعلم الخاضع للإشراف الذاتي هو المحرك وراء النماذج الأساسية الحالية، وهذا الدور سوف ينمو باستمرار. الاتجاه الواضح هو نحو التدريب المسبق متعدد الوسائط، حيث يتعلم نموذج واحد بشكل مشترك من النصوص والصور والصوت والفيديو باستخدام أهداف خاضعة للإشراف الذاتي. ويدفع الباحثون إلى ما هو أبعد من الأساليب التباينية نحو أساليب التنبؤ المقنع في تقنيات الرؤية والتقطير الذاتي التي لا تحتاج إلى أمثلة سلبية. وبما أن البيانات المصنفة عالية الجودة أصبحت عنق الزجاجة، فإن تعلم البنية المفيدة مباشرة من التدفقات الهائلة غير المسماة سيظل الاستراتيجية المركزية لتوسيع نطاق الذكاء الاصطناعي.
التنفيذ في العالم الحقيقي
يتعلم BERT اللغة عن طريق التنبؤ بالكلمات المقنعة، ثم يتم ضبطها بدقة للبحث أو المشاعر أو الإجابة على الأسئلة
يقوم SimCLR بالتدريب المسبق لبرنامج تشفير الصور على الصور غير المسماة حتى يتمكن من تصنيفها لاحقًا باستخدام عدد قليل جدًا من التصنيفات
تتعلم نماذج نمط GPT الكتابة من خلال التنبؤ المتكرر بالرمز التالي عبر مجموعات نصية ضخمة
نماذج الكلام التي تم تدريبها مسبقًا على الصوت الخام غير المسمى (تتنبأ بمقاطع الصوت المقنعة) قبل تكييفها مع النسخ
المخاطر والدرابزين
قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.
يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.
غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.
خارطة طريق التنفيذ
ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.
اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.
قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.
قم بالتوثيق حيث يساعد التعلم تحت الإشراف الذاتي وأين تكون الأساليب الأبسط أفضل.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Supervised Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
التعلم تحت الإشراف
الأسئلة المتداولة
What is Self-Supervised Learning?
يقوم التعلم الخاضع للإشراف الذاتي بتدريب النماذج على البيانات غير المسماة عن طريق اختراع مهمة تكون إجابتها مخفية داخل البيانات نفسها. إنها الطريقة التي تتعلم بها نماذج أسس اللغة والرؤية الحديثة من الإنترنت الخام بدون جيوش من واضعي العلامات البشرية.
ما الذي يجعل التعلم "خاضعًا للإشراف الذاتي"؟
يخترع التعلم الخاضع للإشراف الذاتي مهمة ذريعة حيث تكون الإجابة مخفية في البيانات، لذلك لا حاجة إلى وضع علامات بشرية.
لماذا يعد التعلم الخاضع للإشراف الذاتي ذا قيمة كبيرة بالنسبة لنماذج الأساس؟
ونظرًا لأن إشارة الإشراف تأتي من البيانات نفسها، فيمكن تدريب النماذج مسبقًا على مجموعات ضخمة غير مُسماة من الويب.
بعد التدريب المسبق تحت الإشراف الذاتي، ماذا يحدث عادة بعد ذلك؟
يبني التدريب المسبق تمثيلات عامة يتم نقلها بشكل جيد، لذلك لا يلزم سوى الضبط الدقيق للبيانات المصنفة لمهام محددة.
كيف تختلف مهمة الإشراف الذاتي لنموذج نمط GPT عن مهمة BERT؟
يتم تدريب نماذج نمط GPT على التنبؤ بالرمز المميز التالي في تسلسل، بينما يتنبأ BERT بالرموز المميزة المقنعة باستخدام السياق الأيسر والأيمن.