التعلم بالتقليد
يقوم التعلم بالتقليد بتعليم الذكاء الاصطناعي أداء مهمة ما عن طريق نسخ العروض التوضيحية التي يقدمها الخبراء بدلاً من التعلم من مكافآت التجربة والخطأ.
نظرة عامة
It matters because for many real tasks — driving, surgery, manipulation — it is far easier to show good behavior than to write a reward function.
الغوص العميق
يقوم التعلم بالتقليد بتدريب السياسة من خلال الأمثلة المسجلة لخبير يتصرف في بيئة ما، وعادةً ما يكون ذلك عبارة عن أزواج من الملاحظات والإجراءات التي اتخذها الخبير. إن أبسط أشكاله، وهو الاستنساخ السلوكي، يتعامل مع هذا باعتباره تعلمًا بسيطًا تحت الإشراف: توقع تصرفات الخبير في ضوء الحالة. ويكون الأمر جذابًا عندما يكون من الصعب تحديد المكافآت ولكن العروض التوضيحية وفيرة، كما هو الحال في السيارات ذاتية القيادة المدربة على سجلات التوجيه البشرية أو الروبوتات التي يتم تدريسها عن طريق التشغيل عن بعد. نقطة الضعف الكلاسيكية هي تحول التوزيع، أو الخطأ المضاعف: أخطاء التنبؤ الصغيرة تدفع العميل إلى حالات لم يزرها الخبير مطلقًا، حيث لا يوجد لديه أي توجيه وينجرف بعيدًا عن المسار. تعمل طرق مثل DAgger على إصلاح ذلك من خلال الاستعلام المتكرر عن الخبير حول الحالات التي يصل إليها المتعلم بالفعل.
البصيرة الفنية
يقلل الاستنساخ السلوكي من الخسارة الخاضعة للإشراف بين الإجراءات المتوقعة والمثبتة، لكنه يفترض أن الحالات مستقلة وموزعة بشكل متطابق، وهذا خطأ في التحكم التسلسلي. يكسر DAgger (تجميع مجموعة البيانات) هذا الافتراض من خلال طرح السياسة الحالية بشكل متكرر، ومطالبة الخبير بتسمية الحالات التي تمت زيارتها، وإعادة التدريب على مجموعة البيانات المجمعة المتنامية. يؤدي هذا إلى إبقاء بيانات التدريب متوافقة مع توزيع الحالة الخاصة بالمتعلم، مما يقلل بشكل كبير من الأخطاء المركبة على مدى الآفاق الطويلة.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل التعلم بالتقليد
يعد التعلم بالتقليد عنصرا أساسيا في ظهور نماذج تأسيس الروبوتات، حيث يتم تدريب سياسة واحدة على مجموعات بيانات ضخمة متعددة المهام للتشغيل عن بعد وضبطها بدقة للحصول على مهارات جديدة. توقع اندماجًا أكثر إحكامًا مع اللغة والرؤية حتى تتمكن الروبوتات من التقليد من مقاطع الفيديو أو التعليمات، بالإضافة إلى الروبوتات الهجينة التي تبدأ بالاستنساخ ثم تتحسن من خلال التعلم المعزز. لا يزال توسيع نطاق جمع العروض التوضيحية بتكلفة زهيدة، من خلال المحاكاة وبيانات اللعب البشرية المستمدة من التعهيد الجماعي، هو عنق الزجاجة الرئيسي والحدود النشطة.
التنفيذ في العالم الحقيقي
نماذج إدراك وتوجيه السيارة ذاتية القيادة المدربة على القيادة البشرية المسجلة
تتعلم أذرع الروبوت كيفية طي الغسيل أو تكديس الأشياء من العروض التوضيحية التي يتم تشغيلها عن بعد
يتم تشغيل وكلاء تشغيل الألعاب من عمليات إعادة التشغيل البشرية المسجلة قبل ضبطها باستخدام RL
الروبوتات الجراحية والمساعدة تتعلم الحركات من عروض المشغلين الخبراء
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imitation Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
التعلم المعزز دون اتصال بالإنترنت
الأسئلة المتداولة
What is Imitation Learning?
يقوم التعلم بالتقليد بتعليم الذكاء الاصطناعي أداء مهمة ما عن طريق نسخ العروض التوضيحية التي يقدمها الخبراء بدلاً من التعلم من مكافآت التجربة والخطأ. إنه أمر مهم لأنه بالنسبة للعديد من المهام الحقيقية - مثل القيادة، والجراحة، والتلاعب - يكون إظهار السلوك الجيد أسهل بكثير من كتابة دالة المكافأة.
ما هي الفكرة الأساسية وراء التعلم بالتقليد؟
يقوم التعلم بالتقليد بتدريب العميل على إعادة إنتاج السلوك الموضح في عروض الخبراء بدلاً من اكتشاف السلوك من خلال التجربة والخطأ المبني على المكافأة.
الاستنساخ السلوكي إطارات التعلم التقليد وأي نوع من المشاكل؟
يتعامل الاستنساخ السلوكي مع العروض التوضيحية كبيانات مصنفة ويتعلم التنبؤ بعمل الخبير لكل حالة تمت ملاحظتها، تمامًا مثل التعلم الخاضع للإشراف.
ما هي المشكلة التي تؤدي إلى فشل الاستنساخ السلوكي على مدى تسلسلات عمل طويلة؟
تدفع أخطاء الإجراءات الصغيرة الوكيل إلى حالات لم يوضحها الخبير مطلقًا؛ وبدون توجيه هناك، تتراكم الأخطاء وينجرف العميل بعيدًا عن مسار الخبير.
كيف تعالج خوارزمية DAgger هذا الضعف؟
ينشر DAgger السياسة الحالية، ويطلب من الخبير تسمية الولايات التي تمت زيارتها حديثًا، ويعيد التدريب على مجموعة البيانات المجمعة بحيث تتطابق بيانات التدريب مع توزيع الحالة الخاصة بالمتعلم.
لماذا يفضل التعلم بالتقليد في كثير من الأحيان على التعلم المعزز لمهام مثل القيادة؟
بالنسبة للمهام الواقعية المعقدة، من الصعب كتابة مكافأة تعكس السلوك الجيد، في حين أن عرض أمثلة على السلوك الجيد (سجلات القيادة البشرية) يعد أمرًا سهلاً نسبيًا.