انتقل إلى المحتوى
تعلّم
الأخبار
الأدوات
وظائف
المهمة
بحث
⌘K
English
تبرع
القائمة
ابدأ هنا
ابدأ التعلم
تعلّم
اذهب الى تعلّم
الدورات
الأدلة
معلم الذكاء الاصطناعي
مكتبة عاجلة
اختبارات
الشهادة
المصطلحات
الأخبار
اذهب الى الأخبار
آخر أخبار الذكاء الاصطناعي
تعقب الموضوع
البحوث ومجموعات البيانات
مدونة
المعايير التحريرية
التصحيحات
الأدوات
اذهب الى الأدوات
دليل الأدوات
أفضل القوائم
قارن الأدوات
حاسبة التكلفة
المصفاة السريعة
أضف أداة
وظائف
اذهب الى وظائف
تصفح وظائف الذكاء الاصطناعي
انشر وظيفة
الراعي AIU
المهمة
اذهب الى المهمة
المهمة
التأثير والإحصائيات
المؤلفون
Help center
ما هو الجديد
الدعم
تبرع
الصفحة الرئيسية
/
المعجم
/
تعزيز التعلم من ردود الفعل البشرية (RLHF)
مصطلح مسرد الذكاء الاصطناعي
ما هو
تعزيز التعلم من ردود الفعل البشرية (RLHF)
?
التعريف
طريقة تدريب تستخدم إشارات التفضيل البشري لتشكيل سلوك النموذج.
المصطلحات ذات الصلة
التعلم المعزز
التدريب من خلال إشارات المكافأة حيث يتعلم الوكيل الإجراءات التي تزيد من العائد على المدى الطويل.
نموذج المكافأة
نموذج يسجل المخرجات بناءً على إشارات التفضيل، وغالبًا ما يستخدم في خطوط أنابيب RLHF.
DPO (تحسين التفضيلات المباشرة)
طريقة تدريب تعمل على ضبط النماذج مباشرة على أزواج التفضيلات دون الحاجة إلى نموذج مكافأة منفصل.
التعلم المستمر
أساليب التدريب التي تسمح للنموذج بمواصلة التعلم من البيانات الجديدة دون نسيان المعرفة السابقة.
التعلم بالقليل من اللقطات
تعلم السلوك أو تكييفه من خلال عدد قليل فقط من الأمثلة.
الانجراف النموذجي
تدهور الأداء بمرور الوقت مع اختلاف ظروف العالم الحقيقي عن افتراضات التدريب.
تعرف على المزيد في أدلةنا المجانية
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
انظر أيضا
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
تصفح قاموس الذكاء الاصطناعي الكامل
استكشف جميع أدلة الذكاء الاصطناعي المجانية