انتقل إلى المحتوى
تعلّم
الأخبار
الأدوات
وظائف
المهمة
بحث
⌘K
English
تبرع
القائمة
ابدأ هنا
ابدأ التعلم
تعلّم
اذهب الى تعلّم
الدورات
الأدلة
معلم الذكاء الاصطناعي
مكتبة عاجلة
اختبارات
الشهادة
المصطلحات
الأخبار
اذهب الى الأخبار
آخر أخبار الذكاء الاصطناعي
تعقب الموضوع
البحوث ومجموعات البيانات
مدونة
المعايير التحريرية
التصحيحات
الأدوات
اذهب الى الأدوات
دليل الأدوات
أفضل القوائم
قارن الأدوات
حاسبة التكلفة
المصفاة السريعة
أضف أداة
وظائف
اذهب الى وظائف
تصفح وظائف الذكاء الاصطناعي
انشر وظيفة
الراعي AIU
المهمة
اذهب الى المهمة
المهمة
التأثير والإحصائيات
المؤلفون
Help center
ما هو الجديد
الدعم
تبرع
الصفحة الرئيسية
/
المعجم
/
التعلم المعزز
مصطلح مسرد الذكاء الاصطناعي
ما هو
التعلم المعزز
?
التعريف
التدريب من خلال إشارات المكافأة حيث يتعلم الوكيل الإجراءات التي تزيد من العائد على المدى الطويل.
المصطلحات ذات الصلة
تعزيز التعلم من ردود الفعل البشرية (RLHF)
طريقة تدريب تستخدم إشارات التفضيل البشري لتشكيل سلوك النموذج.
نموذج المكافأة
نموذج يسجل المخرجات بناءً على إشارات التفضيل، وغالبًا ما يستخدم في خطوط أنابيب RLHF.
وكيل منظمة العفو الدولية
نظام برمجي يمكنه الملاحظة والتفكير واتخاذ الإجراءات لتحقيق الهدف، وغالبًا ما يستخدم الأدوات والذاكرة.
الذكاء الاصطناعي الدستوري
نهج التدريب وتشكيل السلوك حيث يتم توجيه مخرجات النموذج من خلال مجموعة ثابتة من المبادئ المكتوبة.
حلقة الوكيل
دورة متكررة حيث يراقب وكيل الذكاء الاصطناعي ويخطط ويتصرف ويفكر حتى يكمل هدفًا أو يصل إلى حالة التوقف.
DPO (تحسين التفضيلات المباشرة)
طريقة تدريب تعمل على ضبط النماذج مباشرة على أزواج التفضيلات دون الحاجة إلى نموذج مكافأة منفصل.
تعرف على المزيد في أدلةنا المجانية
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
انظر أيضا
Red Teaming
Recommendation System
Retrieval
Recall
RAG (Retrieval-Augmented Generation)
Robustness
Quantization
Safety Filter
Previous
Red Teaming
Next
Reinforcement Learning from Human Feedback (RLHF)
تصفح قاموس الذكاء الاصطناعي الكامل
استكشف جميع أدلة الذكاء الاصطناعي المجانية