انتقل إلى المحتوى
تعلّم
الأخبار
الأدوات
وظائف
المهمة
بحث
⌘K
English
تبرع
القائمة
ابدأ هنا
ابدأ التعلم
تعلّم
اذهب الى تعلّم
الدورات
الأدلة
معلم الذكاء الاصطناعي
مكتبة عاجلة
اختبارات
الشهادة
المصطلحات
الأخبار
اذهب الى الأخبار
آخر أخبار الذكاء الاصطناعي
تعقب الموضوع
البحوث ومجموعات البيانات
مدونة
المعايير التحريرية
التصحيحات
الأدوات
اذهب الى الأدوات
دليل الأدوات
أفضل القوائم
قارن الأدوات
حاسبة التكلفة
المصفاة السريعة
أضف أداة
وظائف
اذهب الى وظائف
تصفح وظائف الذكاء الاصطناعي
انشر وظيفة
الراعي AIU
المهمة
اذهب الى المهمة
المهمة
التأثير والإحصائيات
المؤلفون
مركز المساعدة
ما هو الجديد
الدعم
تبرع
← العودة إلى جميع الاختبارات
اختبار مرتبط بالدليل • متوسط المستوى • 6 أسئلة
اختبار تحسين السياسة القريبة
اختبر فهمك لكيفية استقرار PPO للتعلم المعزز ودوره في RLHF.
مسارات الدليل ذات الصلة
تحسين السياسة القريبة
سؤال 1 من 6
ما هي المشكلة التي يعالجها "قص" PPO بشكل أساسي؟
هل تحتاج إلى تلميح؟
A
بطء تحميل البيانات
B
تحديثات السياسة الكبيرة جدًا التي تؤدي إلى زعزعة استقرار التدريب
C
حدود حجم المفردات
D
استخدام الذاكرة أثناء الاستدلال