مواد پر جائیں
سیکھیں
خبریں
ٹولز
ملازمتیں
مشن
تلاش کریں۔
⌘K
English
عطیہ
مینو
×
یہاں سے شروع کریں۔
سیکھنا شروع کریں۔
سیکھیں
پر جائیں۔ سیکھیں
کورسز
گائیڈز
اے آئی ٹیوٹر
Prompt library
کوئز
سرٹیفکیٹ
لغت
خبریں
پر جائیں۔ خبریں
تازہ ترین AI خبریں۔
ٹاپک ٹریکرز
Research & datasets
بلاگ
ادارتی معیارات
تصحیحات
ٹولز
پر جائیں۔ ٹولز
ٹول ڈائرکٹری
بہترین فہرستیں۔
ٹولز کا موازنہ کریں۔
Cost calculator
پرامپٹ ریفائنر
ٹول بھیجیں
ملازمتیں
پر جائیں۔ ملازمتیں
AI جابز کو براؤز کریں۔
نوکری پوسٹ کریں۔
AIU کو اسپانسر کریں۔
مشن
پر جائیں۔ مشن
مشن
اثرات اور اعدادوشمار
مصنفین
Help centre
What's new
مدد
عطیہ
گھر
/
فرہنگ
/
انسانی تاثرات سے کمک سیکھنا (RLHF)
AI لغت کی اصطلاح
کیا ہے
انسانی تاثرات سے کمک سیکھنا (RLHF)
?
تعریف
ایک تربیتی طریقہ جو ماڈل کے رویے کو تشکیل دینے کے لیے انسانی ترجیحی اشارے استعمال کرتا ہے۔
متعلقہ شرائط
کمک سیکھنا
انعامی سگنلز کے ذریعے تربیت جہاں ایک ایجنٹ ایسے اعمال سیکھتا ہے جو طویل مدتی واپسی کو زیادہ سے زیادہ بناتے ہیں۔
انعامی ماڈل
ایک ماڈل جو ترجیحی سگنلز کی بنیاد پر آؤٹ پٹ اسکور کرتا ہے، جو اکثر RLHF پائپ لائنوں میں استعمال ہوتا ہے۔
ڈی پی او (براہ راست ترجیحی اصلاح)
ایک تربیتی طریقہ جو ماڈلز کو براہ راست ترجیحی جوڑوں پر بناتا ہے بغیر کسی علیحدہ انعامی ماڈل کی ضرورت کے۔
مسلسل سیکھنا
تربیتی نقطہ نظر جو ایک ماڈل کو پیشگی معلومات کو فراموش کیے بغیر نئے ڈیٹا سے سیکھتے رہنے دیتے ہیں۔
چند شاٹ لرننگ
صرف چند مثالوں سے طرز عمل سیکھنا یا اپنانا۔
ماڈل ڈرفٹ
وقت کے ساتھ ساتھ کارکردگی کا انحطاط کیونکہ حقیقی دنیا کے حالات تربیت کے مفروضوں سے ہٹ جاتے ہیں۔
ہماری مفت گائیڈز میں مزید جانیں۔
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
See also
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
مکمل AI لغت براؤز کریں۔
تمام مفت AI گائیڈز دریافت کریں۔