বিষয়বস্তু এড়িয়ে যান
শিখুন
সংবাদ
টুলস
চাকরি
মিশন
অনুসন্ধান করুন
⌘K
English
দান
মেনু
এখানে শুরু করুন
শেখা শুরু করুন
শিখুন
যান শিখুন
কোর্স
গাইড
এআই টিউটর
প্রম্পট লাইব্রেরি
কুইজ
সনদ
শব্দকোষ
সংবাদ
যান সংবাদ
সর্বশেষ এআই খবর
বিষয় ট্র্যাকার
গবেষণা এবং ডেটাসেট
ব্লগ
সম্পাদকীয় মানদণ্ড
সংশোধন
টুলস
যান টুলস
টুল ডিরেক্টরি
তালিকার সেরা
টুল তুলনা করুন
খরচ ক্যালকুলেটর
প্রম্পট রিফাইনার
টুল জমা দিন
চাকরি
যান চাকরি
এআই কাজগুলি ব্রাউজ করুন
একটি চাকরি পোস্ট করুন
স্পন্সর AIU
মিশন
যান মিশন
মিশন
প্রভাব এবং পরিসংখ্যান
লেখক
সাহায্য কেন্দ্র
নতুন কি
সহায়তা
দান
বাড়ি
/
শব্দকোষ
/
হিউম্যান ফিডব্যাক থেকে রিইনফোর্সমেন্ট লার্নিং (RLHF)
এআই শব্দকোষের মেয়াদ
কি
হিউম্যান ফিডব্যাক থেকে রিইনফোর্সমেন্ট লার্নিং (RLHF)
?
সংজ্ঞা
একটি প্রশিক্ষণ পদ্ধতি যা মডেল আচরণকে আকার দিতে মানুষের পছন্দ সংকেত ব্যবহার করে।
সম্পর্কিত পদ
শক্তিবৃদ্ধি শিক্ষা
পুরষ্কার সংকেত দ্বারা প্রশিক্ষণ যেখানে একজন এজেন্ট দীর্ঘমেয়াদী রিটার্ন সর্বাধিক করে এমন ক্রিয়াগুলি শিখে।
পুরস্কার মডেল
একটি মডেল যা পছন্দের সংকেতের উপর ভিত্তি করে আউটপুট স্কোর করে, প্রায়শই RLHF পাইপলাইনে ব্যবহৃত হয়।
ডিপিও (ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান)
একটি প্রশিক্ষণ পদ্ধতি যা একটি পৃথক পুরস্কার মডেলের প্রয়োজন ছাড়াই সরাসরি পছন্দের জোড়ায় মডেলগুলিকে সূক্ষ্ম-টিউন করে৷
ক্রমাগত শিক্ষা
প্রশিক্ষণ পদ্ধতি যা একটি মডেলকে পূর্বের জ্ঞান না ভুলে নতুন ডেটা থেকে শিখতে দেয়।
ফিউ-শট লার্নিং
শুধুমাত্র অল্প সংখ্যক উদাহরণ থেকে আচরণ শেখা বা মানিয়ে নেওয়া।
মডেল ড্রিফ্ট
বাস্তব-বিশ্বের পরিস্থিতি প্রশিক্ষণের অনুমান থেকে বিচ্ছিন্ন হওয়ার কারণে সময়ের সাথে সাথে কর্মক্ষমতার অবনতি।
আমাদের বিনামূল্যের গাইডে আরও জানুন
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
আরও দেখুন
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
সম্পূর্ণ AI শব্দকোষ ব্রাউজ করুন
সমস্ত বিনামূল্যের এআই গাইড এক্সপ্লোর করুন