এআই শব্দকোষের মেয়াদ

কি হিউম্যান ফিডব্যাক থেকে রিইনফোর্সমেন্ট লার্নিং (RLHF)?

সংজ্ঞা

একটি প্রশিক্ষণ পদ্ধতি যা মডেল আচরণকে আকার দিতে মানুষের পছন্দ সংকেত ব্যবহার করে।

সম্পর্কিত পদ

শক্তিবৃদ্ধি শিক্ষা
পুরষ্কার সংকেত দ্বারা প্রশিক্ষণ যেখানে একজন এজেন্ট দীর্ঘমেয়াদী রিটার্ন সর্বাধিক করে এমন ক্রিয়াগুলি শিখে।
পুরস্কার মডেল
একটি মডেল যা পছন্দের সংকেতের উপর ভিত্তি করে আউটপুট স্কোর করে, প্রায়শই RLHF পাইপলাইনে ব্যবহৃত হয়।
ডিপিও (ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান)
একটি প্রশিক্ষণ পদ্ধতি যা একটি পৃথক পুরস্কার মডেলের প্রয়োজন ছাড়াই সরাসরি পছন্দের জোড়ায় মডেলগুলিকে সূক্ষ্ম-টিউন করে৷
ক্রমাগত শিক্ষা
প্রশিক্ষণ পদ্ধতি যা একটি মডেলকে পূর্বের জ্ঞান না ভুলে নতুন ডেটা থেকে শিখতে দেয়।
ফিউ-শট লার্নিং
শুধুমাত্র অল্প সংখ্যক উদাহরণ থেকে আচরণ শেখা বা মানিয়ে নেওয়া।
মডেল ড্রিফ্ট
বাস্তব-বিশ্বের পরিস্থিতি প্রশিক্ষণের অনুমান থেকে বিচ্ছিন্ন হওয়ার কারণে সময়ের সাথে সাথে কর্মক্ষমতার অবনতি।

আমাদের বিনামূল্যের গাইডে আরও জানুন

আরও দেখুন