এআই শব্দকোষের মেয়াদ

কি ডিপিও (ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান)?

সংজ্ঞা

একটি প্রশিক্ষণ পদ্ধতি যা একটি পৃথক পুরস্কার মডেলের প্রয়োজন ছাড়াই সরাসরি পছন্দের জোড়ায় মডেলগুলিকে সূক্ষ্ম-টিউন করে৷

সম্পর্কিত পদ

হিউম্যান ফিডব্যাক থেকে রিইনফোর্সমেন্ট লার্নিং (RLHF)
একটি প্রশিক্ষণ পদ্ধতি যা মডেল আচরণকে আকার দিতে মানুষের পছন্দ সংকেত ব্যবহার করে।
পোস্ট-ট্রেনিং
প্রশিক্ষণের ধাপগুলি প্রি-ট্রেনিংয়ের পরে প্রয়োগ করা হয়, যেমন নির্দেশ টিউনিং, পছন্দ অপ্টিমাইজেশান এবং নিরাপত্তা টিউনিং।
ক্রমাগত শিক্ষা
প্রশিক্ষণ পদ্ধতি যা একটি মডেলকে পূর্বের জ্ঞান না ভুলে নতুন ডেটা থেকে শিখতে দেয়।
ফাইন-টিউনিং
একটি নির্দিষ্ট কাজের জন্য একটি প্রাক-প্রশিক্ষিত মডেলকে মানিয়ে নিতে ডোমেন-নির্দিষ্ট ডেটার উপর অবিরত প্রশিক্ষণ।
গ্রেডিয়েন্ট ডিসেন্ট
একটি অপ্টিমাইজেশান পদ্ধতি যা প্যারামিটারগুলিকে সেই দিকে আপডেট করে যা ত্রুটি হ্রাস করে৷
নির্দেশ টিউনিং
নির্দেশনা-প্রতিক্রিয়া জোড়ায় একটি মডেলকে ফাইন-টিউনিং করে অনুসরণ করা টাস্ককে উন্নত করা।

আমাদের বিনামূল্যের গাইডে আরও জানুন

আরও দেখুন