ব্র্যাডলি-টেরি পুরস্কার মডেলিং
ব্র্যাডলি-টেরি মডেল হল একটি শতাব্দী-পুরাতন পরিসংখ্যানগত পদ্ধতি যা যুগলভিত্তিক তুলনা (A বিট বি) কে সাংখ্যিক স্কোরে পরিণত করার জন্য।
ওভারভিউ
In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.
গভীর ডুব
ব্র্যাডলি-টেরি, 1952 সালে প্রবর্তিত, অনুমান করে যে প্রতিটি আইটেমের একটি লুকানো শক্তি স্কোর রয়েছে এবং আইটেম A আইটেম B কে হারানোর সম্ভাবনা তাদের স্কোরের পার্থক্যের লজিস্টিক ফাংশন। এআই সারিবদ্ধকরণে, এটি পছন্দের ডেটাতে সুন্দরভাবে মানচিত্র তৈরি করে: মানব লেবেলার দুটি মডেল প্রতিক্রিয়া দেখেন এবং কঠিন-ক্যালিব্রেট পরম রেটিং দেওয়ার পরিবর্তে আরও ভাল একটি বেছে নেন। একটি পুরষ্কার মডেল, সাধারণত একটি স্কেলার আউটপুট হেড সহ ভাষার মডেলকে প্রশিক্ষিত করা হয় যাতে মানুষের পছন্দের প্রতিক্রিয়া একটি উচ্চতর স্কেলার পুরস্কার পায়। ক্ষতি হল ব্র্যাডলি-টেরির সম্ভাবনার নেতিবাচক লগ-সম্ভাবনা: লগ-সিগময়েডকে সর্বাধিক করুন (প্রত্যাখ্যানের জন্য নির্বাচিত বিয়োগ পুরস্কার)। ফলস্বরূপ পুরষ্কার মডেলটি তখন নির্বিচারে আউটপুট স্কোর করে, যা সিগন্যাল প্রদান করে যে পিপিও-এর মতো শক্তিবৃদ্ধি শেখার অ্যালগরিদমগুলি মডেলগুলিকে আরও সহায়ক এবং সারিবদ্ধ করার বিরুদ্ধে অপ্টিমাইজ করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
তুলনা করার জন্য প্রশিক্ষণের ক্ষতি হল বিয়োগ লগ-সিগমায়েড অফ (r_chosen − r_rejected), তাই মডেলটি শুধুমাত্র আপেক্ষিক পার্থক্য শিখে। এর অর্থ হল পুরষ্কারগুলি শুধুমাত্র একটি সংযোজন ধ্রুবক পর্যন্ত সনাক্তযোগ্য; পরম স্কেল নির্বিচারে হয়. যেহেতু তুলনা করা সহজ এবং মানুষের জন্য 1-থেকে-10 স্কোরের চেয়ে বেশি সামঞ্জস্যপূর্ণ, ব্র্যাডলি-টেরি ডেটা কম শোরগোল করে। প্রত্যক্ষ পছন্দ অপ্টিমাইজেশান পরে দেখায় যে আপনি পৃথক পুরস্কার মডেলটি এড়িয়ে যেতে পারেন এবং সরাসরি নীতিতে ব্র্যাডলি-টেরির উদ্দেশ্য অপ্টিমাইজ করতে পারেন।
কৌশলগত প্রভাব
সুস্পষ্ট সিদ্ধান্ত
এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।
খরচ ও বাজেট
অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।
টিম এবং ওয়ার্কফ্লো
ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।
ব্র্যাডলি-টেরি পুরস্কার মডেলিংয়ের ভবিষ্যত
ব্র্যাডলি-টেরি একটি একক সামঞ্জস্যপূর্ণ র্যাঙ্কিং এবং ট্রানজিটিভ পছন্দ অনুমান করে, যা ভেঙ্গে যায় যখন মানুষ একমত না হয় বা পছন্দের চক্র। গবেষণা এমন মডেলের দিকে অগ্রসর হচ্ছে যা পছন্দের বন্টন, বহুমাত্রিক পুরস্কার (সহায়তা, নিরাপত্তা, সততা আলাদাভাবে স্কোর করা) এবং ন্যাশের মতো পদ্ধতি যা মানব প্রতিক্রিয়া থেকে শেখার মতো পদ্ধতি যা একক-স্কোর অনুমানকে বাদ দেয়। ডিপিও এবং এর রূপগুলি ব্র্যাডলি-টেরির উদ্দেশ্যকে ক্রমবর্ধমানভাবে সরাসরি নীতি প্রশিক্ষণে ভাঁজ করে। পুরষ্কার হ্যাকিং কমাতে দুইটির বেশি আইটেমের র্যাঙ্কিং এবং আত্মবিশ্বাস-ভারিত পছন্দ সহ আরও সমৃদ্ধ তুলনামূলক স্কিমগুলি আশা করুন৷
বাস্তব-বিশ্ব বাস্তবায়ন
RLHF-এ পুরষ্কার মডেলের প্রশিক্ষণ যা দুটি চ্যাটবট প্রতিক্রিয়াকে র্যাঙ্ক করে এবং PPO ফাইন-টিউনিংয়ের জন্য আরও ভাল-খারাপ সংকেত দেয়।
সরাসরি পছন্দ অপ্টিমাইজেশান ব্রাডলি-টেরি লগ-সিগময়েড ক্ষতি ব্যবহার করে নির্বাচিত-বনাম-প্রত্যাখ্যাত উত্তর জোড়ায় সরাসরি একটি মডেলকে ফাইন-টিউনিং করে।
Elo-এর মাধ্যমে দাবা বা এস্পোর্টস খেলোয়াড়দের র্যাঙ্কিং করা, যা গেমের ফলাফলে গাণিতিকভাবে ব্র্যাডলি-টেরি মডেলের ঘনিষ্ঠ কাজিন।
একটি বিষয়বস্তু সুপারিশ র্যাঙ্কার তৈরি করা 'ব্যবহারকারীরা A-এর চেয়ে B' ক্লিক ডেটা থেকে সম্পূর্ণ স্টার রেটিং-এর পরিবর্তে।
ঝুঁকি এবং প্রহরী
বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।
বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।
ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।
বাস্তবায়ন রোডম্যাপ
আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।
পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।
একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷
নথি যেখানে ব্র্যাডলি-টেরি পুরস্কার মডেলিং সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Bradley-Terry Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
পুরস্কার মডেলিং
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Bradley-Terry Reward Modeling?
ব্র্যাডলি-টেরি মডেল হল একটি শতাব্দী-পুরাতন পরিসংখ্যানগত পদ্ধতি যা যুগলভিত্তিক তুলনা (A বিট বি) কে সাংখ্যিক স্কোরে পরিণত করার জন্য। আধুনিক AI-তে এটি পুরষ্কারের মডেলগুলিকে ক্ষমতা দেয় যেগুলি 'কোন উত্তরটি ভাল?' থেকে মানুষের পছন্দগুলি শেখে। লেবেল, RLHF এর মেরুদণ্ড।
ব্র্যাডলি-টেরি মডেলকে কী সংখ্যাসূচক স্কোরে রূপান্তরিত করে?
ব্র্যাডলি-টেরি যুগলভাবে 'এ বিটস বি' তুলনা করে এবং প্রতিটি আইটেমের জন্য একটি লুকানো শক্তি স্কোর অনুমান করে, যে কারণে এটি মানুষের পছন্দের লেবেলিংয়ের সাথে খুব ভালভাবে ফিট করে।
ব্র্যাডলি-টেরিতে, A যে B কে মারছে তার সম্ভাবনা কিসের একটি ফাংশন?
মডেলটি A এর এবং B এর লুকানো শক্তি স্কোরের মধ্যে পার্থক্যের লজিস্টিক (সিগময়েড) এর সমান P(A বিট বি) সেট করে।
কেন ব্র্যাডলি-টেরি পুরষ্কার শুধুমাত্র একটি সংযোজন ধ্রুবক পর্যন্ত শনাক্তযোগ্য?
প্রশিক্ষণ ক্ষতি শুধুমাত্র নির্বাচিত এবং প্রত্যাখ্যান করা পুরস্কারের মধ্যে পার্থক্য ব্যবহার করে, তাই একই ধ্রুবক দ্বারা সমস্ত স্কোর স্থানান্তরিত করলে ক্ষতি অপরিবর্তিত থাকে; পরম স্কেল নির্বিচারে হয়.
পুরষ্কার মডেলিং-এ একক পছন্দের তুলনার জন্য মান ক্ষতি কী?
ব্র্যাডলি-টেরির নেতিবাচক লগ-সম্ভাবনা নির্বাচিত-বিয়োগ-প্রত্যাখ্যাত পুরস্কারের পার্থক্যের মাইনাস লগ-সিগমায়েডে হ্রাস পায়, যা নির্বাচিত প্রতিক্রিয়ার পুরস্কারকে উচ্চতর করে।
কোন পদ্ধতি সরাসরি নীতিতে ব্র্যাডলি-টেরির উদ্দেশ্য অপ্টিমাইজ করে একটি পৃথক পুরস্কার মডেল এড়িয়ে যায়?
DPO ব্র্যাডলি-টেরি পছন্দের উদ্দেশ্যকে পুনর্গঠন করে যাতে এটি সরাসরি নীতি মডেলে প্রয়োগ করা যেতে পারে, একটি স্বতন্ত্র পুরষ্কার মডেলের প্রশিক্ষণ ও অনুসন্ধানের প্রয়োজনীয়তা দূর করে।