মৌলিক নির্দেশিকা

ব্র্যাডলি-টেরি পুরস্কার মডেলিং

ব্র্যাডলি-টেরি মডেল হল একটি শতাব্দী-পুরাতন পরিসংখ্যানগত পদ্ধতি যা যুগলভিত্তিক তুলনা (A বিট বি) কে সাংখ্যিক স্কোরে পরিণত করার জন্য।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

গভীর ডুব

ব্র্যাডলি-টেরি, 1952 সালে প্রবর্তিত, অনুমান করে যে প্রতিটি আইটেমের একটি লুকানো শক্তি স্কোর রয়েছে এবং আইটেম A আইটেম B কে হারানোর সম্ভাবনা তাদের স্কোরের পার্থক্যের লজিস্টিক ফাংশন। এআই সারিবদ্ধকরণে, এটি পছন্দের ডেটাতে সুন্দরভাবে মানচিত্র তৈরি করে: মানব লেবেলার দুটি মডেল প্রতিক্রিয়া দেখেন এবং কঠিন-ক্যালিব্রেট পরম রেটিং দেওয়ার পরিবর্তে আরও ভাল একটি বেছে নেন। একটি পুরষ্কার মডেল, সাধারণত একটি স্কেলার আউটপুট হেড সহ ভাষার মডেলকে প্রশিক্ষিত করা হয় যাতে মানুষের পছন্দের প্রতিক্রিয়া একটি উচ্চতর স্কেলার পুরস্কার পায়। ক্ষতি হল ব্র্যাডলি-টেরির সম্ভাবনার নেতিবাচক লগ-সম্ভাবনা: লগ-সিগময়েডকে সর্বাধিক করুন (প্রত্যাখ্যানের জন্য নির্বাচিত বিয়োগ পুরস্কার)। ফলস্বরূপ পুরষ্কার মডেলটি তখন নির্বিচারে আউটপুট স্কোর করে, যা সিগন্যাল প্রদান করে যে পিপিও-এর মতো শক্তিবৃদ্ধি শেখার অ্যালগরিদমগুলি মডেলগুলিকে আরও সহায়ক এবং সারিবদ্ধ করার বিরুদ্ধে অপ্টিমাইজ করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

তুলনা করার জন্য প্রশিক্ষণের ক্ষতি হল বিয়োগ লগ-সিগমায়েড অফ (r_chosen − r_rejected), তাই মডেলটি শুধুমাত্র আপেক্ষিক পার্থক্য শিখে। এর অর্থ হল পুরষ্কারগুলি শুধুমাত্র একটি সংযোজন ধ্রুবক পর্যন্ত সনাক্তযোগ্য; পরম স্কেল নির্বিচারে হয়. যেহেতু তুলনা করা সহজ এবং মানুষের জন্য 1-থেকে-10 স্কোরের চেয়ে বেশি সামঞ্জস্যপূর্ণ, ব্র্যাডলি-টেরি ডেটা কম শোরগোল করে। প্রত্যক্ষ পছন্দ অপ্টিমাইজেশান পরে দেখায় যে আপনি পৃথক পুরস্কার মডেলটি এড়িয়ে যেতে পারেন এবং সরাসরি নীতিতে ব্র্যাডলি-টেরির উদ্দেশ্য অপ্টিমাইজ করতে পারেন।

কৌশলগত প্রভাব

সুস্পষ্ট সিদ্ধান্ত

এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।

খরচ ও বাজেট

অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।

টিম এবং ওয়ার্কফ্লো

ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।

ব্র্যাডলি-টেরি পুরস্কার মডেলিংয়ের ভবিষ্যত

ব্র্যাডলি-টেরি একটি একক সামঞ্জস্যপূর্ণ র‌্যাঙ্কিং এবং ট্রানজিটিভ পছন্দ অনুমান করে, যা ভেঙ্গে যায় যখন মানুষ একমত না হয় বা পছন্দের চক্র। গবেষণা এমন মডেলের দিকে অগ্রসর হচ্ছে যা পছন্দের বন্টন, বহুমাত্রিক পুরস্কার (সহায়তা, নিরাপত্তা, সততা আলাদাভাবে স্কোর করা) এবং ন্যাশের মতো পদ্ধতি যা মানব প্রতিক্রিয়া থেকে শেখার মতো পদ্ধতি যা একক-স্কোর অনুমানকে বাদ দেয়। ডিপিও এবং এর রূপগুলি ব্র্যাডলি-টেরির উদ্দেশ্যকে ক্রমবর্ধমানভাবে সরাসরি নীতি প্রশিক্ষণে ভাঁজ করে। পুরষ্কার হ্যাকিং কমাতে দুইটির বেশি আইটেমের র‌্যাঙ্কিং এবং আত্মবিশ্বাস-ভারিত পছন্দ সহ আরও সমৃদ্ধ তুলনামূলক স্কিমগুলি আশা করুন৷

বাস্তব-বিশ্ব বাস্তবায়ন

RLHF-এ পুরষ্কার মডেলের প্রশিক্ষণ যা দুটি চ্যাটবট প্রতিক্রিয়াকে র‍্যাঙ্ক করে এবং PPO ফাইন-টিউনিংয়ের জন্য আরও ভাল-খারাপ সংকেত দেয়।

সরাসরি পছন্দ অপ্টিমাইজেশান ব্রাডলি-টেরি লগ-সিগময়েড ক্ষতি ব্যবহার করে নির্বাচিত-বনাম-প্রত্যাখ্যাত উত্তর জোড়ায় সরাসরি একটি মডেলকে ফাইন-টিউনিং করে।

Elo-এর মাধ্যমে দাবা বা এস্পোর্টস খেলোয়াড়দের র‌্যাঙ্কিং করা, যা গেমের ফলাফলে গাণিতিকভাবে ব্র্যাডলি-টেরি মডেলের ঘনিষ্ঠ কাজিন।

একটি বিষয়বস্তু সুপারিশ র‌্যাঙ্কার তৈরি করা 'ব্যবহারকারীরা A-এর চেয়ে B' ক্লিক ডেটা থেকে সম্পূর্ণ স্টার রেটিং-এর পরিবর্তে।

ঝুঁকি এবং প্রহরী

বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।

বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।

ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।

বাস্তবায়ন রোডম্যাপ

1

আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।

2

পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।

3

একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷

4

নথি যেখানে ব্র্যাডলি-টেরি পুরস্কার মডেলিং সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

পুরস্কার মডেলিং

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Bradley-Terry Reward Modeling?

ব্র্যাডলি-টেরি মডেল হল একটি শতাব্দী-পুরাতন পরিসংখ্যানগত পদ্ধতি যা যুগলভিত্তিক তুলনা (A বিট বি) কে সাংখ্যিক স্কোরে পরিণত করার জন্য। আধুনিক AI-তে এটি পুরষ্কারের মডেলগুলিকে ক্ষমতা দেয় যেগুলি 'কোন উত্তরটি ভাল?' থেকে মানুষের পছন্দগুলি শেখে। লেবেল, RLHF এর মেরুদণ্ড।

ব্র্যাডলি-টেরি মডেলকে কী সংখ্যাসূচক স্কোরে রূপান্তরিত করে?

ব্র্যাডলি-টেরি যুগলভাবে 'এ বিটস বি' তুলনা করে এবং প্রতিটি আইটেমের জন্য একটি লুকানো শক্তি স্কোর অনুমান করে, যে কারণে এটি মানুষের পছন্দের লেবেলিংয়ের সাথে খুব ভালভাবে ফিট করে।

ব্র্যাডলি-টেরিতে, A যে B কে মারছে তার সম্ভাবনা কিসের একটি ফাংশন?

মডেলটি A এর এবং B এর লুকানো শক্তি স্কোরের মধ্যে পার্থক্যের লজিস্টিক (সিগময়েড) এর সমান P(A বিট বি) সেট করে।

কেন ব্র্যাডলি-টেরি পুরষ্কার শুধুমাত্র একটি সংযোজন ধ্রুবক পর্যন্ত শনাক্তযোগ্য?

প্রশিক্ষণ ক্ষতি শুধুমাত্র নির্বাচিত এবং প্রত্যাখ্যান করা পুরস্কারের মধ্যে পার্থক্য ব্যবহার করে, তাই একই ধ্রুবক দ্বারা সমস্ত স্কোর স্থানান্তরিত করলে ক্ষতি অপরিবর্তিত থাকে; পরম স্কেল নির্বিচারে হয়.

পুরষ্কার মডেলিং-এ একক পছন্দের তুলনার জন্য মান ক্ষতি কী?

ব্র্যাডলি-টেরির নেতিবাচক লগ-সম্ভাবনা নির্বাচিত-বিয়োগ-প্রত্যাখ্যাত পুরস্কারের পার্থক্যের মাইনাস লগ-সিগমায়েডে হ্রাস পায়, যা নির্বাচিত প্রতিক্রিয়ার পুরস্কারকে উচ্চতর করে।

কোন পদ্ধতি সরাসরি নীতিতে ব্র্যাডলি-টেরির উদ্দেশ্য অপ্টিমাইজ করে একটি পৃথক পুরস্কার মডেল এড়িয়ে যায়?

DPO ব্র্যাডলি-টেরি পছন্দের উদ্দেশ্যকে পুনর্গঠন করে যাতে এটি সরাসরি নীতি মডেলে প্রয়োগ করা যেতে পারে, একটি স্বতন্ত্র পুরষ্কার মডেলের প্রশিক্ষণ ও অনুসন্ধানের প্রয়োজনীয়তা দূর করে।