بنیادی اصول گائیڈ

بریڈلی ٹیری ریوارڈ ماڈلنگ

Bradley-Terry ماڈل ایک صدی پرانا شماریاتی طریقہ ہے جو جوڑے کے حساب سے موازنہ (A beats B) کو عددی اسکور میں تبدیل کرنے کے لیے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

گہرا غوطہ

Bradley-Terry، جو 1952 میں متعارف کرایا گیا، فرض کرتا ہے کہ ہر آئٹم کا ایک پوشیدہ طاقت کا سکور ہوتا ہے، اور اس بات کا امکان کہ شے A کے آئٹم B کو شکست دیتا ہے، ان کے سکور کے فرق کا لاجسٹک فنکشن ہے۔ AI الائنمنٹ میں، یہ ترجیحی اعداد و شمار پر صفائی کے ساتھ نقشہ بناتا ہے: انسانی لیبلرز دو ماڈل جوابات دیکھتے ہیں اور مشکل سے کیلیبریٹ مطلق درجہ بندی دینے کے بجائے بہتر کو منتخب کرتے ہیں۔ ایک انعامی ماڈل، عام طور پر اسکیلر آؤٹ پٹ ہیڈ کے ساتھ لینگویج ماڈل کو تربیت دی جاتی ہے تاکہ انسانوں کے ترجیحی ردعمل کو زیادہ اسکیلر انعام ملے۔ نقصان بریڈلی-ٹیری امکان کا منفی لاگ امکان ہے: لاگ سگمائیڈ کو زیادہ سے زیادہ کریں (منتخب شدہ کا انعام منفی انعام)۔ نتیجے میں آنے والا ریوارڈ ماڈل پھر صوابدیدی آؤٹ پٹ اسکور کرتا ہے، یہ سگنل فراہم کرتا ہے کہ PPO جیسے کمک سیکھنے والے الگورتھم ماڈلز کو مزید مددگار اور سیدھ میں لانے کے خلاف بہتر بناتے ہیں۔

تکنیکی بصیرت

موازنہ کے لیے تربیتی نقصان صرف مائنس لاگ سگمائیڈ آف (r_chosen − r_rejected) ہے، اس لیے ماڈل صرف رشتہ دار فرق سیکھتا ہے۔ اس کا مطلب ہے کہ انعامات صرف ایک اضافی مستقل تک قابل شناخت ہیں۔ مطلق پیمانہ صوابدیدی ہے۔ چونکہ موازنہ انسانوں کے لیے 1 سے 10 سکور کے مقابلے میں آسان اور زیادہ مطابقت رکھتا ہے، بریڈلی ٹیری ڈیٹا کم شور والا ہے۔ براہ راست ترجیحی اصلاح نے بعد میں دکھایا کہ آپ علیحدہ انعامی ماڈل کو چھوڑ سکتے ہیں اور براہ راست پالیسی پر بریڈلی-ٹیری مقصد کو بہتر بنا سکتے ہیں۔

اسٹریٹجک اثر

واضح فیصلے

یہ آپ کو مارکیٹنگ کی زبان سے واضح تکنیکی دعووں کو الگ کرنے میں مدد کرتا ہے۔

لاگت اور بجٹ

آپ پیسہ یا وقت خرچ کرنے سے پہلے بہتر نفاذ کے سوالات پوچھ سکتے ہیں۔

Team and workflow

مشترکہ تفہیم کے ساتھ ٹیمیں بہتر پروڈکٹ، پالیسی اور سیکھنے کے فیصلے کرتی ہیں۔

بریڈلی ٹیری ریوارڈ ماڈلنگ کا مستقبل

Bradley-Terry ایک واحد مستقل درجہ بندی اور عبوری ترجیحات کو فرض کرتا ہے، جو اس وقت ٹوٹ جاتا ہے جب انسان متفق نہیں ہوتے یا ترجیحات کا چکر لگاتے ہیں۔ تحقیق ایسے ماڈلز کی طرف بڑھ رہی ہے جو ترجیحی تقسیم، کثیر جہتی انعامات (مددگاری، حفاظت، ایمانداری کو الگ سے اسکور کیا گیا)، اور انسانی تاثرات سے نیش سیکھنے جیسے طریقے جو سنگل اسکور کے مفروضے کو چھوڑ دیتے ہیں۔ DPO اور اس کی مختلف قسمیں بریڈلی ٹیری کے مقصد کو براہ راست پالیسی ٹریننگ میں جوڑ دیتی ہیں۔ ریوارڈ ہیکنگ کو کم کرنے کے لیے دو سے زیادہ آئٹمز کی درجہ بندی اور اعتماد کے لحاظ سے ترجیحات سمیت زیادہ سے زیادہ موازنہ کی اسکیموں کی توقع کریں۔

حقیقی دنیا کا نفاذ

RLHF میں انعامی ماڈل کی تربیت جو دو چیٹ بوٹ جوابات کی درجہ بندی کرتا ہے اور PPO فائن ٹیوننگ کے لیے بہتر سے بدتر سگنل فراہم کرتا ہے۔

براہ راست ترجیحی اصلاح Bradley-Terry log-sigmoid loss کا استعمال کرتے ہوئے منتخب کردہ بمقابلہ مسترد جوابی جوڑوں پر براہ راست ماڈل کو ٹھیک کرنا۔

Elo کے ذریعے شطرنج یا اسپورٹس کے کھلاڑیوں کی درجہ بندی کرنا، جو کہ ریاضی کے لحاظ سے کھیل کے نتائج پر Bradley-Terry ماڈل کا قریبی کزن ہے۔

مطلق ستارے کی درجہ بندی کے بجائے 'صارفین نے A پر B کو ترجیح دی' سے مواد کی سفارش کا درجہ بندی کرنا۔

خطرات اور گارڈریلز

مختلف ٹیمیں ایک ہی اصطلاح کو مختلف طریقے سے استعمال کر سکتی ہیں، اس لیے دائرہ کار کی جلد وضاحت کریں۔

بینچ مارکس مضبوط نظر آسکتے ہیں جبکہ حقیقی دنیا کی کارکردگی ناہموار ہے۔

ڈیٹا کے معیار اور تشخیص کے منصوبوں کو نظر انداز کرنا اکثر نازک نتائج پیدا کرتا ہے۔

نفاذ کا روڈ میپ

1

آپ کو مطلوبہ نتائج کی سادہ زبان کی تعریف کے ساتھ شروع کریں۔

2

جانچ کرنے سے پہلے ایک کامیابی میٹرک اور ایک ناکامی کی شرط منتخب کریں۔

3

نمائندہ ڈیٹا کے ساتھ ایک چھوٹا پائلٹ چلائیں، نہ کہ پالش شدہ ڈیمو سیٹ۔

4

دستاویز جہاں Bradley-Terry Reward Modeling میں مدد ملتی ہے اور جہاں آسان طریقے بہتر ہیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Bradley-Terry Reward Modeling?

Bradley-Terry ماڈل ایک صدی پرانا شماریاتی طریقہ ہے جو جوڑے کے حساب سے موازنہ (A beats B) کو عددی اسکور میں تبدیل کرنے کے لیے۔ جدید AI میں یہ انعامی ماڈلز کو طاقت دیتا ہے جو 'کون سا جواب بہتر ہے؟' سے انسانی ترجیحات سیکھتے ہیں۔ لیبلز، RLHF کی ریڑھ کی ہڈی۔

بریڈلی-ٹیری ماڈل عددی اسکور میں کیا بدلتا ہے؟

Bradley-Terry جوڑے کے لحاظ سے 'A beats B' کا موازنہ کرتا ہے اور ہر آئٹم کے لیے ایک پوشیدہ طاقت کے اسکور کا اندازہ لگاتا ہے، یہی وجہ ہے کہ یہ انسانی ترجیحات کے لیبلنگ پر اتنی اچھی طرح فٹ بیٹھتا ہے۔

بریڈلی ٹیری میں، اس امکان کا کہ A بی کو دھڑکتا ہے کس چیز کا کام ہے؟

ماڈل P(A beats B) کو A's اور B کے پوشیدہ طاقت کے اسکور کے درمیان فرق کے لاجسٹک (sigmoid) کے برابر سیٹ کرتا ہے۔

بریڈلی ٹیری انعامات صرف ایک اضافی مستقل تک کیوں قابل شناخت ہیں؟

تربیت کا نقصان صرف منتخب اور مسترد شدہ انعامات کے درمیان فرق کا استعمال کرتا ہے، لہذا تمام اسکورز کو ایک ہی مستقل کے ذریعے منتقل کرنے سے نقصان میں کوئی تبدیلی نہیں ہوتی۔ مطلق پیمانہ صوابدیدی ہے۔

انعامی ماڈلنگ میں واحد ترجیحی موازنہ کے لیے معیاری نقصان کیا ہے؟

بریڈلی-ٹیری منفی لاگ کا امکان منتخب شدہ-مائنس-مسترد شدہ انعام کے فرق کے مائنس لاگ-سگمائڈ تک کم ہو جاتا ہے، جس سے منتخب جواب کے انعام کو زیادہ دھکیل دیا جاتا ہے۔

کون سا طریقہ براہ راست پالیسی پر Bradley-Terry مقصد کو بہتر بنا کر ایک الگ انعامی ماڈل کو چھوڑ دیتا ہے؟

DPO بریڈلی-ٹیری ترجیحی مقصد کی اصلاح کرتا ہے تاکہ اسے براہ راست پالیسی ماڈل پر لاگو کیا جا سکے، اسٹینڈ لون ریوارڈ ماڈل کی تربیت اور استفسار کرنے کی ضرورت کو دور کرتے ہوئے