زبان AI گائیڈ

براہ راست ترجیحی اصلاح

ڈائریکٹ پرفرنس آپٹیمائزیشن (DPO) زبان کے ماڈلز کو انسانی ترجیحات کے ساتھ ہم آہنگ کرنے کا ایک طریقہ ہے بغیر کسی علیحدہ انعامی ماڈل کی تربیت کے یا کمک سیکھنے کو چلانا۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It collapses a complex multi-stage pipeline into a single, stable training loss.

گہرا غوطہ

2023 میں اسٹینفورڈ میں Rafailov اور ساتھیوں کے ذریعے متعارف کرایا گیا DPO، دوبارہ غور کرتا ہے کہ ہم کس طرح ایک ماڈل کو سکھاتے ہیں جسے لوگ ترجیح دیتے ہیں۔ روایتی نقطہ نظر (RLHF) انسانی موازنہ پر ایک انعامی ماڈل کی تربیت کرتا ہے، پھر اس انعام کو زیادہ سے زیادہ کرنے کے لیے کمک سیکھنے کا استعمال کرتا ہے۔ ڈی پی او کی کلیدی بصیرت ریاضیاتی ہے: اس RLHF مقصد کے تحت بہترین پالیسی کا انعام سے ایک بند شکل کا تعلق ہے، لہذا آپ مساوات کو دوبارہ ترتیب دے سکتے ہیں اور زبان کے ماڈل کو براہ راست ترجیحی جوڑوں پر بہتر بنا سکتے ہیں۔ آپ اسے ایک پرامپٹ دیتے ہیں، ایک 'منتخب' (ترجیحی) جواب، اور 'مسترد' جواب دیتے ہیں، اور ایک سادہ درجہ بندی کے طرز کا نقصان منتخب کردہ جواب کو نسبتاً زیادہ امکان بنانے کے لیے ماڈل کو دھکیل دیتا ہے۔ کوئی ریوارڈ ماڈل، کوئی سیمپلنگ لوپ، کوئی ریوارڈ ہیکنگ نہیں۔ یہ چلانے کے لیے کہیں زیادہ آسان اور زیادہ مستحکم ہے۔

تکنیکی بصیرت

ڈی پی او ترجیحی جوڑوں پر بائنری کراس اینٹروپی نقصان کا استعمال کرتا ہے۔ یہ مسترد شدہ جواب کے نسبت منتخب کردہ جواب کے لاگ امکانی تناسب کو بڑھاتا ہے، ہر ایک کو منجمد حوالہ ماڈل (عام طور پر زیر نگرانی فائن ٹیونڈ نقطہ آغاز) کے خلاف ماپا جاتا ہے۔ درجہ حرارت کا پیرامیٹر بیٹا کنٹرول کرتا ہے کہ پالیسی اس حوالہ سے کس حد تک ہٹ سکتی ہے، واضح طور پر KL رکاوٹ کو نافذ کرتی ہے جس کا RLHF واضح طور پر اطلاق کرتا ہے۔ اجر کبھی پورا نہیں ہوتا۔ یہ پالیسی کے اپنے لاگ ان امکانات میں مضمر ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

براہ راست ترجیحی اصلاح کا مستقبل

DPO پہلے سے طے شدہ الائنمنٹ کا طریقہ بن گیا ہے کیونکہ یہ سستا اور دوبارہ پیدا کیا جا سکتا ہے، اور اس نے مختلف قسموں کے ایک خاندان کو جنم دیا: IPO قریب سے طے شدہ ترجیحات پر اوور فٹنگ کو ٹھیک کرتا ہے، KTO جوڑوں کے بجائے سنگل اچھے یا برے لیبلز سے سیکھتا ہے، اور ORPO بغیر کسی حوالہ ماڈل کے فائن ٹیوننگ میں ترجیحی سیکھنے کو جوڑتا ہے۔ ڈی پی او کو آن پالیسی ڈیٹا اور طوالت/کوالٹی ڈیبیاسنگ کے ساتھ جوڑنے پر کام جاری رکھنے کی توقع کریں، بقیہ خلا کو مکمل آن لائن RLHF کے ساتھ کم کریں۔

حقیقی دنیا کا نفاذ

فائن ٹیوننگ اوپن ویٹ چیٹ ماڈلز جیسے Zephyr اور بہت سے Llama اور Mistral derivatives، جو DPO کے ساتھ ترجیحی ڈیٹا سیٹس پر منسلک تھے۔

جوڑوں کا استعمال کرتے ہوئے نقصان دہ یا غیر مددگار نتائج کو کم کرنا جہاں محفوظ، مددگار جواب کسی مسئلہ پر 'منتخب' کیا جاتا ہے۔

کوڈنگ اسسٹنٹ کو سکھانا کہ ڈویلپر کی درجہ بندی والے موازنہ کا استعمال کرتے ہوئے چھوٹی چھوٹی چیزوں پر درست، اچھی طرح سے دستاویزی حل کو ترجیح دیں۔

خلاصہ کے انداز کو ٹیوننگ کرنا تاکہ ماڈلز لفظی یا فریب نظروں سے زیادہ جامع، دیانت دار خلاصوں کو پسند کریں۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

مشکلات کا تناسب ترجیحی اصلاح

اکثر پوچھے گئے سوالات

What is Direct Preference Optimization?

ڈائریکٹ پرفرنس آپٹیمائزیشن (DPO) زبان کے ماڈلز کو انسانی ترجیحات کے ساتھ ہم آہنگ کرنے کا ایک طریقہ ہے بغیر کسی علیحدہ انعامی ماڈل کی تربیت کے یا کمک سیکھنے کو چلانا۔ یہ ایک پیچیدہ ملٹی اسٹیج پائپ لائن کو ایک واحد، مستحکم تربیتی نقصان میں گرا دیتا ہے۔

روایتی RLHF کے مقابلے ڈی پی او کیا ختم کرتا ہے؟

ڈی پی او کا بنیادی فائدہ واضح ریوارڈ ماڈل اور آر ایل سیمپلنگ لوپ کو ہٹانا ہے، پالیسی کو براہ راست ترجیحی جوڑوں پر بہتر بنانا ہے۔

ایک واحد DPO ٹریننگ مثال کس ڈیٹا پر مشتمل ہے؟

ڈی پی او ترجیحی جوڑوں پر تربیت دیتا ہے: ایک پرامپٹ جمع ایک ترجیحی ('منتخب') اور ایک ناپسندیدہ ('مسترد') جواب۔

ڈی پی او میں ریفرنس ماڈل کیا کردار ادا کرتا ہے؟

ایک منجمد حوالہ (عام طور پر SFT ماڈل) نقصان کو اینکر کرتا ہے۔ بیٹا پیرامیٹر کنٹرول کرتا ہے کہ تربیت یافتہ پالیسی اس سے کتنی دور جا سکتی ہے۔

ڈی پی او میں 'انعام' کی نمائندگی کہاں ہوتی ہے؟

ڈی پی او کے اخذ کرنے سے پتہ چلتا ہے کہ انعام پالیسی اور حوالہ کے درمیان لاگ امکانات کے تناسب میں مضمر ہے، اس لیے کسی واضح ریوارڈ ماڈل کی ضرورت نہیں ہے۔

ڈی پی او میں بیٹا (درجہ حرارت) پیرامیٹر کیا کنٹرول کرتا ہے؟

Beta مضمر KL رکاوٹ کو کنٹرول کرتا ہے: اعلی بیٹا پالیسی کو حوالہ کے قریب رکھتا ہے، کم بیٹا زیادہ انحراف کی اجازت دیتا ہے۔