زبان AI گائیڈ

قربت کی پالیسی کی اصلاح

Proximal Policy Optimization (PPO) ایک کمک سیکھنے کا الگورتھم ہے جو انسانی تاثرات سے لینگویج کے بہترین ماڈلز سے وابستہ ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

گہرا غوطہ

PPO کو 2017 میں OpenAI نے متعارف کرایا تھا اور InstructGPT اور ChatGPT جیسے سسٹمز کے لیے RLHF کے پیچھے کام کا ہارس بن گیا تھا۔ پالیسی-گریڈینٹ RL میں بنیادی چیلنج یہ ہے کہ ایک حد سے زیادہ بڑی اپ ڈیٹ کارکردگی کو ختم کر سکتی ہے۔ PPO اسے ایک 'کلپڈ سروگیٹ مقصد' کے ساتھ حل کرتا ہے: یہ پیمائش کرتا ہے کہ پرانی پالیسی کے مقابلے میں ایک کارروائی کا کتنا زیادہ (یا کم) امکان ہے، اس تناسب کو فائدہ سے ضرب دیتا ہے (عمل توقع سے کتنا بہتر تھا)، اور تناسب کو 0.8 سے 1.2 جیسی چھوٹی رینج میں کلپ کرتا ہے۔ یہ اس بات کا تعین کرتا ہے کہ پالیسی فی اپ ڈیٹ کس حد تک آگے بڑھ سکتی ہے، سیکھنے کو مستحکم رکھتے ہوئے اب بھی مستحکم بہتری کی اجازت دیتی ہے۔ لینگویج ماڈل RLHF میں، 'ایکشن' ایک ٹوکن یا ردعمل پیدا کر رہا ہے، انعام انعام کے ماڈل سے آتا ہے، اور KL- ڈائیورجنس جرمانہ ماڈل کو اس کے اصل رویے سے بہت دور جانے سے روکتا ہے۔

تکنیکی بصیرت

پی پی او تراشے ہوئے مقصد کو زیادہ سے زیادہ کرتا ہے: منٹ(تناسب * فائدہ، کلپ(تناسب، 1-ای پی ایس، 1+ای پی ایس) * فائدہ)، جہاں تناسب نئے سے زیادہ پرانے عمل کا امکان ہے۔ فوائد کا تخمینہ عام طور پر جنرلائزڈ ایڈوانٹیج اسٹیمیشن اور ایک سیکھی ہوئی قدر (تنقید) نیٹ ورک سے لگایا جاتا ہے۔ RLHF میں، کل انعام ریوارڈ-ماڈل سکور کو حوالہ پالیسی کے خلاف فی ٹوکن KL جرمانے کے ساتھ جوڑتا ہے، اصل ماڈل کے قریب رہنے کے خلاف انعام کے حصول کو متوازن کرتا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

قربت کی پالیسی کی اصلاح کا مستقبل

پی پی او مضبوط رہتا ہے لیکن بدنام زمانہ ہے: اسے ایک علیحدہ ویلیو نیٹ ورک، محتاط ہائپر پیرامیٹر ٹیوننگ، اور بہت زیادہ کمپیوٹ کی ضرورت ہے۔ آسان متبادل زمین حاصل کر رہے ہیں، بشمول DPO (کوئی RL نہیں) اور GRPO، جو نمونے کے جوابات کے گروپوں سے فوائد کا تخمینہ لگا کر ویلیو نیٹ ورک کو گرا دیتا ہے اور حالیہ استدلال کے ماڈلز کو تقویت دیتا ہے۔ پی پی او برقرار رہے گا جہاں پالیسی کی تلاش میں حقیقی طور پر مدد ملتی ہے، لیکن فیلڈ سستے طریقوں کے لیے اپنی کچھ پیچیدگیوں کو فعال طور پر ٹریڈ کر رہا ہے۔

حقیقی دنیا کا نفاذ

RLHF کے ذریعے ہدایات اور انسانی ترجیحات پر عمل کرنے کے لیے Fine-Tuning InstructGPT اور ChatGPT

گیم پلےنگ اور روبوٹکس کنٹرول ایجنٹوں کو تربیت دینا، زبان کے ماڈلز سے پہلے PPO کا اصل ڈومین

KL کی پابندی کے تحت انعامی ماڈل کے اسکور کو زیادہ سے زیادہ کرکے زہریلا کو کم کرنا یا مدد کو بہتر بنانا

ٹول کے استعمال یا ملٹی سٹیپ ایجنٹ کے رویے کو بہتر بنانا جہاں ایک ماڈل کو کاموں کو صحیح طریقے سے مکمل کرنے پر انعام دیا جاتا ہے۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

گروپ رشتہ دار پالیسی کی اصلاح

اکثر پوچھے گئے سوالات

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) ایک کمک سیکھنے کا الگورتھم ہے جو انسانی تاثرات سے لینگویج کے بہترین ماڈلز سے وابستہ ہے۔ یہ عدم استحکام سے بچنے کے لیے محتاط، چھوٹے اقدامات میں پالیسی کو بہتر بناتا ہے جو کہ سادہ پالیسی کے تدریجی طریقوں کو متاثر کرتی ہے۔

PPO کی 'کلپنگ' بنیادی طور پر کس مسئلے کو حل کرتی ہے؟

امکانی تناسب کو تراشنا کسی بھی ایک اپ ڈیٹ کو پالیسی کو بہت آگے جانے سے روکتا ہے، جو پالیسی کے تدریجی طریقوں میں عدم استحکام کا بنیادی ذریعہ ہے۔

پی پی او کے ساتھ لینگویج ماڈل RLHF میں، انعام کا اشارہ عام طور پر کہاں سے آتا ہے؟

ریوارڈ ماڈل جنریٹڈ جوابات کے لیے اسکیلر ریوارڈ فراہم کرتا ہے، کیونکہ انسانوں کا RL کے دوران ہر آؤٹ پٹ اسکور کرنا نا ممکن ہوگا۔

پی پی او پر مبنی آر ایل ایچ ایف میں KL- ڈائیورجنس جرمانہ کیا کرتا ہے؟

اصل (حوالہ) پالیسی کے خلاف فی ٹوکن KL جرمانہ ماڈل کی حوصلہ شکنی کرتا ہے کہ وہ انعام کا پیچھا کرتے ہوئے اپنے رویے کو بہت زیادہ تبدیل کرے۔

پی پی او میں ویلیو (تنقید) نیٹ ورک کا کیا کردار ہے؟

پی پی او ایک اداکار نقاد کا طریقہ ہے۔ ویلیو نیٹ ورک متوقع انعام کا تخمینہ لگاتا ہے، فائدہ کے تخمینے کو فعال کرتا ہے (اکثر GAE کے ذریعے) جو فرق کو کم کرتا ہے۔

PPO میں 'فائدہ' کس چیز کی نمائندگی کرتا ہے؟

فائدہ اس بات کی پیمائش کرتا ہے کہ ایک منتخب کردہ عمل قدر کے تخمینے کے مقابلے میں کتنا بہتر (یا بدتر) تھا، جو پالیسی کو بتاتا ہے کہ کن کارروائیوں کو تقویت دینا ہے۔