ٹیکنیکل گائیڈ

گروپ رشتہ دار پالیسی کی اصلاح

گروپ ریلیٹیو پالیسی آپٹیمائزیشن (GRPO) ٹھیک ٹیوننگ لینگوئج ماڈلز کے لیے ایک کمک سیکھنے کا طریقہ ہے جو PPO کے ذریعے استعمال کیے جانے والے علیحدہ ویلیو نیٹ ورک کو ختم کرتے ہوئے، ایک ہی پرامپٹ پر بہن بھائیوں کے جوابات کے ایک گروپ کے خلاف ہر جواب کا فیصلہ کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It became famous as the core training trick behind DeepSeek's reasoning models.

گہرا غوطہ

GRPO پالیسی-گریڈینٹ ری انفورسمنٹ لرننگ کا ایک قسم ہے جو بڑے لینگویج ماڈلز کی RL فائن ٹیوننگ کو سستا اور زیادہ مستحکم بنانے کے لیے ڈیزائن کیا گیا ہے۔ معیاری پی پی او کو ایک سیکھے ہوئے 'تنقید' (ویلیو ماڈل) کی ضرورت ہوتی ہے، جو کہ خود پالیسی جتنی بڑی ہے، اس بات کا اندازہ لگانے کے لیے کہ ہر ٹوکن کتنا اچھا ہے۔ GRPO اس تنقید کو مکمل طور پر ہٹا دیتا ہے۔ ہر پرامپٹ کے لیے یہ تکمیل کے ایک گروپ کا نمونہ کرتا ہے (کہیں 8-64)، ان سب کو انعامی سگنل کے ساتھ اسکور کرتا ہے، اور پھر گروپ کے اوسط اور معیاری انحراف کے خلاف اس کے انعام کو معیاری بنا کر ہر تکمیل کے فائدے کا حساب لگاتا ہے۔ اوسط سے اوپر والے جوابات کو تقویت دی جاتی ہے اور اوسط سے کم جوابات کو دبا دیا جاتا ہے۔ KL-اختلاف کی اصطلاح ماڈل کو حوالہ پالیسی کے قریب رکھتی ہے۔ DeepSeek کے ذریعے متعارف کرایا گیا، اس نے DeepSeekMath اور DeepSeek-R1 ریجننگ ماڈلز کو تقویت دی۔

تکنیکی بصیرت

اہم خیال پی پی او کی سیکھی ہوئی ویلیو بیس لائن کو مونٹی کارلو گروپ بیس لائن سے بدلنا ہے۔ انعامات r_i کے ساتھ آؤٹ پٹ کے گروپ کے لیے، ہر ایک فائدہ A_i = (r_i - مطلب (r)) / std(r) ہے۔ یہ نارملائزڈ اسکور کلپ شدہ امکانی تناسب کو ضرب دیتا ہے، بالکل اسی طرح جیسے PPO میں، اور ایک KL جرمانہ ایک منجمد ریفرنس ماڈل کو روکتا ہے۔ چونکہ کوئی بھی نقاد تربیت یافتہ نہیں ہے، اس لیے میموری اور کمپیوٹ تقریباً آدھا رہ جاتا ہے، اور فی پرامپٹ نارملائزیشن قدرتی طور پر پیمانہ، کم تغیر کے فوائد دیتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

گروپ رشتہ دار پالیسی کی اصلاح کا مستقبل

GRPO تیزی سے کھلے استدلال کے ماڈلز کی تربیت کے لیے ایک طے شدہ نسخہ بن گیا ہے، اور لیبز اس کے کمزور مقامات پر دوبارہ کام کر رہی ہیں۔ محققین لمبائی اور دشواری کے تعصبات (جیسے ڈاکٹر GRPO)، ترتیب کی سطح کو معمول پر لانے کے بجائے ٹوکن لیول، اور KL کی اصطلاح کو ہٹانے یا نئی شکل دینے کے لیے اصلاحات تلاش کر رہے ہیں۔ قابل تصدیق انعامات (ریاضی، کوڈ، ٹول کا استعمال)، ویرل سگنلز کی بہتر ہینڈلنگ، اور ہائبرڈز کے ساتھ سخت انضمام کی توقع کریں جو ایجنٹی، کثیر قدمی کاموں کے لیے ہلکے وزن کے نقادوں کے ساتھ گروپ بیس لائنز کو یکجا کرتے ہیں۔

حقیقی دنیا کا نفاذ

ریاضی کے مسائل پر اصول پر مبنی درستگی کے انعامات کا استعمال کرتے ہوئے طویل سلسلہ فکری استدلال پیدا کرنے کے لیے DeepSeek-R1 اور DeepSeekMath کو تربیت دینا

فائن ٹیوننگ کوڈ جنریشن ماڈل جہاں ہر نمونے کے حل کو اس بات سے اسکور کیا جاتا ہے کہ آیا یہ یونٹ ٹیسٹ پاس کرتا ہے، اور گروپ کو جیتنے والوں کو منتخب کرنے کے لیے معمول بنایا جاتا ہے۔

اوپن سورس RLHF پائپ لائنز (مثال کے طور پر، TRL اور verl لائبریریوں میں) GRPO کا استعمال کرتے ہوئے چیٹ ماڈلز کو ایک علیحدہ ویلیو نیٹ ورک کی ادائیگی کے بغیر سیدھ میں لانا

فی پرامپٹ کئی جوابات کے نمونے لے کر اور ان کے ساتھیوں کے مقابلے میں سب سے زیادہ ریوارڈ ماڈل کی شرح کو انعام دے کر ہدایات پر عمل کرنے یا حفاظتی رویے کو بہتر بنانا

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

قربت کی پالیسی کی اصلاح

اکثر پوچھے گئے سوالات

What is Group Relative Policy Optimization?

گروپ ریلیٹیو پالیسی آپٹیمائزیشن (GRPO) ٹھیک ٹیوننگ لینگوئج ماڈلز کے لیے ایک کمک سیکھنے کا طریقہ ہے جو PPO کے ذریعے استعمال کیے جانے والے علیحدہ ویلیو نیٹ ورک کو ختم کرتے ہوئے، ایک ہی پرامپٹ پر بہن بھائیوں کے جوابات کے ایک گروپ کے خلاف ہر جواب کا فیصلہ کرتا ہے۔ یہ ڈیپ سیک کے استدلال کے ماڈلز کے پیچھے بنیادی تربیتی چال کے طور پر مشہور ہوا۔

GRPO PPO کا کون سا بڑا حصہ ختم کرتا ہے؟

GRPO کی دستخطی تبدیلی PPO کی سیکھی ہوئی قدر/تنقید کے ماڈل کو گرا رہی ہے، جو عام طور پر پالیسی کے سائز کے برابر ہوتا ہے، کافی میموری اور کمپیوٹ کو بچاتا ہے۔

GRPO کسی دی گئی تکمیل کے فائدے کی گنتی کیسے کرتا ہے؟

ہر تکمیل کا فائدہ (انعام - گروپ کا مطلب) / گروپ معیاری انحراف ہے، لہذا اسی پرامپٹ کے جوابات کا گروپ بیس لائن کے طور پر کام کرتا ہے۔

کن ماڈلز نے GRPO کو مشہور کیا؟

GRPO کو DeepSeek نے متعارف کرایا اور مقبول کیا، خاص طور پر DeepSeekMath میں اور DeepSeek-R1 ریجننگ ماڈلز کے پیچھے RL انجن کے طور پر۔

GRPO میں KL-divergence اصطلاح کیا کردار ادا کرتی ہے؟

ایک حوالہ (عام طور پر پری RL) ماڈل کے خلاف KL جرمانہ تربیت کو باقاعدہ بناتا ہے تاکہ پالیسی گرے یا انحطاط پذیر نتائج میں بڑھے بغیر بہتر ہو جائے۔

GRPO خاص طور پر ریاضی یا کوڈ پر استدلال کے ماڈلز کی تربیت کے لیے پرکشش کیوں ہے؟

بہت سے حلوں کے نمونے لینے اور خودکار درستگی کی جانچ پڑتال کے ساتھ اسکور کرنا GRPO کے گروپ کے معمول کے فوائد کے ساتھ صاف ستھری ہے، کسی تنقید کی ضرورت نہیں ہے۔