خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

فن تعمیر سے آگاہ کریڈٹ تفویض زبان کے ماڈلز کے لیے کمک سیکھنے کو بہتر بناتا ہے۔

ایک arXiv پری پرنٹ CompPO متعارف کراتا ہے، ایک کمک سیکھنے کا طریقہ جو ٹوکنز پر ٹریننگ کریڈٹ تفویض کرنے کے لیے زبان کے ماڈل کے اپنے توجہ کے نمونوں کا استعمال کرتا ہے۔ مصنفین Qwen3-4B اور Llama-3.1-8B-انسٹرکٹ پر تجربات میں ٹیونڈ GRPO کے مقابلے میں زیادہ درستگی اور زیادہ استحکام کی اطلاع دیتے ہیں۔

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
arxiv.org
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.21501
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

کمک سیکھنا
انعامی سگنلز کے ذریعے تربیت جہاں ایک ایجنٹ ایسے اعمال سیکھتا ہے جو طویل مدتی واپسی کو زیادہ سے زیادہ بناتے ہیں۔
بڑی زبان کا ماڈل (LLM)
متن کی تخلیق اور تجزیہ کرنے کے لیے بڑے پیمانے پر ٹیکسٹ کارپورا پر تربیت یافتہ زبان کا ماڈل۔
میموری (ایجنٹ میموری)
ذخیرہ شدہ سیاق و سباق ایک AI ایجنٹ تسلسل کو بہتر بنانے کے لیے تمام مراحل یا سیشنز میں استعمال کرتا ہے۔
اپنے آپ کو جانچیں۔AI ماڈلز نے کوئز کی وضاحت کی۔

کیا ہوا؟

محققین نے کمپیوٹیشن کنڈیشنڈ کریڈٹ ٹرانسپورٹ متعارف کرایا، ایک جواب کے دوران لینگویج ماڈل کے ذریعہ کی گئی کمپیوٹیشن کے مطابق انفرادی ٹوکنز کو کمک سیکھنے کا کریڈٹ تفویض کرنے کا ایک طریقہ۔ ان کا نفاذ، CompPO، فی ٹوکن ریٹینشن گیٹ بنانے کے لیے توجہ کے ارتکاز کا استعمال کرتا ہے اور اسے ایک نقاد کے ساتھ جوڑتا ہے جو اداکار کی پوشیدہ حالتوں اور روٹنگ کی معلومات کو دوبارہ استعمال کرتا ہے۔

21 اگست کو arXiv کو جمع کرایا گیا پری پرنٹ بڑے لینگویج ماڈلز کے لیے کمک سیکھنے کے دوران کریڈٹ تفویض کرنے کا ایک نیا طریقہ تجویز کرتا ہے۔ کاغذ کریڈٹ اسائنمنٹ کو تین حصوں میں الگ کرتا ہے: اس بات کا ثبوت کہ آیا رول آؤٹ کامیاب ہوا، ایک ٹرانسپورٹ آپریٹر جو اس ثبوت کو ٹوکن لیول کے فوائد میں تبدیل کرتا ہے، اور اپ ڈیٹ جیومیٹری جو ان فوائد کو پالیسی میں تبدیلیوں میں بدل دیتا ہے۔ مصنفین کا استدلال ہے کہ حالیہ کام نے پہلے اور تیسرے حصوں میں بہتری لائی ہے، جبکہ عام طور پر استعمال ہونے والے نقل و حمل کے اصول ماڈل فن تعمیر سے بڑی حد تک آزاد رہتے ہیں۔

مجوزہ فریم ورک، جسے کمپیوٹیشن کنڈیشنڈ کریڈٹ ٹرانسپورٹ کہا جاتا ہے، رویے کی پالیسی کے داخلی کمپیوٹیشن سے علیحدہ اعدادوشمار کا استعمال کرتا ہے تاکہ یہ پیرامیٹرائز کیا جا سکے کہ کس طرح نیچے کی قیمت کو رول آؤٹ کے ذریعے منتقل کیا جاتا ہے۔ کنکریٹ الگورتھم، CompPO، مقامی توجہ کے ارتکاز کو ہر ٹوکن کے لیے ایک باؤنڈڈ ریٹینشن گیٹ میں تبدیل کرتا ہے۔ اس گیٹ کو ایک قدمی بوٹسٹریپنگ کے لیے اور Comp-GAE نامی راستے پر منحصر عمومی فائدے کے ٹریس کے لیے استعمال کیا جاتا ہے۔ مصنفین کا کہنا ہے کہ ایک مستقل گیٹ طریقہ کو فکسڈ گتانک عمومی فائدہ کے تخمینہ تک کم کر دیتا ہے، ایک معیاری بیس لائن کا لنک فراہم کرتا ہے۔

CompPO میں ٹرانسپورٹ سے منسلک نقاد، یا TAC بھی شامل ہے۔ اسی پیمانے کا دوسرا ٹرانسفارمر شامل کرنے کے بجائے، TAC اداکار کی پوشیدہ حالتوں اور روٹنگ کی معلومات کو دوبارہ استعمال کرتا ہے۔ کاغذ کہتا ہے کہ ٹاسک ریوارڈ اور تراشے ہوئے PPO پالیسی کے مقصد میں کوئی تبدیلی نہیں ہوئی ہے۔ دعوی کردہ تبدیلی یہ ہے کہ کس طرح کریڈٹ منتقل کیا جاتا ہے اور نقاد کو اس نقل و حمل کے ساتھ کس طرح منسلک کیا جاتا ہے۔ پانچ Qwen3-4B بیجوں کا استعمال کرتے ہوئے، مصنفین نے GRPO کے لیے 52.9% سے 54.7% کے وقفے کے ساتھ، 53.8% کے مقابلے میں 60.8% سے 62.0% کے 95% اعتماد کے وقفے کے ساتھ، 61.4% فائنل ہولڈ آؤٹ درستگی کی اطلاع دی۔

کاغذ کے خاتمے کے نتائج نتائج کو اجزاء کے امتزاج سے منسوب کرتے ہیں۔ معیاری نقاد کے ساتھ جوڑ بنانے والا Comp-GAE 55.2% تک پہنچ گیا، جب کہ ایک مقررہ گیٹ کے ساتھ جوڑا بنایا گیا TAC 56.4% تک پہنچ گیا۔ نہ ہی پورے نظام سے مماثل ہے۔ مصنفین 1.9 سے 2.9 پوائنٹس کے 95% اعتماد کے وقفے کے ساتھ 2.4 پوائنٹس کے تعامل کے اثر کی اطلاع دیتے ہیں۔ شفل اور پوزیشن کنٹرول کو رفتار سے متعلق مخصوص سیدھ کی حمایت کرنے کی اطلاع دی گئی۔ CompPO 12 میں سے 10 PPO-گرڈ رنز میں مستحکم تھا، مقابلے سیٹ اپ کے لیے 12 میں سے 3 کے مقابلے میں۔ منجمد جائزوں پر، مصنفین بالترتیب Qwen3-4B اور Llama-3.1-8B-انسٹرکٹ پر GRPO 4.3 اور 3.9 لالچی پاس@1 میکرو پوائنٹس پر بہتری کی اطلاع دیتے ہیں۔

ماخذ کی تفصیلات: arxiv.org ↗

یہ کیوں اہمیت رکھتا ہے۔

نتیجہ بڑے زبان کے ماڈلز کے لیے کمک سیکھنے میں ایک عملی رکاوٹ کو دور کرتا ہے: یہ فیصلہ کرنا کہ طویل ردعمل کے کون سے حصے حتمی نتائج کے لیے کریڈٹ یا الزام کے مستحق ہیں۔ مصنفین ٹیونڈ GRPO پر بہتری کی اطلاع دیتے ہیں، لیکن شواہد پری پرنٹ اور تجربات کے ایک محدود سیٹ سے آتے ہیں، اس لیے طریقہ کار کی عمومیت اور آپریشنل لاگت غیر یقینی رہتی ہے۔

زبان کے ماڈلز کے لیے کمک سیکھنے کے لیے حتمی انعام کو بہت سے انفرادی ٹوکنز اور درمیانی فیصلوں سے جوڑنا چاہیے۔ ایک جواب مفید اور غیر مددگار اقدامات پر مشتمل ہو سکتا ہے، لیکن ایک طریقہ جو پورے جواب میں ایک ہی نتائج کے اعدادوشمار کو نشر کرتا ہے کمزور رہنمائی فراہم کر سکتا ہے۔ کاغذ کا مرکزی دعویٰ یہ ہے کہ ماڈل کی اپنی گنتی یہ فیصلہ کرنے کے لیے زیادہ مخصوص سگنل فراہم کر سکتی ہے کہ ایک ٹوکن سے دوسرے ٹوکن تک کریڈٹ کو کتنی مضبوطی سے برقرار رہنا چاہیے۔

اگر اطلاع شدہ اثر وسیع تر ترتیبات میں رکھتا ہے، تو فن تعمیر سے آگاہ کریڈٹ ٹرانسپورٹ کسی مختلف انعامی تعریف یا پالیسی مقصد کی ضرورت کے بغیر کمک سیکھنے کی اپ ڈیٹس کو مزید ہدف بنا سکتا ہے۔ یہ اہم ہے کیونکہ کریڈٹ اسائنمنٹ میں تبدیلیوں کو ممکنہ طور پر موجودہ PPO طرز کی ٹریننگ پائپ لائنوں میں شامل کیا جا سکتا ہے۔ GRPO کے ساتھ رپورٹ کردہ موازنہ خاص طور پر موجودہ LLM کمک سیکھنے کی مشق سے متعلق ہے کیونکہ یہ مجوزہ طریقہ کو تربیتی سگنل میں تبدیلی کے طور پر تیار کرتا ہے بجائے کسی نئے ماڈل فیملی یا صارف کا سامنا کرنے والے پروڈکٹ کے۔

رپورٹ کردہ ابلیشنز کارآمد ہیں کیونکہ وہ تجویز کرتے ہیں کہ نتیجہ کی وضاحت یا تو توجہ حاصل کرنے والے گیٹ یا دوبارہ استعمال شدہ نقاد کے ذریعے نہیں کی گئی ہے۔ مکمل طریقہ نے فراہم کردہ نتائج میں دونوں جزوی متغیرات سے بہتر کارکردگی کا مظاہرہ کیا، اور مصنفین کا کہنا ہے کہ شفل اور پوزیشن کنٹرول اس خیال کی حمایت کرتے ہیں کہ رفتار سے متعلق مخصوص صف بندی اہمیت رکھتی ہے۔ استحکام کا موازنہ ایک ممکنہ عملی فائدے کی طرف بھی اشارہ کرتا ہے: کم غیر مستحکم رنز تربیتی کوششوں کو کم کر سکتے ہیں، حالانکہ ماخذ حساب یا لاگت کی پیمائش فراہم نہیں کرتا ہے۔

شواہد کو اب بھی ابتدائی تحقیق کے نتیجے کے طور پر پڑھا جانا چاہیے۔ ماخذ ایک arXiv پری پرنٹ ہے، ہم مرتبہ نظرثانی شدہ اشاعت نہیں، اور خلاصہ بنیادی کاموں، ڈیٹاسیٹ کے سائز، بیس لائن پر عمل درآمد کی تفصیلات، تربیتی بجٹ، یا شماریاتی طریقہ کار کی اطلاع اعتماد کے وقفوں سے آگے کی وضاحت نہیں کرتا ہے۔ اس سے یہ بھی ثابت نہیں ہوتا کہ آیا فوائد اضافی میموری، تاخیر، انجینئرنگ کی پیچیدگی، یا توجہ کے نمونوں کی حساسیت کے ساتھ آتے ہیں۔ اس لیے طریقہ کار کا عوامی اثر اس بات پر منحصر ہے کہ آیا آزاد محققین نتائج کو دوبارہ پیش کر سکتے ہیں اور آیا نقطہ نظر بڑے ماڈلز اور متنوع کمک سیکھنے کے مقاصد میں منتقل ہوتا ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

آگے کیا دیکھنا ہے۔

اہم اگلے ٹیسٹ ہیں آزاد نقل، وسیع تر ماڈل اور ٹاسک کوریج، اور موازنہ جن میں تربیت کی لاگت، میموری کا استعمال، اور رن ٹائم شامل ہیں۔ ماخذ اس بات کا تعین نہیں کرتا ہے کہ آیا CompPO رپورٹ کردہ Qwen3-4B اور Llama-3.1-8B-انسٹرکٹ ایویلیویشنز سے آگے قابل اعتماد طریقے سے کام کرتا ہے یا آیا اس کا توجہ پر مبنی سگنل مختلف ماڈل آرکیٹیکچرز میں کارآمد رہتا ہے۔

پہلی ترجیح پانچ Qwen3-4B بیجوں اور اطلاع شدہ منجمد تشخیص سے آگے نقل ہے۔ آزاد گروپوں کو زیادہ ماڈل سائز، تربیتی کاموں، انعامی ڈھانچے، اور لینگویج ماڈل آرکیٹیکچرز پر طریقہ کی جانچ کرنی چاہیے۔ ماخذ کا نام Qwen3-4B اور Llama-3.1-8B-Instruct ہے، لیکن اس میں یہ نہیں کہا گیا ہے کہ آیا اس طریقہ کار کا اندازہ ماڈلز کی ایک وسیع رینج میں کیا گیا تھا یا آیا توجہ کا اشارہ مختلف روٹنگ یا توجہ کے ڈیزائن کے ساتھ فن تعمیر میں اسی طرح برتاؤ کرتا ہے۔

محققین کو مکمل تربیتی تجارت کی پیمائش بھی کرنی چاہیے۔ مقالے میں کہا گیا ہے کہ ٹی اے سی اداکار کی پوشیدہ حالتوں اور روٹنگ کی معلومات کو دوسرے ایک ہی پیمانے کے ٹرانسفارمر کے بغیر دوبارہ استعمال کرتا ہے، لیکن ماخذ میموری کی کھپت، وال کلاک ٹریننگ ٹائم، ہارڈ ویئر کی ضروریات، یا کل کمپیوٹ کی مقدار نہیں بتاتا۔ یہ پیمائشیں اس بات کا تعین کریں گی کہ آیا رپورٹ کردہ درستگی اور استحکام کے فوائد ان تنظیموں کے لیے عملی ہیں جو پہلے سے ہی مہنگی کمک سیکھنے والی پائپ لائنیں چلاتے ہیں۔

مزید کام کو جانچنا چاہئے کہ توجہ سے حاصل کردہ برقراری گیٹ کتنا مضبوط ہے۔ رپورٹ کردہ شفل اور پوزیشن کنٹرولز تجربات کے اندر رفتار سے متعلق مخصوص صف بندی کی حمایت کرتے ہیں، لیکن ماخذ یہ نہیں دکھاتا ہے کہ گیٹ لمبے سیاق و سباق، غیر معمولی استدلال کے نشانات، کم یا شور والے انعامات، یا اشارہ دینے اور نمونے لینے میں تبدیلیوں کا کیا جواب دیتا ہے۔ یہ بھی معلوم نہیں ہے کہ آیا توجہ کا ارتکاز کمپیوٹیشنل اہمیت کے لیے ایک قابل اعتماد پراکسی ہے یا مخصوص ماڈلز اور ٹیسٹ کیے گئے کاموں کے لیے محض ایک مفید سگنل ہے۔

آخر میں، ایک پری پرنٹ کے طور پر طریقہ کار کی حیثیت اہمیت رکھتی ہے۔ ذریعہ آزاد تصدیق، پیداوار کی تعیناتی، کوڈ کی دستیابی، یا ہم مرتبہ جائزہ کے نتائج کی اطلاع نہیں دیتا ہے۔ وہ کوتاہیاں نتائج کو باطل نہیں کرتی ہیں، لیکن وہ تولیدی صلاحیت اور عامیت کے بارے میں اہم سوالات کو جواب نہیں دیتے ہیں۔ ایک مضبوط کیس کے لیے جاری کردہ نفاذ کی تفصیلات، مماثل لاگت کی بنیادی خطوط، اضافی آرکیٹیکچرز کے نتائج، اور اس بات کا ثبوت درکار ہوگا کہ مصنفین کے تشخیصی سیٹ اپ سے باہر بہتری برقرار رہتی ہے۔

متعلقہ گائیڈز اور کوئزز

AI ماڈلز کی وضاحتاے آئی ٹریننگٹرانسفارمرزاے آئی کا مستقبلآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ماڈل ریلیز ٹریکر پر عمل کریں۔
یہ مفید پایا؟