کیا ہوا؟
محققین نے کمپیوٹیشن کنڈیشنڈ کریڈٹ ٹرانسپورٹ متعارف کرایا، ایک جواب کے دوران لینگویج ماڈل کے ذریعہ کی گئی کمپیوٹیشن کے مطابق انفرادی ٹوکنز کو کمک سیکھنے کا کریڈٹ تفویض کرنے کا ایک طریقہ۔ ان کا نفاذ، CompPO، فی ٹوکن ریٹینشن گیٹ بنانے کے لیے توجہ کے ارتکاز کا استعمال کرتا ہے اور اسے ایک نقاد کے ساتھ جوڑتا ہے جو اداکار کی پوشیدہ حالتوں اور روٹنگ کی معلومات کو دوبارہ استعمال کرتا ہے۔
21 اگست کو arXiv کو جمع کرایا گیا پری پرنٹ بڑے لینگویج ماڈلز کے لیے کمک سیکھنے کے دوران کریڈٹ تفویض کرنے کا ایک نیا طریقہ تجویز کرتا ہے۔ کاغذ کریڈٹ اسائنمنٹ کو تین حصوں میں الگ کرتا ہے: اس بات کا ثبوت کہ آیا رول آؤٹ کامیاب ہوا، ایک ٹرانسپورٹ آپریٹر جو اس ثبوت کو ٹوکن لیول کے فوائد میں تبدیل کرتا ہے، اور اپ ڈیٹ جیومیٹری جو ان فوائد کو پالیسی میں تبدیلیوں میں بدل دیتا ہے۔ مصنفین کا استدلال ہے کہ حالیہ کام نے پہلے اور تیسرے حصوں میں بہتری لائی ہے، جبکہ عام طور پر استعمال ہونے والے نقل و حمل کے اصول ماڈل فن تعمیر سے بڑی حد تک آزاد رہتے ہیں۔
مجوزہ فریم ورک، جسے کمپیوٹیشن کنڈیشنڈ کریڈٹ ٹرانسپورٹ کہا جاتا ہے، رویے کی پالیسی کے داخلی کمپیوٹیشن سے علیحدہ اعدادوشمار کا استعمال کرتا ہے تاکہ یہ پیرامیٹرائز کیا جا سکے کہ کس طرح نیچے کی قیمت کو رول آؤٹ کے ذریعے منتقل کیا جاتا ہے۔ کنکریٹ الگورتھم، CompPO، مقامی توجہ کے ارتکاز کو ہر ٹوکن کے لیے ایک باؤنڈڈ ریٹینشن گیٹ میں تبدیل کرتا ہے۔ اس گیٹ کو ایک قدمی بوٹسٹریپنگ کے لیے اور Comp-GAE نامی راستے پر منحصر عمومی فائدے کے ٹریس کے لیے استعمال کیا جاتا ہے۔ مصنفین کا کہنا ہے کہ ایک مستقل گیٹ طریقہ کو فکسڈ گتانک عمومی فائدہ کے تخمینہ تک کم کر دیتا ہے، ایک معیاری بیس لائن کا لنک فراہم کرتا ہے۔
CompPO میں ٹرانسپورٹ سے منسلک نقاد، یا TAC بھی شامل ہے۔ اسی پیمانے کا دوسرا ٹرانسفارمر شامل کرنے کے بجائے، TAC اداکار کی پوشیدہ حالتوں اور روٹنگ کی معلومات کو دوبارہ استعمال کرتا ہے۔ کاغذ کہتا ہے کہ ٹاسک ریوارڈ اور تراشے ہوئے PPO پالیسی کے مقصد میں کوئی تبدیلی نہیں ہوئی ہے۔ دعوی کردہ تبدیلی یہ ہے کہ کس طرح کریڈٹ منتقل کیا جاتا ہے اور نقاد کو اس نقل و حمل کے ساتھ کس طرح منسلک کیا جاتا ہے۔ پانچ Qwen3-4B بیجوں کا استعمال کرتے ہوئے، مصنفین نے GRPO کے لیے 52.9% سے 54.7% کے وقفے کے ساتھ، 53.8% کے مقابلے میں 60.8% سے 62.0% کے 95% اعتماد کے وقفے کے ساتھ، 61.4% فائنل ہولڈ آؤٹ درستگی کی اطلاع دی۔
کاغذ کے خاتمے کے نتائج نتائج کو اجزاء کے امتزاج سے منسوب کرتے ہیں۔ معیاری نقاد کے ساتھ جوڑ بنانے والا Comp-GAE 55.2% تک پہنچ گیا، جب کہ ایک مقررہ گیٹ کے ساتھ جوڑا بنایا گیا TAC 56.4% تک پہنچ گیا۔ نہ ہی پورے نظام سے مماثل ہے۔ مصنفین 1.9 سے 2.9 پوائنٹس کے 95% اعتماد کے وقفے کے ساتھ 2.4 پوائنٹس کے تعامل کے اثر کی اطلاع دیتے ہیں۔ شفل اور پوزیشن کنٹرول کو رفتار سے متعلق مخصوص سیدھ کی حمایت کرنے کی اطلاع دی گئی۔ CompPO 12 میں سے 10 PPO-گرڈ رنز میں مستحکم تھا، مقابلے سیٹ اپ کے لیے 12 میں سے 3 کے مقابلے میں۔ منجمد جائزوں پر، مصنفین بالترتیب Qwen3-4B اور Llama-3.1-8B-انسٹرکٹ پر GRPO 4.3 اور 3.9 لالچی پاس@1 میکرو پوائنٹس پر بہتری کی اطلاع دیتے ہیں۔
یہ کیوں اہمیت رکھتا ہے۔
نتیجہ بڑے زبان کے ماڈلز کے لیے کمک سیکھنے میں ایک عملی رکاوٹ کو دور کرتا ہے: یہ فیصلہ کرنا کہ طویل ردعمل کے کون سے حصے حتمی نتائج کے لیے کریڈٹ یا الزام کے مستحق ہیں۔ مصنفین ٹیونڈ GRPO پر بہتری کی اطلاع دیتے ہیں، لیکن شواہد پری پرنٹ اور تجربات کے ایک محدود سیٹ سے آتے ہیں، اس لیے طریقہ کار کی عمومیت اور آپریشنل لاگت غیر یقینی رہتی ہے۔
زبان کے ماڈلز کے لیے کمک سیکھنے کے لیے حتمی انعام کو بہت سے انفرادی ٹوکنز اور درمیانی فیصلوں سے جوڑنا چاہیے۔ ایک جواب مفید اور غیر مددگار اقدامات پر مشتمل ہو سکتا ہے، لیکن ایک طریقہ جو پورے جواب میں ایک ہی نتائج کے اعدادوشمار کو نشر کرتا ہے کمزور رہنمائی فراہم کر سکتا ہے۔ کاغذ کا مرکزی دعویٰ یہ ہے کہ ماڈل کی اپنی گنتی یہ فیصلہ کرنے کے لیے زیادہ مخصوص سگنل فراہم کر سکتی ہے کہ ایک ٹوکن سے دوسرے ٹوکن تک کریڈٹ کو کتنی مضبوطی سے برقرار رہنا چاہیے۔
اگر اطلاع شدہ اثر وسیع تر ترتیبات میں رکھتا ہے، تو فن تعمیر سے آگاہ کریڈٹ ٹرانسپورٹ کسی مختلف انعامی تعریف یا پالیسی مقصد کی ضرورت کے بغیر کمک سیکھنے کی اپ ڈیٹس کو مزید ہدف بنا سکتا ہے۔ یہ اہم ہے کیونکہ کریڈٹ اسائنمنٹ میں تبدیلیوں کو ممکنہ طور پر موجودہ PPO طرز کی ٹریننگ پائپ لائنوں میں شامل کیا جا سکتا ہے۔ GRPO کے ساتھ رپورٹ کردہ موازنہ خاص طور پر موجودہ LLM کمک سیکھنے کی مشق سے متعلق ہے کیونکہ یہ مجوزہ طریقہ کو تربیتی سگنل میں تبدیلی کے طور پر تیار کرتا ہے بجائے کسی نئے ماڈل فیملی یا صارف کا سامنا کرنے والے پروڈکٹ کے۔
رپورٹ کردہ ابلیشنز کارآمد ہیں کیونکہ وہ تجویز کرتے ہیں کہ نتیجہ کی وضاحت یا تو توجہ حاصل کرنے والے گیٹ یا دوبارہ استعمال شدہ نقاد کے ذریعے نہیں کی گئی ہے۔ مکمل طریقہ نے فراہم کردہ نتائج میں دونوں جزوی متغیرات سے بہتر کارکردگی کا مظاہرہ کیا، اور مصنفین کا کہنا ہے کہ شفل اور پوزیشن کنٹرول اس خیال کی حمایت کرتے ہیں کہ رفتار سے متعلق مخصوص صف بندی اہمیت رکھتی ہے۔ استحکام کا موازنہ ایک ممکنہ عملی فائدے کی طرف بھی اشارہ کرتا ہے: کم غیر مستحکم رنز تربیتی کوششوں کو کم کر سکتے ہیں، حالانکہ ماخذ حساب یا لاگت کی پیمائش فراہم نہیں کرتا ہے۔
شواہد کو اب بھی ابتدائی تحقیق کے نتیجے کے طور پر پڑھا جانا چاہیے۔ ماخذ ایک arXiv پری پرنٹ ہے، ہم مرتبہ نظرثانی شدہ اشاعت نہیں، اور خلاصہ بنیادی کاموں، ڈیٹاسیٹ کے سائز، بیس لائن پر عمل درآمد کی تفصیلات، تربیتی بجٹ، یا شماریاتی طریقہ کار کی اطلاع اعتماد کے وقفوں سے آگے کی وضاحت نہیں کرتا ہے۔ اس سے یہ بھی ثابت نہیں ہوتا کہ آیا فوائد اضافی میموری، تاخیر، انجینئرنگ کی پیچیدگی، یا توجہ کے نمونوں کی حساسیت کے ساتھ آتے ہیں۔ اس لیے طریقہ کار کا عوامی اثر اس بات پر منحصر ہے کہ آیا آزاد محققین نتائج کو دوبارہ پیش کر سکتے ہیں اور آیا نقطہ نظر بڑے ماڈلز اور متنوع کمک سیکھنے کے مقاصد میں منتقل ہوتا ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
اہم اگلے ٹیسٹ ہیں آزاد نقل، وسیع تر ماڈل اور ٹاسک کوریج، اور موازنہ جن میں تربیت کی لاگت، میموری کا استعمال، اور رن ٹائم شامل ہیں۔ ماخذ اس بات کا تعین نہیں کرتا ہے کہ آیا CompPO رپورٹ کردہ Qwen3-4B اور Llama-3.1-8B-انسٹرکٹ ایویلیویشنز سے آگے قابل اعتماد طریقے سے کام کرتا ہے یا آیا اس کا توجہ پر مبنی سگنل مختلف ماڈل آرکیٹیکچرز میں کارآمد رہتا ہے۔
پہلی ترجیح پانچ Qwen3-4B بیجوں اور اطلاع شدہ منجمد تشخیص سے آگے نقل ہے۔ آزاد گروپوں کو زیادہ ماڈل سائز، تربیتی کاموں، انعامی ڈھانچے، اور لینگویج ماڈل آرکیٹیکچرز پر طریقہ کی جانچ کرنی چاہیے۔ ماخذ کا نام Qwen3-4B اور Llama-3.1-8B-Instruct ہے، لیکن اس میں یہ نہیں کہا گیا ہے کہ آیا اس طریقہ کار کا اندازہ ماڈلز کی ایک وسیع رینج میں کیا گیا تھا یا آیا توجہ کا اشارہ مختلف روٹنگ یا توجہ کے ڈیزائن کے ساتھ فن تعمیر میں اسی طرح برتاؤ کرتا ہے۔
محققین کو مکمل تربیتی تجارت کی پیمائش بھی کرنی چاہیے۔ مقالے میں کہا گیا ہے کہ ٹی اے سی اداکار کی پوشیدہ حالتوں اور روٹنگ کی معلومات کو دوسرے ایک ہی پیمانے کے ٹرانسفارمر کے بغیر دوبارہ استعمال کرتا ہے، لیکن ماخذ میموری کی کھپت، وال کلاک ٹریننگ ٹائم، ہارڈ ویئر کی ضروریات، یا کل کمپیوٹ کی مقدار نہیں بتاتا۔ یہ پیمائشیں اس بات کا تعین کریں گی کہ آیا رپورٹ کردہ درستگی اور استحکام کے فوائد ان تنظیموں کے لیے عملی ہیں جو پہلے سے ہی مہنگی کمک سیکھنے والی پائپ لائنیں چلاتے ہیں۔
مزید کام کو جانچنا چاہئے کہ توجہ سے حاصل کردہ برقراری گیٹ کتنا مضبوط ہے۔ رپورٹ کردہ شفل اور پوزیشن کنٹرولز تجربات کے اندر رفتار سے متعلق مخصوص صف بندی کی حمایت کرتے ہیں، لیکن ماخذ یہ نہیں دکھاتا ہے کہ گیٹ لمبے سیاق و سباق، غیر معمولی استدلال کے نشانات، کم یا شور والے انعامات، یا اشارہ دینے اور نمونے لینے میں تبدیلیوں کا کیا جواب دیتا ہے۔ یہ بھی معلوم نہیں ہے کہ آیا توجہ کا ارتکاز کمپیوٹیشنل اہمیت کے لیے ایک قابل اعتماد پراکسی ہے یا مخصوص ماڈلز اور ٹیسٹ کیے گئے کاموں کے لیے محض ایک مفید سگنل ہے۔
آخر میں، ایک پری پرنٹ کے طور پر طریقہ کار کی حیثیت اہمیت رکھتی ہے۔ ذریعہ آزاد تصدیق، پیداوار کی تعیناتی، کوڈ کی دستیابی، یا ہم مرتبہ جائزہ کے نتائج کی اطلاع نہیں دیتا ہے۔ وہ کوتاہیاں نتائج کو باطل نہیں کرتی ہیں، لیکن وہ تولیدی صلاحیت اور عامیت کے بارے میں اہم سوالات کو جواب نہیں دیتے ہیں۔ ایک مضبوط کیس کے لیے جاری کردہ نفاذ کی تفصیلات، مماثل لاگت کی بنیادی خطوط، اضافی آرکیٹیکچرز کے نتائج، اور اس بات کا ثبوت درکار ہوگا کہ مصنفین کے تشخیصی سیٹ اپ سے باہر بہتری برقرار رہتی ہے۔