کیا ہوا؟
محققین نے RecurSE متعارف کرایا، جو کہ کمک سیکھنے کے انعام میں بیرونی سونے کی نگرانی کے بغیر LLM-بطور جج سسٹمز کو بار بار بہتر بنانے کا طریقہ ہے۔ طریقہ کار کو محدود کرنے اور جانچنے کے لیے قابل تربیت جج، ایک مطابقت پذیر چیکر اور ایک توثیق مانیٹر کا استعمال کرتا ہے۔
یہ مقالہ RecurSE کو پیش کرتا ہے، جو Recursive Self-Evaluation کے لیے مختصر ہے، LLM-بطور جج سسٹمز کے لیے بار بار خود کو بہتر بنانے کی ایک پابند شکل کے طور پر۔ یہ سسٹم اوپن اینڈڈ ٹیکسٹ کا جائزہ لیتے ہیں، جیسے کہ امیدواروں کے جوابات، روبرکس کے خلاف اور تربیت کے بعد کو چلانے میں بھی مدد کر سکتے ہیں۔ محققین نے مرکزی مسئلہ کو بطور بیرونی گولڈ لیبلز، ریوارڈ ماڈلز یا کسی مضبوط استاد سے کشید کیے بغیر خود ہی جج کو بہتر بنانا ہے۔ ان کا مجوزہ ٹریننگ لوپ اصلاح کے لیے سیکھنے کے اشارے پیدا کرنے کے لیے ماڈل کی اپنی تشخیصی صلاحیت کا استعمال کرتا ہے۔ ماخذ اسے ایک بند لوپ اپروچ کے طور پر بیان کرتا ہے، لیکن یہ دعویٰ نہیں کرتا کہ ماڈل تشخیصی ڈھانچے یا نگرانی کے بغیر بہتر ہوتا ہے۔ طریقہ کار میں روبرکس، ایک چیکر اور ایک توثیق کا طریقہ کار شامل ہے۔
مجوزہ نظام کے دو پاس ہیں۔ پاس 1 میں، ایک قابل تربیت جج امیدواروں کے جوابات کا فی قاعدہ کے تحت جائزہ لیتا ہے اور فیصلہ دیتا ہے۔ پاس 2 میں، ایک مطابقت پذیر پالیسی کاپی چیکر میٹا روبرکس کے خلاف جج کے استدلال کا آڈٹ کرتا ہے اور اسکیلر پراسیس کا انعام فراہم کرتا ہے۔ محققین ناکامی کے موڈ کی نشاندہی کرتے ہیں جس میں جج اپنے انعام کو بڑھانے کے لیے اپنے فیصلے کے ٹوکن کو کاپی کر سکتا ہے یا اس کا استحصال کر سکتا ہے۔ اس خطرے سے نمٹنے کے لیے، RecurSE انٹرفیس ڈیکپلنگ کا استعمال کرتا ہے: چیکر کے اسکیلر اسکور کو جج کے فیصلے کے ٹوکنز سے الگ کر دیا جاتا ہے۔ اس کا مقصد ایک انحطاط پذیر ٹوکن کاپی کرنے والے شارٹ کٹ کو ہٹانا اور خود تیار کردہ انعام کو زیادہ معنی خیز بنانا ہے۔ مقالہ یہ بھی استدلال کرتا ہے کہ بیرونی اینکر کے بغیر تکراری سیکھنا فطری طور پر پابند ہے۔ یہ پیئر وائز ایڈوانٹیج ویلیڈیٹی، یا پی اے وی کو ایک توثیق مانیٹر کے طور پر متعارف کرایا ہے جو مشترکہ طور پر جج کی درستگی اور چیکر مخلصی کو ٹریک کرتا ہے۔ بیان کردہ مقصد ایک بہترین ابتدائی رکنے والی ونڈو کی نشاندہی کرنا ہے، بجائے اس کے کہ اسے غیر معینہ مدت تک جاری رکھا جائے۔
خلاصہ تجربات کی رپورٹ کرتا ہے جس میں Qwen3.5-9B، Gemma-4-E4B-it اور Qwen3.6-27B شامل ہیں۔ اس کا کہنا ہے کہ اس طریقہ کار نے ہولڈ آؤٹ میڈیکل، جوڑے کے لحاظ سے، خلاصہ اور پیشہ ورانہ بینچ مارکس پر مستقل عام کرنے کے فوائد پیدا کیے، اور یہ کہ خاتمے کے مطالعے نے ہم آہنگ جج-چیککر کو-ایوولوشن کو منجمد چیکرز، بیرونی میٹا ججز، خود مستقل مزاجی اور اسکیلڈ ٹیچر ڈسٹلیشن سے زیادہ مضبوط پایا۔ ذریعہ فراہم کردہ متن میں ان فوائد کا عددی سائز نہیں دیتا ہے۔ محققین مزید رپورٹ کرتے ہیں کہ ان کے جج کے ذریعہ تیار کردہ ترجیحی جوڑوں نے بہاو پالیسی کی صف بندی کو بہتر کیا۔ یہ طریقہ کار کو جوابات کا جائزہ لینے سے آگے بڑھاتا ہے: جج کے نتائج کسی اور پالیسی کو سیدھ میں لانے کے لیے مفید تربیتی ڈیٹا کے طور پر پیش کیے جاتے ہیں۔ مقالے کا مشروط نتیجہ یہ ہے کہ LLM ججوں کے لیے باؤنڈڈ بار بار خود کو بہتر بنانا اس وقت قابل عمل ہے جب خود تیار کردہ انعامات کی درستگی کو واضح طور پر الگ کر دیا جائے اور اس کی نگرانی کی جائے۔ ہم مرتبہ جائزہ شدہ اشاعت کے بجائے ایک arXiv جمع کرانے کے طور پر، دعوے مصنفین کے رپورٹ کردہ نتائج اور تجویز ہیں، آزادانہ طور پر قائم کردہ نتائج نہیں۔
یہ کیوں اہمیت رکھتا ہے۔
LLM ججوں کو کھلے عام جوابات کا جائزہ لینے اور ماڈل پوسٹ ٹریننگ کی رہنمائی کے لیے تیزی سے استعمال کیا جاتا ہے، لیکن ان ججوں کو بہتر بنانے کے لیے مہنگے انسانی تشریحات یا مضبوط اساتذہ کے ماڈلز کی ضرورت پڑ سکتی ہے۔ RecurSE ایک ممکنہ کم نگرانی کا راستہ پیش کرتا ہے، جبکہ یہ بھی واضح کرتا ہے کہ خود کو بہتر بنانے کے لیے سرکلر یا گمراہ کن انعامات کے خلاف حفاظتی اقدامات کی ضرورت کیوں ہے۔
کام کی اہمیت ماڈل کی تشخیص کی لاگت اور پیمانے میں ہے۔ انسانی جائزہ لینے والے مہنگے اور سست ہو سکتے ہیں، جب کہ مضبوط ٹیچر ماڈل یا الگ سے تربیت یافتہ انعامی ماڈل انفراسٹرکچر اور انحصار کو بڑھاتے ہیں۔ اگر کوئی ماڈل تشخیص کار کو بہتر بنانے کے لیے مفید سیکھنے کے اشارے پیدا کر سکتا ہے، تو ڈویلپر ممکنہ طور پر کم بیرونی تشریح کے ساتھ تشخیص یا پوسٹ ٹریننگ ورک فلو کو بڑھا سکتے ہیں۔ ماخذ صرف اس تنگ دعوے کی حمایت کرتا ہے کہ مصنفین نے طریقہ کار کا تجربہ کیا اور منتخب ترتیبات میں فوائد کی اطلاع دی۔ اس سے یہ ثابت نہیں ہوتا کہ بیرونی نگرانی کو عام طور پر ختم کیا جا سکتا ہے یا یہ کہ RecurSE ہر تعیناتی میں سستا ہے۔ مقالہ AI تشخیص میں مرکزی اعتبار کے مسئلے کو بھی حل کرتا ہے: ایک نظام بہتر ہوتا دکھائی دے سکتا ہے کیونکہ اس نے بہتر فیصلے کرنے کے بجائے اپنے تشخیص کار کو مطمئن کرنا سیکھ لیا ہے۔
چیکر کے اسکیلر انعام اور جج کے فیصلے کے ٹوکن کے درمیان مجوزہ علیحدگی کو ایک مخصوص شارٹ کٹ کو کم کرنے کے لیے ڈیزائن کیا گیا ہے۔ PAV مانیٹر کا مقصد اس بات کی نشاندہی کرنا ہے کہ جب دوبارہ چلنے والی تربیت خود کو تقویت دینے کی بجائے درست تشخیص کو بہتر بنا رہی ہے۔ یہ کام کو نہ صرف کارکردگی بلکہ ماڈل ڈیولپمنٹ میں استعمال ہونے والے خودکار جائزوں کی ساکھ سے بھی متعلقہ بناتا ہے۔ رپورٹ کردہ بینچ مارک کوریج ایک تنگ ٹیسٹ کے بجائے طبی، جوڑے کے لحاظ سے، خلاصہ اور پیشہ ورانہ کاموں پر محیط ہے۔ ہولڈ آؤٹ تشخیص، جیسا کہ خلاصہ میں بیان کیا گیا ہے، اس کا مقصد یہ بتانا ہے کہ آیا یہ طریقہ تربیت کے دوران استعمال ہونے والی مثالوں سے ہٹ کر عام ہے۔ پھر بھی، ماخذ ان ڈیٹاسیٹس کی تعمیر، تشخیص کے معیار، بنیادی اقدار، ٹیسٹ سیٹ کے سائز یا بہتری کی شدت اور تغیر کے بارے میں یہاں کوئی تفصیلات فراہم نہیں کرتا ہے۔ ان تفصیلات کے بغیر، قارئین اس بات کا تعین نہیں کر سکتے کہ رپورٹ شدہ فوائد کتنے بڑے، مضبوط یا عملی طور پر اہم ہیں۔
نیچے دھارے کی صف بندی کے دعوے سے فرق پڑ سکتا ہے اگر جج کی طرف سے تیار کردہ ترجیحی جوڑے تربیتی ڈیٹا تیار کرنے میں شامل محنت کو کم کرتے ہیں۔ اس کے باوجود ایک جج جو اپنے روبرک سے مماثلت میں بہتری لاتا ہے وہ خود بخود ایسا جج نہیں ہے جو انسانی ترجیحات، ڈومین کے معیارات یا حفاظتی تقاضوں کو پورا کرتا ہے۔ ماخذ کا کہنا ہے کہ ترجیحی جوڑوں نے بہاو پالیسی سیدھ میں اضافہ کیا، لیکن اس میں یہ واضح نہیں ہے کہ کس کی ترجیحات نے صف بندی کی تعریف کی، سیدھ کی پیمائش کیسے کی گئی یا انسانی جائزہ لینے والوں نے نتیجے میں ہونے والی تبدیلیوں کی تصدیق کی۔ حساس یا زیادہ اثر والے ایپلی کیشنز میں طریقہ کار پر غور کرنے والے ہر فرد کے لیے یہ امتیاز اہم ہے۔ مزید وسیع طور پر، RecurSE خود کو بہتر بنانے کی حدود کی ایک ٹھوس مثال پیش کرتا ہے۔ اس کا ڈیزائن فرض کرتا ہے کہ خود تیار کردہ انعامات کو ساختی علیحدگی اور نگرانی کے ذریعے مفید بنایا جا سکتا ہے۔ یہ روبرکس، میٹا روبرکس یا توثیق کے اہداف کی وضاحت کرنے کی ضرورت کو دور نہیں کرتا ہے۔ اس لیے شراکت کو LLM تشخیص کاروں کے ایک مخصوص طبقے کے لیے مجوزہ تربیت اور کنٹرول فریم ورک کے طور پر سب سے بہتر سمجھا جاتا ہے۔ عوامی قدر کا انحصار اس بات پر ہوگا کہ آیا بعد میں کام اس بات کی تصدیق کرتا ہے کہ ماڈلز، کاموں، روبرکس یا ترغیبات تبدیل ہونے پر اس کے تحفظات موثر رہتے ہیں۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
ماخذ متعدد ماڈلز اور بینچ مارک اقسام میں حاصلات کی اطلاع دیتا ہے لیکن خلاصہ میں اثر کے سائز، ڈیٹاسیٹ کے سائز، شماریاتی اہمیت یا آزاد نقل کی تفصیلات فراہم نہیں کرتا ہے۔ مزید جانچ پڑتال میں یہ جانچنا چاہئے کہ آیا یہ طریقہ رپورٹ شدہ ترتیبات کے باہر قابل اعتماد رہتا ہے اور آیا اس کا روکنے والا مانیٹر گمراہ کن خود کو بہتر بنانے کا پتہ لگا سکتا ہے۔
پہلا سوال یہ ہے کہ کیا اطلاع دی گئی بہتری آزادانہ نقل میں زندہ رہتی ہے۔ فراہم کردہ ذریعہ تین ماڈل فیملیز یا ورژنز اور کئی بینچ مارک زمروں کی نشاندہی کرتا ہے، لیکن یہ کاموں کی تعداد، بے ترتیب بیج، تربیتی رنز یا شماریاتی ٹیسٹ نہیں بتاتا ہے۔ مستقبل کے جائزوں کو ان تفصیلات کی اطلاع دینی چاہیے اور مماثل کمپیوٹ، ڈیٹا اور تربیت کے حالات کے تحت انہی بنیادی خطوط سے RecurSE کا موازنہ کرنا چاہیے۔ اس سے یہ واضح ہو جائے گا کہ آیا فائدہ خود تکراری ڈیزائن، اضافی اصلاح، بینچ مارک کے مخصوص انتخاب یا تجرباتی سیٹ اپ میں دیگر اختلافات سے حاصل ہوتا ہے۔
دوسرا مسئلہ یہ ہے کہ کیا PAV قابل اعتماد طریقے سے اس نقطہ کی نشاندہی کر سکتا ہے جس پر خود کی بہتری کو روکنا چاہیے۔ خلاصہ PAV کو ایک غیرجانبدار توثیق مانیٹر کے طور پر بیان کرتا ہے جو مشترکہ طور پر جج کی درستگی اور چیکر فیڈیلیٹی کو ٹریک کرتا ہے، لیکن یہ مانیٹر کی تعمیر کی وضاحت نہیں کرتا یا اس کے انشانکن کا ثبوت فراہم نہیں کرتا ہے۔ محققین اور صارفین کو ایسے معاملات کا جائزہ لینا چاہئے جہاں جج اور چیکر غلط وجوہات کی بناء پر متفق ہوں، جہاں دونوں کو ایک ہی نابینا جگہ ملے یا جہاں انسانی متعلقہ معیار کو گراتے ہوئے روبرک پر کارکردگی بہتر ہو۔ اس طرح کے ٹیسٹ اس بات کی جانچ کریں گے کہ آیا مجوزہ روکنے کا اصول اندرونی مستقل مزاجی کے بجائے حقیقی پیش رفت کا پتہ لگاتا ہے۔
روبرکس اور میٹا روبرکس پر طریقہ کار کا انحصار بھی توجہ کا مستحق ہے۔ ماخذ کا کہنا ہے کہ جج فی قاعدہ روبرکس کے تحت جوابات کا جائزہ لیتا ہے اور چیکر میٹا روبرکس کے خلاف استدلال کا آڈٹ کرتا ہے، لیکن اس میں یہ نہیں بتایا گیا کہ یہ روبرکس کس طرح تصنیف، اپ ڈیٹ یا ابہام سے محفوظ ہیں۔ ناقص طور پر متعین کردہ قواعد تکراری لوپ کو ایک مستحکم لیکن ناپسندیدہ ہدف دے سکتے ہیں۔ مستقبل کے کام کو متضاد معیارات، نامکمل ہدایات، مخالفانہ ردعمل اور ڈومینز کی جانچ کرنی چاہیے جن میں درستگی کو تحریری روبرک تک کم کرنا مشکل ہے، بشمول رپورٹ شدہ طبی اور پیشہ ورانہ ترتیبات۔
جج کیوریٹڈ ترجیحی جوڑوں کا بہاو استعمال تصدیق کے لیے ایک اور شعبہ ہے۔ ماخذ نے پالیسی کی صف بندی میں بہتری کی اطلاع دی ہے، لیکن بامعنی تعیناتی کے لیے ترجیحی معیار، انسانی تشخیص کاروں کے ساتھ اختلاف اور کیوریشن کے عمل کے ذریعے متعارف کردہ ناکامیوں کے بارے میں ثبوت درکار ہوں گے۔ یہ نامعلوم ہے کہ آیا نقطہ نظر ماڈل کے سائز، زبانوں، ڈومینز اور تشخیصی مقاصد میں منتقل ہوتا ہے، یا جب جج کو غیر مانوس کاموں کا سامنا ہوتا ہے تو چیکر کی وفاداری گر جاتی ہے۔ وہ نامعلوم اس بات کو محدود کرتے ہیں کہ خلاصہ کے نتائج کو کس حد تک وسیع پیمانے پر لاگو کیا جانا چاہئے۔
آخر میں، کاغذ 25 اگست 2026 کو جمع کرایا گیا ایک arXiv پری پرنٹ ہے، اور فراہم کردہ ماخذ میں صرف خلاصہ اور کتابیات کا صفحہ ہے۔ مکمل کاغذ میں لاپتہ تجرباتی تفصیلات شامل ہوسکتی ہیں، لیکن انہیں یہاں فرض نہیں کیا جاسکتا۔ قارئین کو مکمل طریقہ کار، جاری کردہ کوڈ یا ڈیٹا، اخراج کے نتائج، غلطی کے تجزیے اور آزادانہ فالو اپ اسٹڈیز کو تلاش کرنا چاہیے۔ اس وقت تک، RecurSE ایک مخصوص تحقیقی سمت اور مصنفین کی امید افزا نتائج کی رپورٹ کا ثبوت ہے، نہ کہ اس بات کا ثبوت کہ LLM ججز محفوظ طریقے سے یا قابل اعتماد طریقے سے خود کو عام طور پر بہتر بنا سکتے ہیں۔