کیا ہوا؟
ایک arXiv پری پرنٹ سٹوچاسٹک اسٹوڈنٹ نالج گرافس، یا SSKGs متعارف کرایا جاتا ہے، تاکہ بڑے لینگوئج ماڈلز کو الجبرا میں مہارت کی مختلف سطحوں کے ساتھ طالب علموں کو زیادہ مستقل طور پر نقل کیا جا سکے۔ مصنفین کا کہنا ہے کہ عام پرامپٹ پر مبنی سمولیشنز نے تین ٹیسٹ شدہ LLMs کو تقریباً تمام سوالات کے صحیح جواب دینے کی اجازت دی، قطع نظر اس کے کہ طالب علم کی ہدایت کی گئی پروفائل سے قطع نظر۔
21 اگست 2026 کو arXiv کو جمع کرایا گیا مقالہ اس بات کا مطالعہ کرتا ہے کہ زبان کے بڑے ماڈل کس طرح مختلف مہارت کی سطحوں پر طلباء کی نمائندگی کر سکتے ہیں۔ مصنفین کا کہنا ہے کہ یہ نقلی مصنوعی تربیتی ڈیٹا بنانے اور تناؤ کے ٹیسٹ ٹیوشن سسٹم کے لیے تیزی سے استعمال ہو رہے ہیں۔ ان کی تشویش یہ ہے کہ صرف فوری ہدایات جیسے ماڈل کو ایک کم مہارت والے طالب علم کی طرح برتاؤ کرنے کے لیے کہنا قابل اعتماد طریقے سے تبدیل نہیں کر سکتا ہے کہ ماڈل کس طرح کسی مسئلے کو حل کرتا ہے، کیونکہ بنیادی ماڈل اپنی مسئلہ حل کرنے کی صلاحیت کو برقرار رکھتا ہے۔
مصنفین نے تین فروخت کنندگان سے تین ماڈلز کی جانچ کی اطلاع دی ہے — Gemini 3.1 Flash Lite, Claude Haiku 4.5 اور GPT-5.4-mini — 379 کالج بورڈ کی طرف سے کیلیبریٹڈ SAT الجبرا آئٹمز پر۔ انہوں نے پانچ آثار قدیمہ کی مہارت کے پروفائلز کا استعمال کیا۔ خلاصہ کے مطابق، پرامپٹ پر مبنی سیٹ اپ میں، ماڈلز نے تمام پروفائلز میں 96.8% اور 100% کے درمیان درستگی حاصل کی۔ اس نتیجہ کو ثبوت کے طور پر پیش کیا گیا ہے کہ اشارے نے اعلی مہارت اور کم مہارت والے سلوک کو مناسب طور پر الگ نہیں کیا۔
SSKG کا مجوزہ طریقہ ایک کھلی الجبرا کی نصابی کتاب سے نکالے گئے نصاب کے علمی گراف سے شروع ہوتا ہے۔ مصنفین ہر SAT محلول کو مطلوبہ ٹرپلز کی ایک زنجیر میں تحلیل کرتے ہیں، پھر ہر ٹرپل کو مہارت کا امکان تفویض کرتے ہیں۔ سسٹم ان امکانات کا نمونہ بناتا ہے تاکہ یہ تعین کیا جا سکے کہ آیا نقلی طالب علم صحیح جواب دیتا ہے۔ اس نتیجہ کے منتخب ہونے کے بعد، ایک LLM پہلے فرد کی عقلیت پیدا کرتا ہے جس کا مقصد نتیجہ کے ساتھ مطابقت رکھتا ہے۔
اس طریقہ کار کا استعمال کرتے ہوئے، مصنفین نے رپورٹ کیا ہے کہ تمام ماسٹری پروفائلز میں نقلی درستگی 44.1% اور 85.2% کے درمیان رہ گئی ہے اور یہ کہ نتائج نے ایک واضح یکجہتی مہارت کا میلان دکھایا ہے۔ دوسرے لفظوں میں، رپورٹ شدہ نتائج متوقع سمت میں مزید الگ ہو گئے کیونکہ مصنوعی مہارت کی سطح میں تبدیلی آئی۔ خلاصہ ہر پروفائل یا ماڈل کے لیے درستگی کی وضاحت نہیں کرتا، اور نہ ہی یہ مکمل گراف کی تعمیر کے طریقہ کار، نمونے لینے کی ترتیبات یا عقلی معیار کی تشخیص کو بیان کرتا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
یہ طریقہ مصنوعی تربیتی ڈیٹا یا ٹیسٹ ٹیوشن سسٹم بنانے کے لیے LLMs کے استعمال میں ایک عملی کمزوری کو دور کرتا ہے: ایک ماڈل ایک نوسکھئیے یا انٹرمیڈیٹ سیکھنے والے کی طرح برتاؤ کرنے کے بجائے اپنی صلاحیتوں کی پیروی کر سکتا ہے۔ زیادہ وفادار نقالی تعلیمی AI تشخیص کو زیادہ بامعنی بنا سکتے ہیں، حالانکہ ثبوت صرف ایک الجبرا پر مرکوز مطالعہ تک محدود ہے۔
مرکزی شراکت ایک تبدیلی ہے جہاں سے نقلی جواب کا فیصلہ آتا ہے۔ صرف ایک فوری نقطہ نظر میں، LLM خود فیصلہ کرتا ہے کہ کتنا علم استعمال کرنا ہے۔ یہاں بیان کردہ SSKG اپروچ میں، نقلی علم کی حالت کو مطلوبہ علمی اجزاء سے منسلک امکانات کے ذریعے واضح طور پر ظاہر کیا جاتا ہے، جب کہ LLM کو بعد میں عقلیت کے اظہار کے لیے استعمال کیا جاتا ہے۔ یہ علیحدگی مصنوعی طلباء کے رویے کو کنٹرول اور معائنہ کرنے میں آسان بنا سکتی ہے۔
تعلیمی ٹکنالوجی کے لیے یہ اہمیت رکھتا ہے کیونکہ تشخیص گمراہ کن ہو سکتا ہے اگر ہر نقلی سیکھنے والا ماہر کی طرح برتاؤ کرے۔ ٹیوشن کا نظام اس وقت موثر دکھائی دے سکتا ہے جب وہ حقیقت میں غیر معمولی طور پر قابل یا حد سے زیادہ تعمیل کرنے والے ٹیسٹ استعمال کرنے والوں کو جواب دے رہا ہو۔ ایک طریقہ جو مفروضہ مہارت اور جواب کی درستگی کے درمیان مضبوط تعلق پیدا کرتا ہے اشارے، وضاحت، تدارک اور پیشرفت کے مزید امتیازی ٹیسٹوں کی حمایت کر سکتا ہے۔
کاغذ LLM ایپلی کیشنز کے لیے ایک وسیع تر ڈیزائن انتخاب کی بھی وضاحت کرتا ہے: کسی بیرونی ڈھانچے میں اہم حالت یا رکاوٹوں کو رکھتے ہوئے زبان کی تخلیق کے لیے ماڈل کا استعمال کریں۔ یہاں، بیرونی ڈھانچہ نصاب سے منسلک ایک سٹاکسٹک علمی گراف ہے۔ یہ صرف قدرتی زبان کی ہدایات پر انحصار کرنے کے بجائے نقلی طالب علم کو جو کچھ جانتا ہے اسے کنٹرول کرنے کا ایک زیادہ شفاف طریقہ پیش کر سکتا ہے، لیکن اس کا مطلب یہ بھی ہے کہ تخروپن کا معیار اس بات پر منحصر ہے کہ نصاب کا گراف اور مطلوبہ حل کی زنجیریں کیسے بنتی ہیں۔
ثبوت تنگ ہی رہتا ہے۔ ماخذ ایک پری پرنٹ، ایک سبجیکٹ ایریا، ایک امتحانی ڈومین، 379 آئٹمز اور پانچ آرکیٹپل پروفائلز کی اطلاع دیتا ہے۔ رپورٹ کردہ درستگی کی حد جانچ شدہ پروفائلز کے درمیان علیحدگی کو ظاہر کرتی ہے، لیکن یہ اس بات کو قائم نہیں کرتی ہے کہ نقلیں حقیقی طلباء کی غلطیاں، غلط تصورات، استقامت، استدلال یا مدد کی تلاش کو دوبارہ پیش کرتی ہیں۔ خلاصہ آزادانہ توثیق، ہم مرتبہ جائزہ، تعیناتی کے نتائج یا سیکھنے کے نتائج پر اثرات کی بھی اطلاع نہیں دیتا ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
اہم سوالات یہ ہیں کہ آیا SSKGs SAT الجبرا، دیگر مضامین، مختلف نصاب اور اضافی ماڈلز سے آگے کو عام کیا جاتا ہے، اور کیا پیدا شدہ عقلیات نقلی علم کی حالت کے ساتھ وفادار رہتے ہیں۔ کاغذ ایک واحد، غیر جائزہ شدہ arXiv پری پرنٹ ہے، اور خلاصہ انسانی طلباء یا حقیقی ٹیوشن سسٹم کے نتائج کے ساتھ موازنہ کی اطلاع نہیں دیتا ہے۔
نقل پہلا امتحان ہونا چاہئے. محققین کو ریاضی کے دیگر موضوعات، مختلف گریڈ لیولز اور مضامین جیسے سائنس یا زبان سیکھنے پر SSKG اپروچ کو لاگو کرنے کی ضرورت ہوگی۔ ایسے نصاب کی جانچ کرنا بھی مفید ہو گا جو کسی ایک کھلی الجبرا کی نصابی کتاب سے اخذ نہیں کیے گئے ہیں، کیونکہ گراف اس مخصوص ماخذ کے مفروضوں اور ساخت کو انکوڈ کر سکتا ہے۔
مستقبل کے جائزوں کو حقیقی طلباء کے ریکارڈ کے ساتھ نقلی جوابات کا موازنہ کرنا چاہیے، نہ صرف متوقع مہارت کے آرڈر کے ساتھ۔ اہم اقدامات میں غلطیوں کی اقسام، متعلقہ سوالات میں مستقل مزاجی، ہدایات کے بعد تبدیلیاں اور آیا عقلی نمونے کے نتائج کی درست وضاحت کرتے ہیں۔ ان اقدامات میں سے کوئی بھی ماخذ خلاصہ میں رپورٹ نہیں کیا گیا ہے، لہذا کاغذ کا موجودہ ثبوت طرز عمل کی علیحدگی کی حمایت کرتا ہے لیکن طالب علم کی مکمل وفاداری نہیں۔
زبان کے ماڈل کا کردار بھی جانچ پڑتال کی ضمانت دیتا ہے۔ SSKG نمونے کی مہارت کے امکانات کے ذریعے درستگی کا تعین کرتا ہے، لیکن LLM پہلے شخص کی وضاحت پیدا کرتا ہے۔ ایک عقلیت قابل فہم لگ سکتی ہے جب کہ اس علمی کیفیت کی عکاسی کرنے میں ناکام رہے جس نے جواب پیدا کیا۔ مقالے کا خلاصہ یہ نہیں بتاتا کہ اس طرح کے استدلالات کی جانچ کیسے کی گئی، آیا جائزہ لینے والے انسان تھے یا خودکار، یا کتنی بار وضاحت نقلی نتائج سے متصادم تھی۔
آخر میں، پریکٹیشنرز کو رپورٹ کردہ درستگی کی حدود کو کارکردگی کے قائم کردہ معیارات کے بجائے ابتدائی پری پرنٹ کے دعووں کے طور پر ماننا چاہیے۔ ماخذ دستیابی کو بطور سافٹ ویئر سسٹم، عمومی مقصد کی تعلیمی تاثیر، یا اس تجربے سے باہر دیگر نقلی طریقوں پر برتری قائم نہیں کرتا ہے۔ سب سے زیادہ معنی خیز اگلی پیشرفت عمل درآمد کی تفصیلات، وسیع تر بینچ مارکس، حقیقی سیکھنے والے ڈیٹا کے ساتھ موازنہ اور ماڈلز اور تعلیمی ترتیبات میں آزاد نقلیں جاری کی جائیں گی۔