क्या हुआ?
एक arXiv प्रीप्रिंट बड़े भाषा मॉडल को बीजगणित निपुणता के विभिन्न स्तरों वाले छात्रों को अधिक लगातार अनुकरण करने के लिए स्टोचैस्टिक छात्र ज्ञान ग्राफ़ या एसएसकेजी पेश करता है। लेखकों का कहना है कि सामान्य संकेत-आधारित सिमुलेशन ने तीन परीक्षण किए गए एलएलएम को निर्देशित छात्र प्रोफ़ाइल की परवाह किए बिना लगभग सभी प्रश्नों का सही उत्तर देने की अनुमति दी।
21 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर अध्ययन करता है कि कैसे बड़े भाषा मॉडल विभिन्न महारत स्तरों पर छात्रों का प्रतिनिधित्व कर सकते हैं। लेखकों का कहना है कि इन सिमुलेशन का उपयोग सिंथेटिक प्रशिक्षण डेटा बनाने और तनाव-परीक्षण ट्यूशन सिस्टम बनाने के लिए तेजी से किया जा रहा है। उनकी चिंता यह है कि किसी मॉडल को कम निपुणता वाले छात्र की तरह व्यवहार करने के लिए कहने जैसे शीघ्र-केवल निर्देश मॉडल द्वारा किसी समस्या को हल करने के तरीके को विश्वसनीय रूप से नहीं बदल सकते हैं, क्योंकि अंतर्निहित मॉडल अपनी स्वयं की समस्या-समाधान क्षमता को बरकरार रखता है।
लेखक 379 कॉलेज बोर्ड-कैलिब्रेटेड SAT बीजगणित आइटमों पर तीन विक्रेताओं-Gemini 3.1 फ्लैश लाइट, Claude हाइकु 4.5 और GPT-5.4-मिनी-के तीन मॉडलों का परीक्षण करने की रिपोर्ट देते हैं। उन्होंने पाँच आदर्श निपुणता प्रोफ़ाइलों का उपयोग किया। सार के अनुसार, प्रॉम्प्ट-आधारित सेटअप में, मॉडल ने सभी प्रोफाइलों में 96.8% और 100% के बीच सटीकता हासिल की। उस परिणाम को साक्ष्य के रूप में प्रस्तुत किया गया है कि संकेतों ने उच्च-निपुणता और निम्न-निपुणता व्यवहार को पर्याप्त रूप से अलग नहीं किया है।
प्रस्तावित एसएसकेजी पद्धति एक खुली बीजगणित पाठ्यपुस्तक से निकाले गए पाठ्यक्रम ज्ञान ग्राफ से शुरू होती है। लेखक प्रत्येक SAT समाधान को आवश्यक त्रिगुणों की एक श्रृंखला में विघटित करते हैं, फिर प्रत्येक त्रिगुण को एक महारत संभाव्यता प्रदान करते हैं। सिस्टम यह निर्धारित करने के लिए उन संभावनाओं का नमूना लेता है कि कोई नकली छात्र सही उत्तर देता है या नहीं। उस परिणाम के चयन के बाद, एलएलएम परिणाम के अनुरूप होने के उद्देश्य से प्रथम-व्यक्ति तर्क उत्पन्न करता है।
विधि का उपयोग करते हुए, लेखक रिपोर्ट करते हैं कि मास्टरी प्रोफाइल में सिम्युलेटेड सटीकता 44.1% और 85.2% के बीच गिर गई और परिणामों ने एक स्पष्ट मोनोटोन मास्टरी ग्रेडिएंट दिखाया। दूसरे शब्दों में, जैसे-जैसे अनुरूपित महारत का स्तर बदलता गया, रिपोर्ट किए गए परिणाम अपेक्षित दिशा में अधिक अलग होते गए। सार प्रत्येक प्रोफ़ाइल या मॉडल के लिए सटीकता निर्दिष्ट नहीं करता है, न ही यह पूर्ण ग्राफ़-निर्माण प्रक्रिया, नमूना सेटिंग्स या तर्क-गुणवत्ता मूल्यांकन का वर्णन करता है।
यह क्यों मायने रखता है?
यह विधि सिंथेटिक प्रशिक्षण डेटा या परीक्षण ट्यूशन सिस्टम उत्पन्न करने के लिए एलएलएम का उपयोग करने में एक व्यावहारिक कमजोरी को संबोधित करती है: एक मॉडल नौसिखिया या मध्यवर्ती शिक्षार्थी की तरह व्यवहार करने के बजाय अपनी क्षमताओं का पालन कर सकता है। अधिक विश्वसनीय सिमुलेशन शैक्षिक एआई मूल्यांकन को अधिक सार्थक बना सकते हैं, हालांकि सबूत एक बीजगणित-केंद्रित अध्ययन तक सीमित है।
केंद्रीय योगदान वह बदलाव है जिसमें सिमुलेशन का उत्तर निर्णय कहां से आता है। शीघ्र-केवल दृष्टिकोण में, एलएलएम स्वयं निर्णय लेता है कि कितना ज्ञान उपयोग करना है। यहां वर्णित एसएसकेजी दृष्टिकोण में, सिम्युलेटेड ज्ञान स्थिति को आवश्यक ज्ञान घटकों से जुड़ी संभावनाओं के माध्यम से स्पष्ट रूप से दर्शाया जाता है, जबकि एलएलएम का उपयोग बाद में तर्क व्यक्त करने के लिए किया जाता है। उस पृथक्करण से सिंथेटिक छात्रों के व्यवहार को नियंत्रित करना और निरीक्षण करना आसान हो सकता है।
यह शैक्षिक प्रौद्योगिकी के लिए मायने रखता है क्योंकि यदि प्रत्येक अनुकरणीय शिक्षार्थी एक विशेषज्ञ की तरह व्यवहार करता है तो मूल्यांकन भ्रामक हो सकता है। एक शिक्षण प्रणाली तब प्रभावी दिखाई दे सकती है जब वह वास्तव में असामान्य रूप से सक्षम या अत्यधिक आज्ञाकारी परीक्षण उपयोगकर्ताओं को प्रतिक्रिया दे रही हो। एक विधि जो कल्पित महारत और उत्तर सटीकता के बीच एक मजबूत संबंध पैदा करती है, संकेत, स्पष्टीकरण, उपचार और प्रगति के अधिक भेदभावपूर्ण परीक्षणों का समर्थन कर सकती है - बशर्ते बाद के अध्ययनों से पता चलता है कि अनुरूपित व्यवहार वास्तविक शिक्षार्थियों जैसा दिखता है।
पेपर एलएलएम अनुप्रयोगों के लिए एक व्यापक डिज़ाइन विकल्प को भी दर्शाता है: बाहरी संरचना में महत्वपूर्ण स्थिति या बाधाओं को रखते हुए भाषा निर्माण के लिए मॉडल का उपयोग करें। यहां, बाहरी संरचना एक पाठ्यक्रम से बंधा हुआ स्टोकेस्टिक ज्ञान ग्राफ है। यह केवल प्राकृतिक-भाषा के निर्देशों पर निर्भर रहने की तुलना में एक सिम्युलेटेड छात्र जो जानता है उसे नियंत्रित करने के लिए अधिक पारदर्शी तरीका प्रदान कर सकता है, लेकिन इसका मतलब यह भी है कि सिमुलेशन की गुणवत्ता इस बात पर निर्भर करती है कि पाठ्यक्रम ग्राफ और आवश्यक समाधान श्रृंखलाएं कैसे बनाई जाती हैं।
सबूत संकीर्ण रहता है. स्रोत एक प्रीप्रिंट, एक विषय क्षेत्र, एक परीक्षा डोमेन, 379 आइटम और पांच आदर्श प्रोफाइल की रिपोर्ट करता है। रिपोर्ट की गई सटीकता सीमा परीक्षण किए गए प्रोफाइलों के बीच अलगाव को दर्शाती है, लेकिन यह स्थापित नहीं करती है कि सिमुलेशन वास्तविक छात्रों की गलतियों, गलतफहमियों, दृढ़ता, तर्क या मदद मांगने को पुन: उत्पन्न करते हैं। सार स्वतंत्र सत्यापन, सहकर्मी समीक्षा, परिनियोजन परिणाम या सीखने के परिणामों पर प्रभाव की भी रिपोर्ट नहीं करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
मुख्य प्रश्न यह हैं कि क्या एसएसकेजी एसएटी बीजगणित, अन्य विषयों, विभिन्न पाठ्यक्रम और अतिरिक्त मॉडल से परे सामान्यीकरण करते हैं, और क्या उत्पन्न तर्क सिम्युलेटेड ज्ञान स्थिति के प्रति वफादार रहते हैं। पेपर एक एकल, बिना समीक्षा वाला arXiv प्रीप्रिंट है, और सार मानव छात्रों या वास्तविक ट्यूशन-सिस्टम परिणामों के साथ तुलना की रिपोर्ट नहीं करता है।
प्रतिकृति पहला परीक्षण होना चाहिए. शोधकर्ताओं को एसएसकेजी दृष्टिकोण को अन्य गणितीय विषयों, विभिन्न ग्रेड स्तरों और विज्ञान या भाषा सीखने जैसे विषयों पर लागू करने की आवश्यकता होगी। यह उन पाठ्यक्रमों का परीक्षण करने के लिए भी उपयोगी होगा जो एकल खुली बीजगणित पाठ्यपुस्तक से प्राप्त नहीं हुए हैं, क्योंकि ग्राफ़ उस विशेष स्रोत की मान्यताओं और संरचना को एन्कोड कर सकता है।
भविष्य के मूल्यांकन में सिम्युलेटेड प्रतिक्रियाओं की तुलना वास्तविक छात्रों के रिकॉर्ड के साथ की जानी चाहिए, न कि केवल अपेक्षित महारत के क्रम के साथ। महत्वपूर्ण उपायों में की गई त्रुटियों के प्रकार, संबंधित प्रश्नों में स्थिरता, निर्देश के बाद परिवर्तन और क्या तर्कसंगतताएं नमूना परिणाम को सटीक रूप से समझाती हैं, शामिल हो सकती हैं। स्रोत सार में उन उपायों में से कोई भी रिपोर्ट नहीं किया गया है, इसलिए पेपर के वर्तमान साक्ष्य व्यवहारिक पृथक्करण का समर्थन करते हैं लेकिन पूर्ण छात्र निष्ठा का नहीं।
भाषा मॉडल की भूमिका की भी जांच जरूरी है। एसएसकेजी नमूना महारत संभावनाओं के माध्यम से शुद्धता निर्धारित करता है, लेकिन एलएलएम प्रथम-व्यक्ति स्पष्टीकरण उत्पन्न करता है। उत्तर उत्पन्न करने वाली ज्ञान स्थिति को प्रतिबिंबित करने में विफल रहने पर भी एक तर्क प्रशंसनीय लग सकता है। पेपर के सार में यह नहीं बताया गया है कि ऐसे तर्कों की जाँच कैसे की गई, क्या मूल्यांकनकर्ता मानव थे या स्वचालित, या कितनी बार स्पष्टीकरण ने अनुरूपित परिणाम का खंडन किया।
अंत में, चिकित्सकों को रिपोर्ट की गई सटीकता श्रेणियों को स्थापित प्रदर्शन मानकों के बजाय प्रारंभिक प्रीप्रिंट के दावों के रूप में मानना चाहिए। स्रोत सॉफ़्टवेयर सिस्टम के रूप में उपलब्धता, सामान्य प्रयोजन शैक्षिक प्रभावशीलता, या इस प्रयोग के बाहर अन्य सिमुलेशन विधियों पर श्रेष्ठता स्थापित नहीं करता है। सबसे सार्थक अगला विकास कार्यान्वयन विवरण, व्यापक बेंचमार्क, वास्तविक शिक्षार्थी डेटा के साथ तुलना और मॉडल और शैक्षिक सेटिंग्स में स्वतंत्र प्रतिकृति जारी किया जाएगा।