समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

एसएसकेजी विधि एलएलएम छात्र सिमुलेशन को अधिक ईमानदारी से महारत हासिल करने में सक्षम बनाती है, पेपर रिपोर्ट

एक arXiv प्रीप्रिंट रिपोर्ट करता है कि एक स्टोकेस्टिक ज्ञान-ग्राफ पद्धति ने तीन एलएलएम को 379 एसएटी बीजगणित आइटमों में अधिक विशिष्ट अनुरूपित छात्रों का उत्पादन किया है।

5 min readRead the primary source
Source-page capture accompanying SSKG method makes LLM student simulations track mastery more faithfully, paper reports
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21668
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
ज्ञान ग्राफ
तर्क या पुनर्प्राप्ति के लिए उपयोग की जाने वाली संस्थाओं और संबंधों की एक ग्राफ़ संरचना।
ढाल
एक वेक्टर जो दर्शाता है कि हानि को कम करने के लिए प्रत्येक पैरामीटर को कितना बदलना चाहिए।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

एक arXiv प्रीप्रिंट बड़े भाषा मॉडल को बीजगणित निपुणता के विभिन्न स्तरों वाले छात्रों को अधिक लगातार अनुकरण करने के लिए स्टोचैस्टिक छात्र ज्ञान ग्राफ़ या एसएसकेजी पेश करता है। लेखकों का कहना है कि सामान्य संकेत-आधारित सिमुलेशन ने तीन परीक्षण किए गए एलएलएम को निर्देशित छात्र प्रोफ़ाइल की परवाह किए बिना लगभग सभी प्रश्नों का सही उत्तर देने की अनुमति दी।

21 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर अध्ययन करता है कि कैसे बड़े भाषा मॉडल विभिन्न महारत स्तरों पर छात्रों का प्रतिनिधित्व कर सकते हैं। लेखकों का कहना है कि इन सिमुलेशन का उपयोग सिंथेटिक प्रशिक्षण डेटा बनाने और तनाव-परीक्षण ट्यूशन सिस्टम बनाने के लिए तेजी से किया जा रहा है। उनकी चिंता यह है कि किसी मॉडल को कम निपुणता वाले छात्र की तरह व्यवहार करने के लिए कहने जैसे शीघ्र-केवल निर्देश मॉडल द्वारा किसी समस्या को हल करने के तरीके को विश्वसनीय रूप से नहीं बदल सकते हैं, क्योंकि अंतर्निहित मॉडल अपनी स्वयं की समस्या-समाधान क्षमता को बरकरार रखता है।

लेखक 379 कॉलेज बोर्ड-कैलिब्रेटेड SAT बीजगणित आइटमों पर तीन विक्रेताओं-Gemini 3.1 फ्लैश लाइट, Claude हाइकु 4.5 और GPT-5.4-मिनी-के तीन मॉडलों का परीक्षण करने की रिपोर्ट देते हैं। उन्होंने पाँच आदर्श निपुणता प्रोफ़ाइलों का उपयोग किया। सार के अनुसार, प्रॉम्प्ट-आधारित सेटअप में, मॉडल ने सभी प्रोफाइलों में 96.8% और 100% के बीच सटीकता हासिल की। उस परिणाम को साक्ष्य के रूप में प्रस्तुत किया गया है कि संकेतों ने उच्च-निपुणता और निम्न-निपुणता व्यवहार को पर्याप्त रूप से अलग नहीं किया है।

प्रस्तावित एसएसकेजी पद्धति एक खुली बीजगणित पाठ्यपुस्तक से निकाले गए पाठ्यक्रम ज्ञान ग्राफ से शुरू होती है। लेखक प्रत्येक SAT समाधान को आवश्यक त्रिगुणों की एक श्रृंखला में विघटित करते हैं, फिर प्रत्येक त्रिगुण को एक महारत संभाव्यता प्रदान करते हैं। सिस्टम यह निर्धारित करने के लिए उन संभावनाओं का नमूना लेता है कि कोई नकली छात्र सही उत्तर देता है या नहीं। उस परिणाम के चयन के बाद, एलएलएम परिणाम के अनुरूप होने के उद्देश्य से प्रथम-व्यक्ति तर्क उत्पन्न करता है।

विधि का उपयोग करते हुए, लेखक रिपोर्ट करते हैं कि मास्टरी प्रोफाइल में सिम्युलेटेड सटीकता 44.1% और 85.2% के बीच गिर गई और परिणामों ने एक स्पष्ट मोनोटोन मास्टरी ग्रेडिएंट दिखाया। दूसरे शब्दों में, जैसे-जैसे अनुरूपित महारत का स्तर बदलता गया, रिपोर्ट किए गए परिणाम अपेक्षित दिशा में अधिक अलग होते गए। सार प्रत्येक प्रोफ़ाइल या मॉडल के लिए सटीकता निर्दिष्ट नहीं करता है, न ही यह पूर्ण ग्राफ़-निर्माण प्रक्रिया, नमूना सेटिंग्स या तर्क-गुणवत्ता मूल्यांकन का वर्णन करता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

यह विधि सिंथेटिक प्रशिक्षण डेटा या परीक्षण ट्यूशन सिस्टम उत्पन्न करने के लिए एलएलएम का उपयोग करने में एक व्यावहारिक कमजोरी को संबोधित करती है: एक मॉडल नौसिखिया या मध्यवर्ती शिक्षार्थी की तरह व्यवहार करने के बजाय अपनी क्षमताओं का पालन कर सकता है। अधिक विश्वसनीय सिमुलेशन शैक्षिक एआई मूल्यांकन को अधिक सार्थक बना सकते हैं, हालांकि सबूत एक बीजगणित-केंद्रित अध्ययन तक सीमित है।

केंद्रीय योगदान वह बदलाव है जिसमें सिमुलेशन का उत्तर निर्णय कहां से आता है। शीघ्र-केवल दृष्टिकोण में, एलएलएम स्वयं निर्णय लेता है कि कितना ज्ञान उपयोग करना है। यहां वर्णित एसएसकेजी दृष्टिकोण में, सिम्युलेटेड ज्ञान स्थिति को आवश्यक ज्ञान घटकों से जुड़ी संभावनाओं के माध्यम से स्पष्ट रूप से दर्शाया जाता है, जबकि एलएलएम का उपयोग बाद में तर्क व्यक्त करने के लिए किया जाता है। उस पृथक्करण से सिंथेटिक छात्रों के व्यवहार को नियंत्रित करना और निरीक्षण करना आसान हो सकता है।

यह शैक्षिक प्रौद्योगिकी के लिए मायने रखता है क्योंकि यदि प्रत्येक अनुकरणीय शिक्षार्थी एक विशेषज्ञ की तरह व्यवहार करता है तो मूल्यांकन भ्रामक हो सकता है। एक शिक्षण प्रणाली तब प्रभावी दिखाई दे सकती है जब वह वास्तव में असामान्य रूप से सक्षम या अत्यधिक आज्ञाकारी परीक्षण उपयोगकर्ताओं को प्रतिक्रिया दे रही हो। एक विधि जो कल्पित महारत और उत्तर सटीकता के बीच एक मजबूत संबंध पैदा करती है, संकेत, स्पष्टीकरण, उपचार और प्रगति के अधिक भेदभावपूर्ण परीक्षणों का समर्थन कर सकती है - बशर्ते बाद के अध्ययनों से पता चलता है कि अनुरूपित व्यवहार वास्तविक शिक्षार्थियों जैसा दिखता है।

पेपर एलएलएम अनुप्रयोगों के लिए एक व्यापक डिज़ाइन विकल्प को भी दर्शाता है: बाहरी संरचना में महत्वपूर्ण स्थिति या बाधाओं को रखते हुए भाषा निर्माण के लिए मॉडल का उपयोग करें। यहां, बाहरी संरचना एक पाठ्यक्रम से बंधा हुआ स्टोकेस्टिक ज्ञान ग्राफ है। यह केवल प्राकृतिक-भाषा के निर्देशों पर निर्भर रहने की तुलना में एक सिम्युलेटेड छात्र जो जानता है उसे नियंत्रित करने के लिए अधिक पारदर्शी तरीका प्रदान कर सकता है, लेकिन इसका मतलब यह भी है कि सिमुलेशन की गुणवत्ता इस बात पर निर्भर करती है कि पाठ्यक्रम ग्राफ और आवश्यक समाधान श्रृंखलाएं कैसे बनाई जाती हैं।

सबूत संकीर्ण रहता है. स्रोत एक प्रीप्रिंट, एक विषय क्षेत्र, एक परीक्षा डोमेन, 379 आइटम और पांच आदर्श प्रोफाइल की रिपोर्ट करता है। रिपोर्ट की गई सटीकता सीमा परीक्षण किए गए प्रोफाइलों के बीच अलगाव को दर्शाती है, लेकिन यह स्थापित नहीं करती है कि सिमुलेशन वास्तविक छात्रों की गलतियों, गलतफहमियों, दृढ़ता, तर्क या मदद मांगने को पुन: उत्पन्न करते हैं। सार स्वतंत्र सत्यापन, सहकर्मी समीक्षा, परिनियोजन परिणाम या सीखने के परिणामों पर प्रभाव की भी रिपोर्ट नहीं करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

मुख्य प्रश्न यह हैं कि क्या एसएसकेजी एसएटी बीजगणित, अन्य विषयों, विभिन्न पाठ्यक्रम और अतिरिक्त मॉडल से परे सामान्यीकरण करते हैं, और क्या उत्पन्न तर्क सिम्युलेटेड ज्ञान स्थिति के प्रति वफादार रहते हैं। पेपर एक एकल, बिना समीक्षा वाला arXiv प्रीप्रिंट है, और सार मानव छात्रों या वास्तविक ट्यूशन-सिस्टम परिणामों के साथ तुलना की रिपोर्ट नहीं करता है।

प्रतिकृति पहला परीक्षण होना चाहिए. शोधकर्ताओं को एसएसकेजी दृष्टिकोण को अन्य गणितीय विषयों, विभिन्न ग्रेड स्तरों और विज्ञान या भाषा सीखने जैसे विषयों पर लागू करने की आवश्यकता होगी। यह उन पाठ्यक्रमों का परीक्षण करने के लिए भी उपयोगी होगा जो एकल खुली बीजगणित पाठ्यपुस्तक से प्राप्त नहीं हुए हैं, क्योंकि ग्राफ़ उस विशेष स्रोत की मान्यताओं और संरचना को एन्कोड कर सकता है।

भविष्य के मूल्यांकन में सिम्युलेटेड प्रतिक्रियाओं की तुलना वास्तविक छात्रों के रिकॉर्ड के साथ की जानी चाहिए, न कि केवल अपेक्षित महारत के क्रम के साथ। महत्वपूर्ण उपायों में की गई त्रुटियों के प्रकार, संबंधित प्रश्नों में स्थिरता, निर्देश के बाद परिवर्तन और क्या तर्कसंगतताएं नमूना परिणाम को सटीक रूप से समझाती हैं, शामिल हो सकती हैं। स्रोत सार में उन उपायों में से कोई भी रिपोर्ट नहीं किया गया है, इसलिए पेपर के वर्तमान साक्ष्य व्यवहारिक पृथक्करण का समर्थन करते हैं लेकिन पूर्ण छात्र निष्ठा का नहीं।

भाषा मॉडल की भूमिका की भी जांच जरूरी है। एसएसकेजी नमूना महारत संभावनाओं के माध्यम से शुद्धता निर्धारित करता है, लेकिन एलएलएम प्रथम-व्यक्ति स्पष्टीकरण उत्पन्न करता है। उत्तर उत्पन्न करने वाली ज्ञान स्थिति को प्रतिबिंबित करने में विफल रहने पर भी एक तर्क प्रशंसनीय लग सकता है। पेपर के सार में यह नहीं बताया गया है कि ऐसे तर्कों की जाँच कैसे की गई, क्या मूल्यांकनकर्ता मानव थे या स्वचालित, या कितनी बार स्पष्टीकरण ने अनुरूपित परिणाम का खंडन किया।

अंत में, चिकित्सकों को रिपोर्ट की गई सटीकता श्रेणियों को स्थापित प्रदर्शन मानकों के बजाय प्रारंभिक प्रीप्रिंट के दावों के रूप में मानना ​​चाहिए। स्रोत सॉफ़्टवेयर सिस्टम के रूप में उपलब्धता, सामान्य प्रयोजन शैक्षिक प्रभावशीलता, या इस प्रयोग के बाहर अन्य सिमुलेशन विधियों पर श्रेष्ठता स्थापित नहीं करता है। सबसे सार्थक अगला विकास कार्यान्वयन विवरण, व्यापक बेंचमार्क, वास्तविक शिक्षार्थी डेटा के साथ तुलना और मॉडल और शैक्षिक सेटिंग्स में स्वतंत्र प्रतिकृति जारी किया जाएगा।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणChatGPT और एलएलएमआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?