समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

LURE पेपर कार्य डेटा के बिना एलएलएम तर्क को प्रशिक्षित करने के लिए पीछा-चोरी स्व-खेल का प्रस्ताव करता है

एक नया arXiv पेपर LURE प्रस्तुत करता है, एक शून्य-डेटा स्व-प्ले विधि जिसमें एक भाषा मॉडल कार्य कठिनाई निर्धारित करता है जबकि दूसरा सत्यापन योग्य तर्क चुनौतियों को हल करता है। लेखक नौ आयोजित बेंचमार्क में प्रशिक्षित बेसलाइन की तुलना में अधिक मजबूत आउट-ऑफ-डिस्ट्रीब्यूशन शून्य-शॉट सटीकता की रिपोर्ट करते हैं, लेकिन सार नहीं…

5 min readRead the primary source
Primary-source image accompanying LURE paper proposes pursuit-evasion self-play to train LLM reasoning without task data
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21871
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
स्व-खेल
एक प्रशिक्षण सेटअप जहां एक मॉडल स्वयं की प्रतियों के साथ बातचीत या प्रतियोगिताओं के माध्यम से डेटा उत्पन्न करके सुधार करता है।
सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

एक arXiv पेपर LURE का परिचय देता है, जो एक सुदृढीकरण-सीखने का दृष्टिकोण है जिसका उद्देश्य बड़े मानव-क्यूरेटेड कार्य संग्रह पर भरोसा किए बिना बड़े भाषा मॉडल तर्क में सुधार करना है। यह प्रशिक्षण को एक पीछा-चोरी के खेल के रूप में प्रस्तुत करता है: एक चोर कार्यों को कठिनाई के पैमाने पर रखता है, जबकि एक योजनाकार-निष्पादक पीछा करने वाला सत्यापन योग्य बातचीत के माध्यम से उन्हें हल करने का प्रयास करता है।

22 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, LURE को बड़े भाषा मॉडल तर्क में शून्य-डेटा सेल्फ-प्ले के लिए एक विधि के रूप में वर्णित करता है। लेखकों का कहना है कि सत्यापन योग्य पुरस्कारों के साथ पारंपरिक सुदृढीकरण सीखने में आम तौर पर मानव-क्यूरेटेड कार्यों के बड़े संग्रह तक पहुंच शामिल होती है। उनका घोषित उद्देश्य पूरी तरह से तैयार कार्य पूल पर निर्भर रहने के बजाय प्रशिक्षण के दौरान कार्यों को उत्पन्न करने या स्थिति में लाने के द्वारा उस निर्भरता को दूर करना है। स्रोत इसे पेपर की शोध समस्या और प्रस्ताव के रूप में स्थापित करता है; यह स्थापित नहीं करता है कि LURE एक तैनात प्रणाली या उत्पादन-तैयार प्रशिक्षण पद्धति है।

LURE प्रशिक्षण प्रक्रिया को दो भूमिकाओं में विभाजित करता है। एक एलएलएम चोर पर्यावरण की कठिनाई धुरी के साथ कार्यों को रखता है, जबकि एक योजनाकार-निष्पादक अनुयायी उन कार्यों को बातचीत के माध्यम से हल करने का प्रयास करता है जिनके परिणामों को सत्यापित किया जा सकता है। पेपर में कहा गया है कि चोरी करने वाले को कैप्चर-फ्रंटियर इनाम मिलता है जो तब सबसे अधिक होता है जब सॉल्वर उसके रोलआउट के ठीक आधे हिस्से पर उसे पकड़ लेता है। लेखकों के निर्धारण में, वह पुरस्कार "मुश्किल से पकड़ने योग्य" कार्य प्लेसमेंट को मैन्युअल रूप से चुनी गई अस्वीकृति सीमा द्वारा लागू करने के बजाय सीखी गई चीज़ में बदल देता है। सार सटीक वातावरण, कार्य प्रारूप या सत्यापनकर्ता कार्यान्वयन की व्याख्या नहीं करता है।

विधि यह भी बदलती है कि समाधान मॉडल को प्रशिक्षण क्रेडिट कैसे प्राप्त होता है। केवल विरल टर्मिनल इनाम पर भरोसा करने के बजाय, LURE उस चीज़ का उपयोग करता है जिसे पेपर कैप्चर-एंकर्ड डेंस प्रोसेस क्रेडिट कहता है। सार कहता है कि कार्य-सेटिंग और कार्य-समाधान भूमिकाओं के बीच सह-विकास को स्थिर करने के उद्देश्य से एक गोल-एंकर वाले केएल बाधा के तहत, मोनोटोन सत्यापनकर्ता प्रगति को टर्मिनल कैप्चर के साथ समूह-सामान्यीकृत किया जाता है। लेखक एकीकृत और विशेषज्ञ सेटिंग्स की तुलना करते हुए तीन सत्यापन योग्य तर्क वातावरण और तीन रीढ़ वाले परिवारों में परीक्षणों की रिपोर्ट करते हैं। स्रोत रीढ़ की हड्डी के नाम, प्रशिक्षण बजट, उपचार, या सटीक आधारभूत विन्यास की पहचान नहीं करता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो LURE शोधकर्ताओं को व्यापक लेबल वाले डेटासेट को इकट्ठा किए बिना उपयोगी तर्क चुनौतियों को उत्पन्न करने और चुनने का एक तरीका प्रदान कर सकता है। इसका दृष्टिकोण एक साथ दो लगातार प्रशिक्षण समस्याओं को भी लक्षित करता है: ऐसे कार्यों को चुनना जो कठिन हैं लेकिन सीखने योग्य हैं, और केवल अंतिम उत्तरों के बजाय मध्यवर्ती चरणों को श्रेय देना।

प्रस्ताव का व्यावहारिक महत्व मानव-जनित तर्क अभ्यास पर निर्भरता को कम करने का प्रयास है। बड़े, उच्च-गुणवत्ता वाले कार्य संग्रह बनाना महंगा है, और निश्चित संग्रह प्रशिक्षण चुनौतियों को उचित स्तर पर रखना मुश्किल बना सकते हैं। LURE का इवेडर-पर्सुअर सेटअप सॉल्वर में सुधार होने पर कठिनाई को समायोजित करने के लिए डिज़ाइन किया गया है। यदि वह तंत्र विश्वसनीय रूप से काम करता है, तो यह स्व-प्ले प्रशिक्षण को अधिक अनुकूली बना सकता है और संभावित रूप से कुछ सत्यापन योग्य तर्क डोमेन के लिए आवश्यक मैन्युअल कार्य क्यूरेशन की मात्रा को कम कर सकता है। यह डिज़ाइन का एक संभावित निहितार्थ है, स्वतंत्र रूप से स्थापित परिणाम नहीं।

पेपर क्रेडिट असाइनमेंट को भी संबोधित करता है, जो बहु-चरणीय तर्क प्रशिक्षण में एक केंद्रीय मुद्दा है। एक सॉल्वर उपयोगी और अनुपयोगी निर्णयों वाले अनुक्रम के बाद एक सही अंतिम परिणाम तक पहुंच सकता है, जबकि केवल एक टर्मिनल इनाम इस बारे में बहुत कम जानकारी देता है कि कौन से चरण मायने रखते हैं। मध्यवर्ती सत्यापनकर्ता प्रगति को अंतिम कैप्चर इवेंट से जोड़कर, LURE का लक्ष्य सत्यापित परिणाम के महत्व को त्यागे बिना एक सघन शिक्षण संकेत प्रदान करना है। सार रिपोर्ट करता है कि इस संयोजन ने लेखकों के प्रयोगों में उन्नत बेसलाइन से बेहतर प्रदर्शन किया है, लेकिन यह नहीं दिखाता है कि सुधार मुख्य रूप से अनुकूली कार्य चयन, सघन क्रेडिट, केएल स्थिरीकरण शब्द, या उनकी बातचीत से आया है।

सबसे मजबूत रिपोर्ट किया गया परिणाम यह है कि एकीकृत मॉडल ने तीन कार्य परिवारों में फैले नौ होल्ड-आउट बेंचमार्क में सभी प्रशिक्षित बेसलाइन की तुलना में उच्च समग्र आउट-ऑफ-डिस्ट्रीब्यूशन शून्य-शॉट सटीकता हासिल की। वह दावा, यदि प्रतिलिपि प्रस्तुत करने योग्य है, तो सुझाव देता है कि यह विधि केवल प्रशिक्षण के दौरान उपयोग किए गए वातावरण को अनुकूलित करने के बजाय स्थानांतरण में सुधार कर सकती है। फिर भी, "मजबूत समुच्चय" व्यावहारिक महत्व निर्धारित करने के लिए पर्याप्त नहीं है: सार कोई स्कोर, आत्मविश्वास अंतराल, प्रति-बेंचमार्क परिणाम, बड़े या अधिक गणना-गहन प्रणालियों के साथ तुलना, या आयोजित किए गए कार्यों का चयन कैसे किया गया था, इसके बारे में जानकारी नहीं देता है। इसलिए कार्य को एक शोध परिणाम के रूप में सबसे अच्छी तरह से समझा जाता है जिसके लिए आगे की परीक्षा की आवश्यकता होती है, न कि सबूत के रूप में कि शून्य-डेटा स्व-प्ले ने सामान्य प्रयोजन तर्क प्रशिक्षण को हल कर दिया है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

पेपर नौ पेज का arXiv प्रीप्रिंट है, और स्रोत केवल एक सार प्रदान करता है। रिपोर्ट किए गए लाभ के संख्यात्मक आकार, कम्प्यूटेशनल लागत, कार्य निर्माण, मॉडल आकार, बेंचमार्क संरचना, प्रतिलिपि प्रस्तुत करने योग्यता, और क्या विधि परीक्षण किए गए तीन वातावरणों और तीन कार्य परिवारों से परे स्थानांतरित होती है, के बारे में महत्वपूर्ण प्रश्न बने हुए हैं।

पहला सत्यापन चरण पूर्ण पेपर और उसकी प्रयोगात्मक तालिकाएँ हैं। पाठकों को तीन प्रमुख परिवारों की पहचान और आकार, तीन वातावरणों की सटीक परिभाषा, प्रशिक्षण कार्यों की संख्या और प्रकार, आधारभूत विधियों और उपयोग की गई गणना को देखना चाहिए। वे विवरण यह निर्धारित करेंगे कि क्या LURE के लाभ व्यापक रूप से उपयोगी प्रशिक्षण नुस्खा या किसी विशेष बेंचमार्क डिज़ाइन से कसकर जुड़े परिणाम को दर्शाते हैं। स्रोत अंश पुष्टि करता है कि पेपर में पाँच तालिकाएँ और पाँच आंकड़े हैं, लेकिन यह उनकी सामग्री प्रदान नहीं करता है।

प्रतिलिपि प्रस्तुत करने योग्यता एक और खुला मुद्दा है। आपूर्ति किया गया स्रोत यह नहीं बताता है कि कोड, कार्य जनरेटर, सत्यापनकर्ता कार्यान्वयन, चौकियाँ, या प्रशिक्षण डेटा उपलब्ध हैं या नहीं। क्योंकि विधि सह-विकसित चोर और पीछा करने वाले पर निर्भर करती है, इनाम स्केलिंग, रोलआउट नमूनाकरण, सामान्यीकरण या स्थिरीकरण में छोटे विकल्प परिणामों को प्रभावित कर सकते हैं। विभिन्न मॉडल परिवारों और सत्यापन योग्य वातावरणों में स्वतंत्र प्रतिकृति यह स्थापित करने में मदद करेगी कि रिपोर्ट किया गया व्यवहार मजबूत है या लेखकों के कार्यान्वयन पर निर्भर करता है।

अंत में, विधि के दायरे को पेपर में बताए गए नौ निर्धारित बेंचमार्क और तीन कार्य परिवारों से परे परीक्षण की आवश्यकता है। सत्यापन योग्य वातावरण उपयोगी होते हैं क्योंकि वे वस्तुनिष्ठ प्रतिक्रिया प्रदान करते हैं, लेकिन कई वास्तविक दुनिया के तर्क कार्यों में स्वचालित सत्यापनकर्ता का अभाव होता है या अस्पष्ट सफलता मानदंड होते हैं। यह अज्ञात है कि क्या LURE उन सेटिंग्स में उपयोगी कठिनाई पाठ्यक्रम बना सकता है, अभी भी कितनी मानवीय निगरानी की आवश्यकता होगी, और क्या चोरी करने वाला वास्तव में मूल्यवान चुनौतियों का उत्पादन करने के बजाय सत्यापनकर्ता में कमजोरियों का फायदा उठाना सीख सकता है। सार में विधि की प्रशिक्षण लागत, विलंबता, विफलता मोड और लंबे या कम संरचित कार्यों पर प्रदर्शन भी अज्ञात है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणट्रांसफार्मरएआई एजेंटआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?