क्या हुआ?
एक arXiv पेपर LURE का परिचय देता है, जो एक सुदृढीकरण-सीखने का दृष्टिकोण है जिसका उद्देश्य बड़े मानव-क्यूरेटेड कार्य संग्रह पर भरोसा किए बिना बड़े भाषा मॉडल तर्क में सुधार करना है। यह प्रशिक्षण को एक पीछा-चोरी के खेल के रूप में प्रस्तुत करता है: एक चोर कार्यों को कठिनाई के पैमाने पर रखता है, जबकि एक योजनाकार-निष्पादक पीछा करने वाला सत्यापन योग्य बातचीत के माध्यम से उन्हें हल करने का प्रयास करता है।
22 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, LURE को बड़े भाषा मॉडल तर्क में शून्य-डेटा सेल्फ-प्ले के लिए एक विधि के रूप में वर्णित करता है। लेखकों का कहना है कि सत्यापन योग्य पुरस्कारों के साथ पारंपरिक सुदृढीकरण सीखने में आम तौर पर मानव-क्यूरेटेड कार्यों के बड़े संग्रह तक पहुंच शामिल होती है। उनका घोषित उद्देश्य पूरी तरह से तैयार कार्य पूल पर निर्भर रहने के बजाय प्रशिक्षण के दौरान कार्यों को उत्पन्न करने या स्थिति में लाने के द्वारा उस निर्भरता को दूर करना है। स्रोत इसे पेपर की शोध समस्या और प्रस्ताव के रूप में स्थापित करता है; यह स्थापित नहीं करता है कि LURE एक तैनात प्रणाली या उत्पादन-तैयार प्रशिक्षण पद्धति है।
LURE प्रशिक्षण प्रक्रिया को दो भूमिकाओं में विभाजित करता है। एक एलएलएम चोर पर्यावरण की कठिनाई धुरी के साथ कार्यों को रखता है, जबकि एक योजनाकार-निष्पादक अनुयायी उन कार्यों को बातचीत के माध्यम से हल करने का प्रयास करता है जिनके परिणामों को सत्यापित किया जा सकता है। पेपर में कहा गया है कि चोरी करने वाले को कैप्चर-फ्रंटियर इनाम मिलता है जो तब सबसे अधिक होता है जब सॉल्वर उसके रोलआउट के ठीक आधे हिस्से पर उसे पकड़ लेता है। लेखकों के निर्धारण में, वह पुरस्कार "मुश्किल से पकड़ने योग्य" कार्य प्लेसमेंट को मैन्युअल रूप से चुनी गई अस्वीकृति सीमा द्वारा लागू करने के बजाय सीखी गई चीज़ में बदल देता है। सार सटीक वातावरण, कार्य प्रारूप या सत्यापनकर्ता कार्यान्वयन की व्याख्या नहीं करता है।
विधि यह भी बदलती है कि समाधान मॉडल को प्रशिक्षण क्रेडिट कैसे प्राप्त होता है। केवल विरल टर्मिनल इनाम पर भरोसा करने के बजाय, LURE उस चीज़ का उपयोग करता है जिसे पेपर कैप्चर-एंकर्ड डेंस प्रोसेस क्रेडिट कहता है। सार कहता है कि कार्य-सेटिंग और कार्य-समाधान भूमिकाओं के बीच सह-विकास को स्थिर करने के उद्देश्य से एक गोल-एंकर वाले केएल बाधा के तहत, मोनोटोन सत्यापनकर्ता प्रगति को टर्मिनल कैप्चर के साथ समूह-सामान्यीकृत किया जाता है। लेखक एकीकृत और विशेषज्ञ सेटिंग्स की तुलना करते हुए तीन सत्यापन योग्य तर्क वातावरण और तीन रीढ़ वाले परिवारों में परीक्षणों की रिपोर्ट करते हैं। स्रोत रीढ़ की हड्डी के नाम, प्रशिक्षण बजट, उपचार, या सटीक आधारभूत विन्यास की पहचान नहीं करता है।
यह क्यों मायने रखता है?
यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो LURE शोधकर्ताओं को व्यापक लेबल वाले डेटासेट को इकट्ठा किए बिना उपयोगी तर्क चुनौतियों को उत्पन्न करने और चुनने का एक तरीका प्रदान कर सकता है। इसका दृष्टिकोण एक साथ दो लगातार प्रशिक्षण समस्याओं को भी लक्षित करता है: ऐसे कार्यों को चुनना जो कठिन हैं लेकिन सीखने योग्य हैं, और केवल अंतिम उत्तरों के बजाय मध्यवर्ती चरणों को श्रेय देना।
प्रस्ताव का व्यावहारिक महत्व मानव-जनित तर्क अभ्यास पर निर्भरता को कम करने का प्रयास है। बड़े, उच्च-गुणवत्ता वाले कार्य संग्रह बनाना महंगा है, और निश्चित संग्रह प्रशिक्षण चुनौतियों को उचित स्तर पर रखना मुश्किल बना सकते हैं। LURE का इवेडर-पर्सुअर सेटअप सॉल्वर में सुधार होने पर कठिनाई को समायोजित करने के लिए डिज़ाइन किया गया है। यदि वह तंत्र विश्वसनीय रूप से काम करता है, तो यह स्व-प्ले प्रशिक्षण को अधिक अनुकूली बना सकता है और संभावित रूप से कुछ सत्यापन योग्य तर्क डोमेन के लिए आवश्यक मैन्युअल कार्य क्यूरेशन की मात्रा को कम कर सकता है। यह डिज़ाइन का एक संभावित निहितार्थ है, स्वतंत्र रूप से स्थापित परिणाम नहीं।
पेपर क्रेडिट असाइनमेंट को भी संबोधित करता है, जो बहु-चरणीय तर्क प्रशिक्षण में एक केंद्रीय मुद्दा है। एक सॉल्वर उपयोगी और अनुपयोगी निर्णयों वाले अनुक्रम के बाद एक सही अंतिम परिणाम तक पहुंच सकता है, जबकि केवल एक टर्मिनल इनाम इस बारे में बहुत कम जानकारी देता है कि कौन से चरण मायने रखते हैं। मध्यवर्ती सत्यापनकर्ता प्रगति को अंतिम कैप्चर इवेंट से जोड़कर, LURE का लक्ष्य सत्यापित परिणाम के महत्व को त्यागे बिना एक सघन शिक्षण संकेत प्रदान करना है। सार रिपोर्ट करता है कि इस संयोजन ने लेखकों के प्रयोगों में उन्नत बेसलाइन से बेहतर प्रदर्शन किया है, लेकिन यह नहीं दिखाता है कि सुधार मुख्य रूप से अनुकूली कार्य चयन, सघन क्रेडिट, केएल स्थिरीकरण शब्द, या उनकी बातचीत से आया है।
सबसे मजबूत रिपोर्ट किया गया परिणाम यह है कि एकीकृत मॉडल ने तीन कार्य परिवारों में फैले नौ होल्ड-आउट बेंचमार्क में सभी प्रशिक्षित बेसलाइन की तुलना में उच्च समग्र आउट-ऑफ-डिस्ट्रीब्यूशन शून्य-शॉट सटीकता हासिल की। वह दावा, यदि प्रतिलिपि प्रस्तुत करने योग्य है, तो सुझाव देता है कि यह विधि केवल प्रशिक्षण के दौरान उपयोग किए गए वातावरण को अनुकूलित करने के बजाय स्थानांतरण में सुधार कर सकती है। फिर भी, "मजबूत समुच्चय" व्यावहारिक महत्व निर्धारित करने के लिए पर्याप्त नहीं है: सार कोई स्कोर, आत्मविश्वास अंतराल, प्रति-बेंचमार्क परिणाम, बड़े या अधिक गणना-गहन प्रणालियों के साथ तुलना, या आयोजित किए गए कार्यों का चयन कैसे किया गया था, इसके बारे में जानकारी नहीं देता है। इसलिए कार्य को एक शोध परिणाम के रूप में सबसे अच्छी तरह से समझा जाता है जिसके लिए आगे की परीक्षा की आवश्यकता होती है, न कि सबूत के रूप में कि शून्य-डेटा स्व-प्ले ने सामान्य प्रयोजन तर्क प्रशिक्षण को हल कर दिया है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
पेपर नौ पेज का arXiv प्रीप्रिंट है, और स्रोत केवल एक सार प्रदान करता है। रिपोर्ट किए गए लाभ के संख्यात्मक आकार, कम्प्यूटेशनल लागत, कार्य निर्माण, मॉडल आकार, बेंचमार्क संरचना, प्रतिलिपि प्रस्तुत करने योग्यता, और क्या विधि परीक्षण किए गए तीन वातावरणों और तीन कार्य परिवारों से परे स्थानांतरित होती है, के बारे में महत्वपूर्ण प्रश्न बने हुए हैं।
पहला सत्यापन चरण पूर्ण पेपर और उसकी प्रयोगात्मक तालिकाएँ हैं। पाठकों को तीन प्रमुख परिवारों की पहचान और आकार, तीन वातावरणों की सटीक परिभाषा, प्रशिक्षण कार्यों की संख्या और प्रकार, आधारभूत विधियों और उपयोग की गई गणना को देखना चाहिए। वे विवरण यह निर्धारित करेंगे कि क्या LURE के लाभ व्यापक रूप से उपयोगी प्रशिक्षण नुस्खा या किसी विशेष बेंचमार्क डिज़ाइन से कसकर जुड़े परिणाम को दर्शाते हैं। स्रोत अंश पुष्टि करता है कि पेपर में पाँच तालिकाएँ और पाँच आंकड़े हैं, लेकिन यह उनकी सामग्री प्रदान नहीं करता है।
प्रतिलिपि प्रस्तुत करने योग्यता एक और खुला मुद्दा है। आपूर्ति किया गया स्रोत यह नहीं बताता है कि कोड, कार्य जनरेटर, सत्यापनकर्ता कार्यान्वयन, चौकियाँ, या प्रशिक्षण डेटा उपलब्ध हैं या नहीं। क्योंकि विधि सह-विकसित चोर और पीछा करने वाले पर निर्भर करती है, इनाम स्केलिंग, रोलआउट नमूनाकरण, सामान्यीकरण या स्थिरीकरण में छोटे विकल्प परिणामों को प्रभावित कर सकते हैं। विभिन्न मॉडल परिवारों और सत्यापन योग्य वातावरणों में स्वतंत्र प्रतिकृति यह स्थापित करने में मदद करेगी कि रिपोर्ट किया गया व्यवहार मजबूत है या लेखकों के कार्यान्वयन पर निर्भर करता है।
अंत में, विधि के दायरे को पेपर में बताए गए नौ निर्धारित बेंचमार्क और तीन कार्य परिवारों से परे परीक्षण की आवश्यकता है। सत्यापन योग्य वातावरण उपयोगी होते हैं क्योंकि वे वस्तुनिष्ठ प्रतिक्रिया प्रदान करते हैं, लेकिन कई वास्तविक दुनिया के तर्क कार्यों में स्वचालित सत्यापनकर्ता का अभाव होता है या अस्पष्ट सफलता मानदंड होते हैं। यह अज्ञात है कि क्या LURE उन सेटिंग्स में उपयोगी कठिनाई पाठ्यक्रम बना सकता है, अभी भी कितनी मानवीय निगरानी की आवश्यकता होगी, और क्या चोरी करने वाला वास्तव में मूल्यवान चुनौतियों का उत्पादन करने के बजाय सत्यापनकर्ता में कमजोरियों का फायदा उठाना सीख सकता है। सार में विधि की प्रशिक्षण लागत, विलंबता, विफलता मोड और लंबे या कम संरचित कार्यों पर प्रदर्शन भी अज्ञात है।