क्या हुआ?
Xiewei Ni, Ruofeng Mei और Xiangyu Xu द्वारा एक arXiv प्रीप्रिंट CoDrift का प्रस्ताव करता है, जो प्रशिक्षण नीतियों के लिए एक विधि है जब एक AI सिस्टम को लगातार नए अनुभव एकत्र करने के बजाय एक निश्चित डेटासेट से सीखना चाहिए। यह विधि विभिन्न शिक्षण लक्ष्यों को एक्शन-स्पेस मोशन फ़ील्ड के रूप में प्रस्तुत करती है और उन्हें एक नीति क्षेत्र में संयोजित करती है। लेखकों का कहना है कि CoDrift का मूल्यांकन OGBench और D4RL बेंचमार्क से 73 कार्यों पर किया गया और ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन दोनों सेटिंग्स में सर्वोत्तम औसत रैंक हासिल की गई।
पेपर ऑफ़लाइन सुदृढीकरण सीखने में एक विशिष्ट समस्या से शुरू होता है: एक नीति को उन कार्यों का चयन करते समय एक निश्चित डेटासेट से सीखना चाहिए जो डेटासेट के व्यवहार समर्थन के साथ संगत और उच्च मूल्य से जुड़े हों। लेखक उन लक्ष्यों को एक्शन-स्पेस मोशन फ़ील्ड के रूप में पुनः प्रस्तुत करते हैं। इस फ़्रेमिंग में, प्रत्येक फ़ील्ड निर्दिष्ट करती है कि जेनरेट की गई कार्रवाइयां कैसे आगे बढ़नी चाहिए, जिससे उन उद्देश्यों के लिए एक सामान्य प्रतिनिधित्व तैयार होता है जिन्हें अन्यथा अलग से संभाला जा सकता है। जैसा कि सार में वर्णित है, यह रीफ़्रेमिंग पेपर का मुख्य वैचारिक योगदान है; स्रोत स्वतंत्र रूप से यह आकलन करने के लिए पर्याप्त विवरण प्रदान नहीं करता है कि फ़ील्ड को पैरामीटरयुक्त या अनुकूलित कैसे किया जाता है।
CoDrift तीन क्षेत्रों को जोड़ती है। एक सशर्त क्षेत्र का उद्देश्य राज्य-निर्भर व्यवहार संरचना को संरक्षित करना है। एक सीमांत क्षेत्र राज्यों में कार्यों को पूल करता है और इसे निरंतर-नियंत्रण ऑफ़लाइन सुदृढीकरण सीखने के एकल-सकारात्मक-नमूना शासन में अधिक स्थिर जेनरेटर सिग्नल प्रदान करने के रूप में वर्णित किया गया है। एक मान फ़ील्ड उत्पन्न गतिविधियों को उच्च-मूल्य वाले क्षेत्रों की ओर ले जाता है। फिर लेखक इन क्षेत्रों को एक एकीकृत नीति क्षेत्र में बनाते हैं, जो एक स्टोकेस्टिक जनरेटर में समाहित हो जाता है। तैनाती के समय, वह जनरेटर एक फॉरवर्ड पास के साथ एक क्रिया उत्पन्न करता है।
सार वास्तुकला, प्रशिक्षण अवधि, हार्डवेयर, डेटासेट आकार या अनुमान विलंबता निर्दिष्ट नहीं करता है। स्रोत के अनुसार, मूल्यांकन में OGBench और D4RL से लिए गए 73 कार्य शामिल हैं। लेखकों की रिपोर्ट है कि CoDrift अत्याधुनिक तरीकों से अनुकूल रूप से तुलना करता है और ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन दोनों सेटिंग्स में सर्वोत्तम औसत रैंक प्राप्त करता है। वे कथन पेपर के लेखकों द्वारा किए गए दावे हैं। स्रोत तुलना विधियों की पहचान नहीं करता है, व्यक्तिगत कार्यों के लिए संख्यात्मक प्रदर्शन नहीं देता है, लाभ का आकार नहीं बताता है, या अनिश्चितता उपायों की रिपोर्ट नहीं करता है।
इसलिए यह परिणाम को एक बेंचमार्क दावे के रूप में वर्णित करने का समर्थन करता है, लेकिन आम तौर पर ऑफ़लाइन सुदृढीकरण सीखने के बारे में एक स्थापित निष्कर्ष के रूप में नहीं। पेपर arXiv की कंप्यूटर-विज्ञान मशीन-लर्निंग श्रेणी में सूचीबद्ध है और रोबोटिक्स को एक विषय क्षेत्र के रूप में भी पहचानता है। इसे 25 अगस्त, 2026 को 00:54:59 यूटीसी पर प्रस्तुत किया गया था, इसे वर्तमान समाचार विंडो के अंदर रखा गया था। स्रोत इसे arXiv प्रीप्रिंट के संस्करण एक के रूप में पहचानता है। यह किसी सहकर्मी-समीक्षित स्थल पर स्वीकृति, स्वतंत्र प्रतिकृति, सार्वजनिक सॉफ़्टवेयर या वास्तविक रोबोटिक प्रणाली में तैनाती का संकेत नहीं देता है।
यह क्यों मायने रखता है?
ऑफ़लाइन सुदृढीकरण सीखना तब उपयोगी होता है जब नए इंटरैक्शन एकत्र करना महंगा, जोखिम भरा या अनुपलब्ध हो सकता है, लेकिन एक नीति को बेहतर कार्यों का पक्ष लेते हुए अभी भी अपने डेटासेट में दर्शाए गए व्यवहार के काफी करीब रहना होगा। CoDrift सीधे उस तनाव को लक्षित करता है। इसका सिंगल-फ़ॉरवर्ड-पास परिनियोजन डिज़ाइन सीखी गई नीति का उपयोग करने की रनटाइम जटिलता को भी कम कर सकता है, हालांकि स्रोत रिपोर्ट किए गए बेंचमार्क के बाहर विधि की कम्प्यूटेशनल लागत या व्यावहारिक लाभ स्थापित नहीं करता है।
CoDrift की व्यावहारिक चुनौती दो प्रतिस्पर्धी आवश्यकताओं को संतुलित करने की आवश्यकता है। ऐतिहासिक डेटा से प्रशिक्षित नीति को उन कार्यों में भटकने से बचना चाहिए जिनके लिए डेटासेट कम समर्थन प्रदान करता है, जबकि अभी भी उन कार्यों को प्राथमिकता देना चाहिए जो सीखने की प्रणाली बेहतर होने का अनुमान लगाती है। पेपर का फ़ील्ड-रचना दृष्टिकोण दोनों आवश्यकताओं को एक ही एक्शन-स्पेस भाषा में व्यक्त करने के लिए डिज़ाइन किया गया है। यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो इससे शोधकर्ताओं को ऑफ़लाइन नीति सीखने में व्यवहार संबंधी बाधाओं और मूल्य अनुकूलन को संयोजित करने का अधिक सीधा तरीका मिल सकता है।
प्रस्तावित सीमांत क्षेत्र विशेष रूप से लेखकों द्वारा एकल-सकारात्मक-नमूना शासन के रूप में वर्णित सेटिंग के लिए प्रासंगिक है। सार कहता है कि यह अधिक स्थिर जेनरेटर सिग्नल प्रदान करने के लिए राज्यों में क्रियाओं को पूल करता है। वह डिज़ाइन मायने रख सकता है जहां राज्य-विशिष्ट डेटा विरल है, लेकिन स्रोत स्थिरता में सुधार की मात्रा निर्धारित नहीं करता है या यह नहीं दिखाता है कि कौन से कार्यों से सबसे अधिक लाभ होता है। यह यह भी स्थापित नहीं करता है कि राज्यों में पूलिंग अवांछित कार्रवाइयों का परिचय देती है या किसी कार्रवाई और उस स्थिति के बीच संबंध को कमजोर करती है जिसमें इसे देखा गया था।
एक-चरणीय परिनियोजन दावा संभावित रूप से उपयोगी परिचालन संपत्ति प्रदान करता है। एक स्टोकेस्टिक जनरेटर जो एकल फॉरवर्ड पास के साथ एक क्रिया उत्पन्न करता है, उन प्रणालियों के लिए निष्पादन पथ को सरल बना सकता है जिन्हें बार-बार निर्णय लेने की आवश्यकता होती है। हालाँकि, स्रोत कोई विलंबता माप, स्मृति आवश्यकताएँ, ऊर्जा अनुमान या प्रतिस्पर्धी विधियों द्वारा उपयोग की जाने वाली अनुमान प्रक्रियाओं के साथ तुलना नहीं देता है। एक भी फ़ॉरवर्ड पास, अपने आप में, यह प्रदर्शित नहीं करता है कि परिणामी क्रियाएं वास्तविक वातावरण में निगरानी के लिए अधिक सुरक्षित, अधिक सटीक या आसान हैं।
रिपोर्ट किया गया मूल्यांकन कार्य गणना में व्यापक है, जिसमें 73 ओजीबेंच और डी4आरएल कार्य और दो सेटिंग्स शामिल हैं: ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन। वह चौड़ाई एक कार्य पर प्रदर्शन की तुलना में परिणाम को अधिक जानकारीपूर्ण बनाती है, लेकिन बेंचमार्क चौड़ाई वास्तविक दुनिया की प्रभावशीलता के प्रमाण के समान नहीं है। स्रोत परिवेश, डेटा-संग्रह नीतियों, ऑफ़लाइन-से-ऑनलाइन प्रोटोकॉल या विफलता के परिणामों का वर्णन नहीं करता है। यह यह भी नहीं दिखाता है कि सर्वोत्तम औसत रैंक लगातार सुधारों को दर्शाता है या कम संख्या में मजबूत परिणामों को दर्शाता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
केंद्रीय साक्ष्य लेखकों का बेंचमार्क दावा है, स्वतंत्र रूप से सत्यापित परिणाम नहीं: स्रोत कोई कार्य-दर-कार्य स्कोर, तुलना तालिका, सांख्यिकीय परीक्षण या पृथक्करण परिणाम प्रदान नहीं करता है। यह यह भी नहीं बताता है कि कोड या प्रशिक्षित मॉडल उपलब्ध हैं या नहीं, क्या काम की सहकर्मी समीक्षा हुई है, या विधि डेटासेट शिफ्ट के तहत या भौतिक प्रणालियों में कैसा प्रदर्शन करती है। आगे की जांच में प्रतिलिपि प्रस्तुत करने योग्यता, आधारभूत चयन, विफलता के मामलों और व्यवहार सुरक्षा और मूल्य अनुकूलन के बीच व्यापार पर ध्यान केंद्रित किया जाना चाहिए।
देखने लायक पहला मुद्दा प्रतिलिपि प्रस्तुत करने योग्यता है। स्रोत यह नहीं बताता है कि CoDrift का कोड, कॉन्फ़िगरेशन फ़ाइलें, डेटासेट या प्रशिक्षित नीतियां उपलब्ध हैं या नहीं। स्वतंत्र शोधकर्ताओं को संपूर्ण बेंचमार्क प्रोटोकॉल के साथ उन सामग्रियों की आवश्यकता होगी, ताकि लेखकों के सर्वोत्तम औसत रैंक के दावे की जांच की जा सके और यह निर्धारित किया जा सके कि कार्यान्वयन विकल्प वास्तव में परिणाम को प्रभावित करते हैं या नहीं। पेपर के संस्करण-एक की स्थिति यह भी खुली है कि बाद के संशोधनों से पद्धति या परिणाम बदलेंगे या नहीं।
दूसरा मुद्दा अत्याधुनिक तरीकों से तुलना के पीछे का सबूत है। सार आधार रेखाओं को सूचीबद्ध नहीं करता है, प्रति-कार्य रैंकिंग की रिपोर्ट नहीं करता है या सांख्यिकीय महत्व प्रदान नहीं करता है। अनुवर्ती कवरेज में पूरे पेपर की तालिकाओं और एब्लेशन की तलाश होनी चाहिए, जिसमें ऐसे परीक्षण भी शामिल हैं जो सशर्त, सीमांत या मूल्य फ़ील्ड को व्यक्तिगत रूप से हटा देते हैं। उन तुलनाओं से स्पष्ट होगा कि क्या लाभ प्रस्तावित संरचना से, किसी विशेष जनरेटर से या प्रशिक्षण और मूल्यांकन प्रक्रियाओं में अंतर से आता है।
तीसरा मुद्दा सुरक्षा और सामान्यीकरण समझौता है। CoDrift को एक निश्चित डेटासेट के साथ अनुकूलता और उच्च-मूल्य वाली कार्रवाइयों की ओर बढ़ने के लिए डिज़ाइन किया गया है, लेकिन स्रोत यह नहीं बताता है कि जब डेटासेट में त्रुटियां, संकीर्ण कवरेज या भ्रामक उच्च-मूल्य अनुमान होते हैं तो यह कैसे व्यवहार करता है। यह वितरण बदलाव, दुर्लभ स्थिति या अप्रत्याशित इनपुट के तहत प्रदर्शन की रिपोर्ट भी नहीं करता है। भौतिक रोबोट या अन्य परिणामी प्रणालियों में उपयोग के लिए बेंचमार्क परिणामों को साक्ष्य के रूप में मानने से पहले ये सीमाएं विशेष रूप से महत्वपूर्ण हैं।
अंत में, फ़ील्ड को पेपर के अपने दावे से परे सबूतों पर नज़र रखनी चाहिए: स्वतंत्र प्रतिकृतियां, सहकर्मी-समीक्षित मूल्यांकन, सार्वजनिक कार्यान्वयन और तैनाती से मिलती-जुलती सेटिंग्स में मूल्यांकन। गणना आवश्यकताओं, रनटाइम गति, विफलता मोड, विरल डेटा की मजबूती और रिपोर्ट किए गए ऑफ़लाइन-से-ऑनलाइन सुधार के अर्थ के बारे में महत्वपूर्ण अज्ञात बने हुए हैं। जब तक वे विवरण उपलब्ध नहीं होते, CoDrift को इसके लेखकों द्वारा रिपोर्ट किए गए बेंचमार्क परिणामों के साथ एक आशाजनक शोध प्रस्ताव के रूप में समझा जाता है, न कि एक मान्य उत्पादन तकनीक के रूप में।