समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

कोड्रिफ्ट ऑफ़लाइन सुदृढीकरण सीखने के लिए रचनात्मक कार्य क्षेत्रों का प्रस्ताव करता है

एक नया arXiv प्रीप्रिंट CoDrift पेश करता है, जो एक-चरणीय जनरेटिव नीति ढांचा है जो ऑफ़लाइन सुदृढीकरण सीखने के लिए व्यवहारिक अनुकूलता और मूल्य-प्राप्ति उद्देश्यों को जोड़ता है। लेखक ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन दोनों सेटिंग्स में 73 OGBench और D4RL कार्यों में सर्वोत्तम औसत रैंक की रिपोर्ट करते हैं।

6 min readRead the primary source
Source-page capture accompanying CoDrift proposes compositional action fields for offline reinforcement learning
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.23939
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
सामान्यीकरण
कोई मॉडल प्रशिक्षण सेट के बाहर नए, अनदेखे डेटा पर कितना अच्छा प्रदर्शन करता है।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

Xiewei Ni, Ruofeng Mei और Xiangyu Xu द्वारा एक arXiv प्रीप्रिंट CoDrift का प्रस्ताव करता है, जो प्रशिक्षण नीतियों के लिए एक विधि है जब एक AI सिस्टम को लगातार नए अनुभव एकत्र करने के बजाय एक निश्चित डेटासेट से सीखना चाहिए। यह विधि विभिन्न शिक्षण लक्ष्यों को एक्शन-स्पेस मोशन फ़ील्ड के रूप में प्रस्तुत करती है और उन्हें एक नीति क्षेत्र में संयोजित करती है। लेखकों का कहना है कि CoDrift का मूल्यांकन OGBench और D4RL बेंचमार्क से 73 कार्यों पर किया गया और ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन दोनों सेटिंग्स में सर्वोत्तम औसत रैंक हासिल की गई।

पेपर ऑफ़लाइन सुदृढीकरण सीखने में एक विशिष्ट समस्या से शुरू होता है: एक नीति को उन कार्यों का चयन करते समय एक निश्चित डेटासेट से सीखना चाहिए जो डेटासेट के व्यवहार समर्थन के साथ संगत और उच्च मूल्य से जुड़े हों। लेखक उन लक्ष्यों को एक्शन-स्पेस मोशन फ़ील्ड के रूप में पुनः प्रस्तुत करते हैं। इस फ़्रेमिंग में, प्रत्येक फ़ील्ड निर्दिष्ट करती है कि जेनरेट की गई कार्रवाइयां कैसे आगे बढ़नी चाहिए, जिससे उन उद्देश्यों के लिए एक सामान्य प्रतिनिधित्व तैयार होता है जिन्हें अन्यथा अलग से संभाला जा सकता है। जैसा कि सार में वर्णित है, यह रीफ़्रेमिंग पेपर का मुख्य वैचारिक योगदान है; स्रोत स्वतंत्र रूप से यह आकलन करने के लिए पर्याप्त विवरण प्रदान नहीं करता है कि फ़ील्ड को पैरामीटरयुक्त या अनुकूलित कैसे किया जाता है।

CoDrift तीन क्षेत्रों को जोड़ती है। एक सशर्त क्षेत्र का उद्देश्य राज्य-निर्भर व्यवहार संरचना को संरक्षित करना है। एक सीमांत क्षेत्र राज्यों में कार्यों को पूल करता है और इसे निरंतर-नियंत्रण ऑफ़लाइन सुदृढीकरण सीखने के एकल-सकारात्मक-नमूना शासन में अधिक स्थिर जेनरेटर सिग्नल प्रदान करने के रूप में वर्णित किया गया है। एक मान फ़ील्ड उत्पन्न गतिविधियों को उच्च-मूल्य वाले क्षेत्रों की ओर ले जाता है। फिर लेखक इन क्षेत्रों को एक एकीकृत नीति क्षेत्र में बनाते हैं, जो एक स्टोकेस्टिक जनरेटर में समाहित हो जाता है। तैनाती के समय, वह जनरेटर एक फॉरवर्ड पास के साथ एक क्रिया उत्पन्न करता है।

सार वास्तुकला, प्रशिक्षण अवधि, हार्डवेयर, डेटासेट आकार या अनुमान विलंबता निर्दिष्ट नहीं करता है। स्रोत के अनुसार, मूल्यांकन में OGBench और D4RL से लिए गए 73 कार्य शामिल हैं। लेखकों की रिपोर्ट है कि CoDrift अत्याधुनिक तरीकों से अनुकूल रूप से तुलना करता है और ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन दोनों सेटिंग्स में सर्वोत्तम औसत रैंक प्राप्त करता है। वे कथन पेपर के लेखकों द्वारा किए गए दावे हैं। स्रोत तुलना विधियों की पहचान नहीं करता है, व्यक्तिगत कार्यों के लिए संख्यात्मक प्रदर्शन नहीं देता है, लाभ का आकार नहीं बताता है, या अनिश्चितता उपायों की रिपोर्ट नहीं करता है।

इसलिए यह परिणाम को एक बेंचमार्क दावे के रूप में वर्णित करने का समर्थन करता है, लेकिन आम तौर पर ऑफ़लाइन सुदृढीकरण सीखने के बारे में एक स्थापित निष्कर्ष के रूप में नहीं। पेपर arXiv की कंप्यूटर-विज्ञान मशीन-लर्निंग श्रेणी में सूचीबद्ध है और रोबोटिक्स को एक विषय क्षेत्र के रूप में भी पहचानता है। इसे 25 अगस्त, 2026 को 00:54:59 यूटीसी पर प्रस्तुत किया गया था, इसे वर्तमान समाचार विंडो के अंदर रखा गया था। स्रोत इसे arXiv प्रीप्रिंट के संस्करण एक के रूप में पहचानता है। यह किसी सहकर्मी-समीक्षित स्थल पर स्वीकृति, स्वतंत्र प्रतिकृति, सार्वजनिक सॉफ़्टवेयर या वास्तविक रोबोटिक प्रणाली में तैनाती का संकेत नहीं देता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

ऑफ़लाइन सुदृढीकरण सीखना तब उपयोगी होता है जब नए इंटरैक्शन एकत्र करना महंगा, जोखिम भरा या अनुपलब्ध हो सकता है, लेकिन एक नीति को बेहतर कार्यों का पक्ष लेते हुए अभी भी अपने डेटासेट में दर्शाए गए व्यवहार के काफी करीब रहना होगा। CoDrift सीधे उस तनाव को लक्षित करता है। इसका सिंगल-फ़ॉरवर्ड-पास परिनियोजन डिज़ाइन सीखी गई नीति का उपयोग करने की रनटाइम जटिलता को भी कम कर सकता है, हालांकि स्रोत रिपोर्ट किए गए बेंचमार्क के बाहर विधि की कम्प्यूटेशनल लागत या व्यावहारिक लाभ स्थापित नहीं करता है।

CoDrift की व्यावहारिक चुनौती दो प्रतिस्पर्धी आवश्यकताओं को संतुलित करने की आवश्यकता है। ऐतिहासिक डेटा से प्रशिक्षित नीति को उन कार्यों में भटकने से बचना चाहिए जिनके लिए डेटासेट कम समर्थन प्रदान करता है, जबकि अभी भी उन कार्यों को प्राथमिकता देना चाहिए जो सीखने की प्रणाली बेहतर होने का अनुमान लगाती है। पेपर का फ़ील्ड-रचना दृष्टिकोण दोनों आवश्यकताओं को एक ही एक्शन-स्पेस भाषा में व्यक्त करने के लिए डिज़ाइन किया गया है। यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो इससे शोधकर्ताओं को ऑफ़लाइन नीति सीखने में व्यवहार संबंधी बाधाओं और मूल्य अनुकूलन को संयोजित करने का अधिक सीधा तरीका मिल सकता है।

प्रस्तावित सीमांत क्षेत्र विशेष रूप से लेखकों द्वारा एकल-सकारात्मक-नमूना शासन के रूप में वर्णित सेटिंग के लिए प्रासंगिक है। सार कहता है कि यह अधिक स्थिर जेनरेटर सिग्नल प्रदान करने के लिए राज्यों में क्रियाओं को पूल करता है। वह डिज़ाइन मायने रख सकता है जहां राज्य-विशिष्ट डेटा विरल है, लेकिन स्रोत स्थिरता में सुधार की मात्रा निर्धारित नहीं करता है या यह नहीं दिखाता है कि कौन से कार्यों से सबसे अधिक लाभ होता है। यह यह भी स्थापित नहीं करता है कि राज्यों में पूलिंग अवांछित कार्रवाइयों का परिचय देती है या किसी कार्रवाई और उस स्थिति के बीच संबंध को कमजोर करती है जिसमें इसे देखा गया था।

एक-चरणीय परिनियोजन दावा संभावित रूप से उपयोगी परिचालन संपत्ति प्रदान करता है। एक स्टोकेस्टिक जनरेटर जो एकल फॉरवर्ड पास के साथ एक क्रिया उत्पन्न करता है, उन प्रणालियों के लिए निष्पादन पथ को सरल बना सकता है जिन्हें बार-बार निर्णय लेने की आवश्यकता होती है। हालाँकि, स्रोत कोई विलंबता माप, स्मृति आवश्यकताएँ, ऊर्जा अनुमान या प्रतिस्पर्धी विधियों द्वारा उपयोग की जाने वाली अनुमान प्रक्रियाओं के साथ तुलना नहीं देता है। एक भी फ़ॉरवर्ड पास, अपने आप में, यह प्रदर्शित नहीं करता है कि परिणामी क्रियाएं वास्तविक वातावरण में निगरानी के लिए अधिक सुरक्षित, अधिक सटीक या आसान हैं।

रिपोर्ट किया गया मूल्यांकन कार्य गणना में व्यापक है, जिसमें 73 ओजीबेंच और डी4आरएल कार्य और दो सेटिंग्स शामिल हैं: ऑफ़लाइन और ऑफ़लाइन-से-ऑनलाइन। वह चौड़ाई एक कार्य पर प्रदर्शन की तुलना में परिणाम को अधिक जानकारीपूर्ण बनाती है, लेकिन बेंचमार्क चौड़ाई वास्तविक दुनिया की प्रभावशीलता के प्रमाण के समान नहीं है। स्रोत परिवेश, डेटा-संग्रह नीतियों, ऑफ़लाइन-से-ऑनलाइन प्रोटोकॉल या विफलता के परिणामों का वर्णन नहीं करता है। यह यह भी नहीं दिखाता है कि सर्वोत्तम औसत रैंक लगातार सुधारों को दर्शाता है या कम संख्या में मजबूत परिणामों को दर्शाता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

केंद्रीय साक्ष्य लेखकों का बेंचमार्क दावा है, स्वतंत्र रूप से सत्यापित परिणाम नहीं: स्रोत कोई कार्य-दर-कार्य स्कोर, तुलना तालिका, सांख्यिकीय परीक्षण या पृथक्करण परिणाम प्रदान नहीं करता है। यह यह भी नहीं बताता है कि कोड या प्रशिक्षित मॉडल उपलब्ध हैं या नहीं, क्या काम की सहकर्मी समीक्षा हुई है, या विधि डेटासेट शिफ्ट के तहत या भौतिक प्रणालियों में कैसा प्रदर्शन करती है। आगे की जांच में प्रतिलिपि प्रस्तुत करने योग्यता, आधारभूत चयन, विफलता के मामलों और व्यवहार सुरक्षा और मूल्य अनुकूलन के बीच व्यापार पर ध्यान केंद्रित किया जाना चाहिए।

देखने लायक पहला मुद्दा प्रतिलिपि प्रस्तुत करने योग्यता है। स्रोत यह नहीं बताता है कि CoDrift का कोड, कॉन्फ़िगरेशन फ़ाइलें, डेटासेट या प्रशिक्षित नीतियां उपलब्ध हैं या नहीं। स्वतंत्र शोधकर्ताओं को संपूर्ण बेंचमार्क प्रोटोकॉल के साथ उन सामग्रियों की आवश्यकता होगी, ताकि लेखकों के सर्वोत्तम औसत रैंक के दावे की जांच की जा सके और यह निर्धारित किया जा सके कि कार्यान्वयन विकल्प वास्तव में परिणाम को प्रभावित करते हैं या नहीं। पेपर के संस्करण-एक की स्थिति यह भी खुली है कि बाद के संशोधनों से पद्धति या परिणाम बदलेंगे या नहीं।

दूसरा मुद्दा अत्याधुनिक तरीकों से तुलना के पीछे का सबूत है। सार आधार रेखाओं को सूचीबद्ध नहीं करता है, प्रति-कार्य रैंकिंग की रिपोर्ट नहीं करता है या सांख्यिकीय महत्व प्रदान नहीं करता है। अनुवर्ती कवरेज में पूरे पेपर की तालिकाओं और एब्लेशन की तलाश होनी चाहिए, जिसमें ऐसे परीक्षण भी शामिल हैं जो सशर्त, सीमांत या मूल्य फ़ील्ड को व्यक्तिगत रूप से हटा देते हैं। उन तुलनाओं से स्पष्ट होगा कि क्या लाभ प्रस्तावित संरचना से, किसी विशेष जनरेटर से या प्रशिक्षण और मूल्यांकन प्रक्रियाओं में अंतर से आता है।

तीसरा मुद्दा सुरक्षा और सामान्यीकरण समझौता है। CoDrift को एक निश्चित डेटासेट के साथ अनुकूलता और उच्च-मूल्य वाली कार्रवाइयों की ओर बढ़ने के लिए डिज़ाइन किया गया है, लेकिन स्रोत यह नहीं बताता है कि जब डेटासेट में त्रुटियां, संकीर्ण कवरेज या भ्रामक उच्च-मूल्य अनुमान होते हैं तो यह कैसे व्यवहार करता है। यह वितरण बदलाव, दुर्लभ स्थिति या अप्रत्याशित इनपुट के तहत प्रदर्शन की रिपोर्ट भी नहीं करता है। भौतिक रोबोट या अन्य परिणामी प्रणालियों में उपयोग के लिए बेंचमार्क परिणामों को साक्ष्य के रूप में मानने से पहले ये सीमाएं विशेष रूप से महत्वपूर्ण हैं।

अंत में, फ़ील्ड को पेपर के अपने दावे से परे सबूतों पर नज़र रखनी चाहिए: स्वतंत्र प्रतिकृतियां, सहकर्मी-समीक्षित मूल्यांकन, सार्वजनिक कार्यान्वयन और तैनाती से मिलती-जुलती सेटिंग्स में मूल्यांकन। गणना आवश्यकताओं, रनटाइम गति, विफलता मोड, विरल डेटा की मजबूती और रिपोर्ट किए गए ऑफ़लाइन-से-ऑनलाइन सुधार के अर्थ के बारे में महत्वपूर्ण अज्ञात बने हुए हैं। जब तक वे विवरण उपलब्ध नहीं होते, CoDrift को इसके लेखकों द्वारा रिपोर्ट किए गए बेंचमार्क परिणामों के साथ एक आशाजनक शोध प्रस्ताव के रूप में समझा जाता है, न कि एक मान्य उत्पादन तकनीक के रूप में।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?