क्या हुआ?
शोधकर्ता यू हान और तियानवेन कियान ने WM-R1 पेश किया, जो विश्व मॉडल के साथ मोबाइल ग्राफिकल-यूजर-इंटरफ़ेस एजेंटों को प्रशिक्षित करने के लिए एक सुदृढीकरण-शिक्षण ढांचा है। पेपर में कहा गया है कि सिस्टम सभी प्रशिक्षण रोलआउट के दौरान मॉडल-जनित राज्य परिवर्तनों के साथ वास्तविक एंड्रॉइड वातावरण को प्रतिस्थापित करता है, जिससे एजेंट को एक सिम्युलेटेड वातावरण में कार्यों का अभ्यास करने की अनुमति मिलती है।
27 अगस्त, 2026 को प्रस्तुत एक arXiv पेपर WM-R1 प्रस्तुत करता है, जिसे इसके लेखक मोबाइल GUI एजेंटों के लिए सुदृढीकरण-शिक्षण ढांचे के रूप में वर्णित करते हैं। प्रत्यक्ष विषय एक एआई प्रशिक्षण पद्धति है: इसे एजेंटों को क्रियाओं का चयन करके, परिणामी स्थितियों का अवलोकन करके और पुरस्कारों के विरुद्ध व्यवहार को अनुकूलित करके मोबाइल प्लेटफ़ॉर्म पर ग्राफिकल इंटरफ़ेस संचालित करना सिखाने के लिए डिज़ाइन किया गया है। लेखक यू हान और तियानवेन कियान को पेपर के लेखक के रूप में पहचानते हैं और काम को कृत्रिम बुद्धिमत्ता अनुसंधान के अंतर्गत वर्गीकृत करते हैं।
केंद्रीय डिज़ाइन परिवर्तन सभी प्रशिक्षण रोलआउट के दौरान राज्य परिवर्तन के स्रोत के रूप में विश्व मॉडल का उपयोग करना है। जीयूआई एजेंटों के लिए पारंपरिक सुदृढीकरण-शिक्षण सेटअप में, प्रशिक्षण प्रणाली एक वास्तविक वातावरण, जैसे एंड्रॉइड डिवाइस या एमुलेटर के साथ बार-बार इंटरैक्ट करती है। इसके बजाय WM-R1 प्रशिक्षण लूप के अंदर उस वातावरण को एक सीखे हुए विश्व मॉडल से बदल देता है जो भविष्यवाणी करता है कि किसी कार्रवाई के बाद क्या हो सकता है। सूत्र का कहना है कि इससे प्रशिक्षण के दौरान वास्तविक-पर्यावरण संपर्क की आवश्यकता दूर हो जाती है; यह स्थापित नहीं करता है कि परिणामी एजेंट को कभी भी वास्तविक-डिवाइस परीक्षण या परिनियोजन सुरक्षा उपायों की आवश्यकता नहीं होती है।
यह ढाँचा एजेंट की तर्क प्रक्रिया के अंदर विश्व मॉडलों को भी रखता है। अंतिम कार्रवाई का चयन करने से पहले, एजेंट उम्मीदवार की कार्रवाई के परिणामों के बारे में तर्क करने के लिए मॉडल का उपयोग कर सकता है। घोषित उद्देश्य एजेंट को किसी ऑपरेशन के लिए प्रतिबद्ध होने से पहले संभावित अगले राज्यों का मूल्यांकन करने देना है, एक ऐसा दृष्टिकोण जो उन कार्यों के लिए उपयोगी हो सकता है जिनमें गलत टैप, नेविगेशन विकल्प, या डेटा प्रविष्टि चरण महंगा है। स्रोत यह निर्धारित करने के लिए पर्याप्त विवरण प्रदान नहीं करता है कि मॉडल जीयूआई स्थिति का प्रतिनिधित्व कैसे करता है, कितने उम्मीदवार कार्यों पर विचार किया जाता है, या भविष्यवाणी त्रुटियां निर्णयों को कैसे प्रभावित करती हैं।
प्रशिक्षण दक्षता के लिए, लेखकों का कहना है कि WM-R1 विश्व मॉडलों पर आधारित बड़े पैमाने पर समानांतर और चरण-स्तरीय-दानेदार प्रक्षेपवक्र पीढ़ी का समर्थन करता है। वे चुनौतीपूर्ण मोबाइल जीयूआई कार्यों को कवर करने वाले 2,000-कार्य डेटासेट की भी रिपोर्ट करते हैं। ढांचा कई आयामों के साथ नियम-आधारित इनाम का उपयोग करता है: कार्य सफलता, प्रक्षेपवक्र दक्षता, और विश्व मॉडल का उपयोग। पेपर की रिपोर्ट है कि एंड्रॉइड मोबाइल बेंचमार्क पर प्रयोगों ने जीआरपीओ-केवल बेसलाइन और अनुमान-समय सिमुलेशन विधियों पर महत्वपूर्ण सुधार दिखाया है। वे लेखकों के रिपोर्ट किए गए परिणाम हैं, और स्रोत अंश में स्कोर, बेंचमार्क नाम, मॉडल आकार, हार्डवेयर आवश्यकताएं या तुलना प्रोटोकॉल के बारे में विवरण शामिल नहीं हैं।
यह क्यों मायने रखता है?
यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो दृष्टिकोण बड़ी संख्या में वास्तविक-डिवाइस इंटरैक्शन एकत्र करने से जुड़ी लागत और अस्थिरता को कम कर सकता है। यह जीयूआई-एजेंट प्रशिक्षण को अधिक समानांतर और सुव्यवस्थित बनाने का एक तरीका भी प्रदान करता है, जबकि एजेंटों को कार्रवाई करने से पहले उनके संभावित परिणामों पर विचार करने का अवसर देता है।
वास्तविक इंटरैक्शन के माध्यम से जीयूआई एजेंटों को प्रशिक्षित करना महंगा हो सकता है क्योंकि प्रत्येक क्रिया को निष्पादित करने, रीसेट करने और रिकॉर्ड करने के लिए एक वातावरण की आवश्यकता होती है। यह तब भी अस्थिर हो सकता है जब वातावरण धीमा, स्थिर या समानांतर में चलाना मुश्किल हो। WM-R1 द्वारा उत्पन्न राज्य परिवर्तन का प्रस्तावित उपयोग सीधे उस बाधा को संबोधित करता है। यदि इसके विश्व मॉडल पर्याप्त रूप से सटीक हैं, तो शोधकर्ता कम परिचालन लागत पर अधिक प्रक्षेप पथ का उत्पादन कर सकते हैं और एजेंटों को अधिक तेज़ी से परिष्कृत करने के लिए उनका उपयोग कर सकते हैं।
यह दृष्टिकोण जीयूआई-एजेंट प्रशिक्षण के पैमाने और संकल्प को भी बदल सकता है। चरण-स्तरीय प्रक्षेपवक्र पीढ़ी का मतलब है कि सिस्टम केवल संपूर्ण कार्य को सीखने की इकाई के रूप में मानने के बजाय व्यक्तिगत निर्णयों पर ध्यान केंद्रित कर सकता है। बड़े पैमाने पर समानांतरीकरण एक साथ कई काल्पनिक क्रिया अनुक्रमों का पता लगाने की अनुमति दे सकता है। साथ में, उन सुविधाओं से एजेंटों को लंबे, शाखाओं वाले वर्कफ़्लो पर प्रशिक्षित करना आसान हो सकता है जैसे सेटिंग्स को नेविगेट करना, फॉर्म पूरा करना, या मल्टी-स्टेप मोबाइल एप्लिकेशन के माध्यम से आगे बढ़ना, हालांकि स्रोत किसी विशेष उपभोक्ता या सार्वजनिक-सेवा वर्कफ़्लो में प्रदर्शन प्रदर्शित नहीं करता है।
एजेंट की तर्क प्रक्रिया में एक विश्व मॉडल को शामिल करना दक्षता से परे संभावित रूप से महत्वपूर्ण है। एक जीयूआई एजेंट जो कार्य करने से पहले संभावित परिणामों का मूल्यांकन करता है, वह वर्तमान स्क्रीन स्थिति पर प्रतिक्रिया करने वाले एजेंट की तुलना में अपरिवर्तनीय या अक्षम विकल्पों से बचने के लिए बेहतर स्थिति में हो सकता है। रिपोर्ट की गई इनाम संरचना अकेले कार्य समापन को अनुकूलित करने के बजाय तीन उद्देश्यों को संतुलित करने का भी प्रयास करती है। यह अनावश्यक रूप से लंबे प्रक्षेप पथ या व्यवहार को हतोत्साहित कर सकता है जो सिम्युलेटर का खराब उपयोग करते समय सफल होता है। पेपर यह नहीं दिखाता है कि क्या वे उद्देश्य सुरक्षित या उपयोगी बातचीत के मानवीय निर्णयों के अनुरूप हैं।
व्यापक व्यावहारिक महत्व अनुकरण और वास्तविकता के बीच के अंतर पर निर्भर करता है। एक विश्व मॉडल प्रचुर प्रशिक्षण डेटा उत्पन्न कर सकता है, लेकिन गलत भविष्यवाणियाँ एक एजेंट को ऐसी रणनीतियाँ सिखा सकती हैं जो केवल मॉडल के अंदर ही काम करती हैं। मोबाइल इंटरफ़ेस बदलते हैं, एप्लिकेशन में अप्रत्याशित स्थितियाँ होती हैं, और वास्तविक डिवाइस समय, अनुमति, नेटवर्क और रेंडरिंग व्यवहार पेश कर सकते हैं जिसे एक सिम्युलेटर कैप्चर नहीं कर सकता है। इसलिए, पेपर में रिपोर्ट किए गए बेंचमार्क सुधार को एक शोध दिशा के साक्ष्य के रूप में समझा जाना चाहिए, न कि इस बात का प्रमाण कि WM-R1 लोगों के उपकरणों या खातों पर बिना पर्यवेक्षित उपयोग के लिए तैयार है।
स्रोत महत्वपूर्ण तुलनाओं को भी अनसुलझा छोड़ देता है। यह कहता है कि WM-R1 ने GRPO-केवल और अनुमान-समय सिमुलेशन बेसलाइन से बेहतर प्रदर्शन किया है, लेकिन आपूर्ति किए गए पाठ में कोई संख्यात्मक परिणाम नहीं देता है। यह निर्दिष्ट नहीं करता है कि कोड, डेटासेट, प्रशिक्षित मॉडल, विश्व मॉडल, या मूल्यांकन वातावरण सार्वजनिक रूप से उपलब्ध हैं या नहीं, यह कहने के अलावा कि कोड arXiv-लिंक्ड यूआरएल के माध्यम से उपलब्ध है। परिणाम कितना सामान्य है यह स्थापित करने के लिए स्वतंत्र प्रतिकृति, व्यापक कार्य कवरेज और अदृश्य अनुप्रयोगों पर परीक्षण की आवश्यकता होगी।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
मुख्य प्रश्न यह हैं कि विश्व मॉडल वास्तविक एंड्रॉइड व्यवहार को कितनी सटीकता से दर्शाते हैं, रिपोर्ट किए गए लाभ अपरिचित ऐप्स और उपकरणों में कितनी अच्छी तरह स्थानांतरित होते हैं, और क्या सिमुलेशन वास्तविकता से अलग होने पर विधि विश्वसनीय रहती है। स्रोत कार्य को arXiv प्रीप्रिंट के रूप में पहचानता है, इसलिए इसके दावे यहां स्वतंत्र रूप से स्थापित नहीं किए गए हैं।
पहला सत्यापन लक्ष्य पूर्ण पेपर और उसका कार्यान्वयन है। पाठकों को महत्वपूर्ण सुधार के दावे के पीछे सटीक एंड्रॉइड बेंचमार्क, कार्य परिभाषाएँ, बेसलाइन कॉन्फ़िगरेशन, मूल्यांकन मेट्रिक्स और सांख्यिकीय परिणाम देखना चाहिए। यह भी मायने रखेगा कि क्या तुलना समतुल्य गणना का उपयोग करती है और क्या विश्व-मॉडल प्रशिक्षण लागत दक्षता विश्लेषण में शामिल है।
दूसरा मुद्दा मॉडल निष्ठा का है। भविष्य के मूल्यांकन में यह मापना चाहिए कि कितनी बार पूर्वानुमानित जीयूआई बदलाव वास्तविक परिणामों से मेल खाते हैं, जिसमें लेआउट, अनुमतियाँ, नेटवर्क प्रतिक्रियाएँ, विलंबता और एप्लिकेशन स्थिति में परिवर्तन शामिल हैं। ऐसे परीक्षण जो जानबूझकर अपरिचित ऐप्स या इंटरफ़ेस परिवर्तन पेश करते हैं, यह प्रकट करने में मदद करेंगे कि क्या एजेंट ने सामान्य इंटरैक्शन रणनीतियों को सीखा है या मुख्य रूप से प्रशिक्षण वातावरण में नियमितताओं का फायदा उठाया है।
2,000-कार्य डेटासेट की भूमिका भी जांच के योग्य है। इसकी संरचना, लाइसेंसिंग, भौगोलिक और भाषाई कवरेज, कार्य कठिनाई और मूल्यांकन कार्यों के साथ ओवरलैप रिपोर्ट किए गए परिणामों को प्रभावित कर सकते हैं। शोधकर्ताओं को यह निर्धारित करना चाहिए कि क्या डेटासेट सामान्य मोबाइल उपयोग का प्रतिनिधित्व करता है या बेंचमार्क-शैली क्रियाओं का एक संकीर्ण संग्रह दर्शाता है। कार्यों और मूल्यांकन स्क्रिप्टों तक प्रतिलिपि प्रस्तुत करने योग्य पहुंच से निष्कर्षों का आकलन करना आसान हो जाएगा।
सुरक्षा और तैनाती सीमाएँ एक अन्य निगरानी बिंदु हैं। प्रशिक्षण के दौरान वास्तविक वातावरण को बदलने से प्रयोग के दौरान परिचालन जोखिम कम हो सकता है, लेकिन यह तैनाती के जोखिम को दूर नहीं करता है। वास्तविक इंटरफ़ेस संचालित करने वाले एजेंट संदेश भेज सकते हैं, सेटिंग्स बदल सकते हैं, खरीदारी कर सकते हैं, निजी जानकारी उजागर कर सकते हैं, या अन्य परिणामी कार्रवाई कर सकते हैं। आपूर्ति किया गया स्रोत अनुमति नियंत्रण, मानव पुष्टि, रोलबैक तंत्र, या विश्व-मॉडल त्रुटियों के खिलाफ सुरक्षा का वर्णन नहीं करता है, इसलिए वे सुरक्षा उपाय अज्ञात रहते हैं।
अंत में, WM-R1 की तुलना अन्य दृष्टिकोणों से की जानी चाहिए जो एजेंटों के लिए सिमुलेशन, योजना और सुदृढीकरण सीखने को जोड़ते हैं। पेपर खुद को मोबाइल जीयूआई एजेंटों के लिए अपनी तरह का पहला ढांचा कहता है, लेकिन यह आपूर्ति किए गए स्रोत में स्वतंत्र रूप से सत्यापित ऐतिहासिक खोज के बजाय एक लेखक का दावा है। सबसे उपयोगी अनुवर्ती साक्ष्य स्वतंत्र प्रतिकृति, नए उपकरणों और अनुप्रयोगों पर मूल्यांकन और सिमुलेशन-आधारित प्रशिक्षण के बाद वास्तविक दुनिया की विश्वसनीयता का माप होगा।