समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

WM-R1 विश्व मॉडल के अंदर मोबाइल GUI एजेंटों को प्रशिक्षित करता है

एक नया arXiv प्रीप्रिंट WM-R1 का वर्णन करता है, जो एक सुदृढीकरण-शिक्षण ढांचा है जो मोबाइल GUI एजेंटों को वास्तविक एंड्रॉइड वातावरण तक बार-बार पहुंच के बजाय पूरी तरह से विश्व-मॉडल-जनित इंटरैक्शन के माध्यम से प्रशिक्षित करता है।

6 min readRead the primary source
Source-provided image accompanying WM-R1 trains mobile GUI agents inside world models
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.27508
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

कृत्रिम बुद्धिमत्ता (एआई)
बिल्डिंग सिस्टम का व्यापक क्षेत्र जो पैटर्न पहचान, तर्क, भाषा या निर्णय लेने की आवश्यकता वाले कार्य करता है।
सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

शोधकर्ता यू हान और तियानवेन कियान ने WM-R1 पेश किया, जो विश्व मॉडल के साथ मोबाइल ग्राफिकल-यूजर-इंटरफ़ेस एजेंटों को प्रशिक्षित करने के लिए एक सुदृढीकरण-शिक्षण ढांचा है। पेपर में कहा गया है कि सिस्टम सभी प्रशिक्षण रोलआउट के दौरान मॉडल-जनित राज्य परिवर्तनों के साथ वास्तविक एंड्रॉइड वातावरण को प्रतिस्थापित करता है, जिससे एजेंट को एक सिम्युलेटेड वातावरण में कार्यों का अभ्यास करने की अनुमति मिलती है।

27 अगस्त, 2026 को प्रस्तुत एक arXiv पेपर WM-R1 प्रस्तुत करता है, जिसे इसके लेखक मोबाइल GUI एजेंटों के लिए सुदृढीकरण-शिक्षण ढांचे के रूप में वर्णित करते हैं। प्रत्यक्ष विषय एक एआई प्रशिक्षण पद्धति है: इसे एजेंटों को क्रियाओं का चयन करके, परिणामी स्थितियों का अवलोकन करके और पुरस्कारों के विरुद्ध व्यवहार को अनुकूलित करके मोबाइल प्लेटफ़ॉर्म पर ग्राफिकल इंटरफ़ेस संचालित करना सिखाने के लिए डिज़ाइन किया गया है। लेखक यू हान और तियानवेन कियान को पेपर के लेखक के रूप में पहचानते हैं और काम को कृत्रिम बुद्धिमत्ता अनुसंधान के अंतर्गत वर्गीकृत करते हैं।

केंद्रीय डिज़ाइन परिवर्तन सभी प्रशिक्षण रोलआउट के दौरान राज्य परिवर्तन के स्रोत के रूप में विश्व मॉडल का उपयोग करना है। जीयूआई एजेंटों के लिए पारंपरिक सुदृढीकरण-शिक्षण सेटअप में, प्रशिक्षण प्रणाली एक वास्तविक वातावरण, जैसे एंड्रॉइड डिवाइस या एमुलेटर के साथ बार-बार इंटरैक्ट करती है। इसके बजाय WM-R1 प्रशिक्षण लूप के अंदर उस वातावरण को एक सीखे हुए विश्व मॉडल से बदल देता है जो भविष्यवाणी करता है कि किसी कार्रवाई के बाद क्या हो सकता है। सूत्र का कहना है कि इससे प्रशिक्षण के दौरान वास्तविक-पर्यावरण संपर्क की आवश्यकता दूर हो जाती है; यह स्थापित नहीं करता है कि परिणामी एजेंट को कभी भी वास्तविक-डिवाइस परीक्षण या परिनियोजन सुरक्षा उपायों की आवश्यकता नहीं होती है।

यह ढाँचा एजेंट की तर्क प्रक्रिया के अंदर विश्व मॉडलों को भी रखता है। अंतिम कार्रवाई का चयन करने से पहले, एजेंट उम्मीदवार की कार्रवाई के परिणामों के बारे में तर्क करने के लिए मॉडल का उपयोग कर सकता है। घोषित उद्देश्य एजेंट को किसी ऑपरेशन के लिए प्रतिबद्ध होने से पहले संभावित अगले राज्यों का मूल्यांकन करने देना है, एक ऐसा दृष्टिकोण जो उन कार्यों के लिए उपयोगी हो सकता है जिनमें गलत टैप, नेविगेशन विकल्प, या डेटा प्रविष्टि चरण महंगा है। स्रोत यह निर्धारित करने के लिए पर्याप्त विवरण प्रदान नहीं करता है कि मॉडल जीयूआई स्थिति का प्रतिनिधित्व कैसे करता है, कितने उम्मीदवार कार्यों पर विचार किया जाता है, या भविष्यवाणी त्रुटियां निर्णयों को कैसे प्रभावित करती हैं।

प्रशिक्षण दक्षता के लिए, लेखकों का कहना है कि WM-R1 विश्व मॉडलों पर आधारित बड़े पैमाने पर समानांतर और चरण-स्तरीय-दानेदार प्रक्षेपवक्र पीढ़ी का समर्थन करता है। वे चुनौतीपूर्ण मोबाइल जीयूआई कार्यों को कवर करने वाले 2,000-कार्य डेटासेट की भी रिपोर्ट करते हैं। ढांचा कई आयामों के साथ नियम-आधारित इनाम का उपयोग करता है: कार्य सफलता, प्रक्षेपवक्र दक्षता, और विश्व मॉडल का उपयोग। पेपर की रिपोर्ट है कि एंड्रॉइड मोबाइल बेंचमार्क पर प्रयोगों ने जीआरपीओ-केवल बेसलाइन और अनुमान-समय सिमुलेशन विधियों पर महत्वपूर्ण सुधार दिखाया है। वे लेखकों के रिपोर्ट किए गए परिणाम हैं, और स्रोत अंश में स्कोर, बेंचमार्क नाम, मॉडल आकार, हार्डवेयर आवश्यकताएं या तुलना प्रोटोकॉल के बारे में विवरण शामिल नहीं हैं।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो दृष्टिकोण बड़ी संख्या में वास्तविक-डिवाइस इंटरैक्शन एकत्र करने से जुड़ी लागत और अस्थिरता को कम कर सकता है। यह जीयूआई-एजेंट प्रशिक्षण को अधिक समानांतर और सुव्यवस्थित बनाने का एक तरीका भी प्रदान करता है, जबकि एजेंटों को कार्रवाई करने से पहले उनके संभावित परिणामों पर विचार करने का अवसर देता है।

वास्तविक इंटरैक्शन के माध्यम से जीयूआई एजेंटों को प्रशिक्षित करना महंगा हो सकता है क्योंकि प्रत्येक क्रिया को निष्पादित करने, रीसेट करने और रिकॉर्ड करने के लिए एक वातावरण की आवश्यकता होती है। यह तब भी अस्थिर हो सकता है जब वातावरण धीमा, स्थिर या समानांतर में चलाना मुश्किल हो। WM-R1 द्वारा उत्पन्न राज्य परिवर्तन का प्रस्तावित उपयोग सीधे उस बाधा को संबोधित करता है। यदि इसके विश्व मॉडल पर्याप्त रूप से सटीक हैं, तो शोधकर्ता कम परिचालन लागत पर अधिक प्रक्षेप पथ का उत्पादन कर सकते हैं और एजेंटों को अधिक तेज़ी से परिष्कृत करने के लिए उनका उपयोग कर सकते हैं।

यह दृष्टिकोण जीयूआई-एजेंट प्रशिक्षण के पैमाने और संकल्प को भी बदल सकता है। चरण-स्तरीय प्रक्षेपवक्र पीढ़ी का मतलब है कि सिस्टम केवल संपूर्ण कार्य को सीखने की इकाई के रूप में मानने के बजाय व्यक्तिगत निर्णयों पर ध्यान केंद्रित कर सकता है। बड़े पैमाने पर समानांतरीकरण एक साथ कई काल्पनिक क्रिया अनुक्रमों का पता लगाने की अनुमति दे सकता है। साथ में, उन सुविधाओं से एजेंटों को लंबे, शाखाओं वाले वर्कफ़्लो पर प्रशिक्षित करना आसान हो सकता है जैसे सेटिंग्स को नेविगेट करना, फॉर्म पूरा करना, या मल्टी-स्टेप मोबाइल एप्लिकेशन के माध्यम से आगे बढ़ना, हालांकि स्रोत किसी विशेष उपभोक्ता या सार्वजनिक-सेवा वर्कफ़्लो में प्रदर्शन प्रदर्शित नहीं करता है।

एजेंट की तर्क प्रक्रिया में एक विश्व मॉडल को शामिल करना दक्षता से परे संभावित रूप से महत्वपूर्ण है। एक जीयूआई एजेंट जो कार्य करने से पहले संभावित परिणामों का मूल्यांकन करता है, वह वर्तमान स्क्रीन स्थिति पर प्रतिक्रिया करने वाले एजेंट की तुलना में अपरिवर्तनीय या अक्षम विकल्पों से बचने के लिए बेहतर स्थिति में हो सकता है। रिपोर्ट की गई इनाम संरचना अकेले कार्य समापन को अनुकूलित करने के बजाय तीन उद्देश्यों को संतुलित करने का भी प्रयास करती है। यह अनावश्यक रूप से लंबे प्रक्षेप पथ या व्यवहार को हतोत्साहित कर सकता है जो सिम्युलेटर का खराब उपयोग करते समय सफल होता है। पेपर यह नहीं दिखाता है कि क्या वे उद्देश्य सुरक्षित या उपयोगी बातचीत के मानवीय निर्णयों के अनुरूप हैं।

व्यापक व्यावहारिक महत्व अनुकरण और वास्तविकता के बीच के अंतर पर निर्भर करता है। एक विश्व मॉडल प्रचुर प्रशिक्षण डेटा उत्पन्न कर सकता है, लेकिन गलत भविष्यवाणियाँ एक एजेंट को ऐसी रणनीतियाँ सिखा सकती हैं जो केवल मॉडल के अंदर ही काम करती हैं। मोबाइल इंटरफ़ेस बदलते हैं, एप्लिकेशन में अप्रत्याशित स्थितियाँ होती हैं, और वास्तविक डिवाइस समय, अनुमति, नेटवर्क और रेंडरिंग व्यवहार पेश कर सकते हैं जिसे एक सिम्युलेटर कैप्चर नहीं कर सकता है। इसलिए, पेपर में रिपोर्ट किए गए बेंचमार्क सुधार को एक शोध दिशा के साक्ष्य के रूप में समझा जाना चाहिए, न कि इस बात का प्रमाण कि WM-R1 लोगों के उपकरणों या खातों पर बिना पर्यवेक्षित उपयोग के लिए तैयार है।

स्रोत महत्वपूर्ण तुलनाओं को भी अनसुलझा छोड़ देता है। यह कहता है कि WM-R1 ने GRPO-केवल और अनुमान-समय सिमुलेशन बेसलाइन से बेहतर प्रदर्शन किया है, लेकिन आपूर्ति किए गए पाठ में कोई संख्यात्मक परिणाम नहीं देता है। यह निर्दिष्ट नहीं करता है कि कोड, डेटासेट, प्रशिक्षित मॉडल, विश्व मॉडल, या मूल्यांकन वातावरण सार्वजनिक रूप से उपलब्ध हैं या नहीं, यह कहने के अलावा कि कोड arXiv-लिंक्ड यूआरएल के माध्यम से उपलब्ध है। परिणाम कितना सामान्य है यह स्थापित करने के लिए स्वतंत्र प्रतिकृति, व्यापक कार्य कवरेज और अदृश्य अनुप्रयोगों पर परीक्षण की आवश्यकता होगी।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

मुख्य प्रश्न यह हैं कि विश्व मॉडल वास्तविक एंड्रॉइड व्यवहार को कितनी सटीकता से दर्शाते हैं, रिपोर्ट किए गए लाभ अपरिचित ऐप्स और उपकरणों में कितनी अच्छी तरह स्थानांतरित होते हैं, और क्या सिमुलेशन वास्तविकता से अलग होने पर विधि विश्वसनीय रहती है। स्रोत कार्य को arXiv प्रीप्रिंट के रूप में पहचानता है, इसलिए इसके दावे यहां स्वतंत्र रूप से स्थापित नहीं किए गए हैं।

पहला सत्यापन लक्ष्य पूर्ण पेपर और उसका कार्यान्वयन है। पाठकों को महत्वपूर्ण सुधार के दावे के पीछे सटीक एंड्रॉइड बेंचमार्क, कार्य परिभाषाएँ, बेसलाइन कॉन्फ़िगरेशन, मूल्यांकन मेट्रिक्स और सांख्यिकीय परिणाम देखना चाहिए। यह भी मायने रखेगा कि क्या तुलना समतुल्य गणना का उपयोग करती है और क्या विश्व-मॉडल प्रशिक्षण लागत दक्षता विश्लेषण में शामिल है।

दूसरा मुद्दा मॉडल निष्ठा का है। भविष्य के मूल्यांकन में यह मापना चाहिए कि कितनी बार पूर्वानुमानित जीयूआई बदलाव वास्तविक परिणामों से मेल खाते हैं, जिसमें लेआउट, अनुमतियाँ, नेटवर्क प्रतिक्रियाएँ, विलंबता और एप्लिकेशन स्थिति में परिवर्तन शामिल हैं। ऐसे परीक्षण जो जानबूझकर अपरिचित ऐप्स या इंटरफ़ेस परिवर्तन पेश करते हैं, यह प्रकट करने में मदद करेंगे कि क्या एजेंट ने सामान्य इंटरैक्शन रणनीतियों को सीखा है या मुख्य रूप से प्रशिक्षण वातावरण में नियमितताओं का फायदा उठाया है।

2,000-कार्य डेटासेट की भूमिका भी जांच के योग्य है। इसकी संरचना, लाइसेंसिंग, भौगोलिक और भाषाई कवरेज, कार्य कठिनाई और मूल्यांकन कार्यों के साथ ओवरलैप रिपोर्ट किए गए परिणामों को प्रभावित कर सकते हैं। शोधकर्ताओं को यह निर्धारित करना चाहिए कि क्या डेटासेट सामान्य मोबाइल उपयोग का प्रतिनिधित्व करता है या बेंचमार्क-शैली क्रियाओं का एक संकीर्ण संग्रह दर्शाता है। कार्यों और मूल्यांकन स्क्रिप्टों तक प्रतिलिपि प्रस्तुत करने योग्य पहुंच से निष्कर्षों का आकलन करना आसान हो जाएगा।

सुरक्षा और तैनाती सीमाएँ एक अन्य निगरानी बिंदु हैं। प्रशिक्षण के दौरान वास्तविक वातावरण को बदलने से प्रयोग के दौरान परिचालन जोखिम कम हो सकता है, लेकिन यह तैनाती के जोखिम को दूर नहीं करता है। वास्तविक इंटरफ़ेस संचालित करने वाले एजेंट संदेश भेज सकते हैं, सेटिंग्स बदल सकते हैं, खरीदारी कर सकते हैं, निजी जानकारी उजागर कर सकते हैं, या अन्य परिणामी कार्रवाई कर सकते हैं। आपूर्ति किया गया स्रोत अनुमति नियंत्रण, मानव पुष्टि, रोलबैक तंत्र, या विश्व-मॉडल त्रुटियों के खिलाफ सुरक्षा का वर्णन नहीं करता है, इसलिए वे सुरक्षा उपाय अज्ञात रहते हैं।

अंत में, WM-R1 की तुलना अन्य दृष्टिकोणों से की जानी चाहिए जो एजेंटों के लिए सिमुलेशन, योजना और सुदृढीकरण सीखने को जोड़ते हैं। पेपर खुद को मोबाइल जीयूआई एजेंटों के लिए अपनी तरह का पहला ढांचा कहता है, लेकिन यह आपूर्ति किए गए स्रोत में स्वतंत्र रूप से सत्यापित ऐतिहासिक खोज के बजाय एक लेखक का दावा है। सबसे उपयोगी अनुवर्ती साक्ष्य स्वतंत्र प्रतिकृति, नए उपकरणों और अनुप्रयोगों पर मूल्यांकन और सिमुलेशन-आधारित प्रशिक्षण के बाद वास्तविक दुनिया की विश्वसनीयता का माप होगा।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणसुदृढीकरण सीखनाआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?