返回新聞
創新AI Understanding 簡報

WM-R1 在世界模型中訓練行動 GUI 代理

新的 arXiv 預印本描述了 WM-R1,這是一種強化學習框架,完全透過世界模型產生的互動來訓練行動 GUI 代理,而不是重複存取真實的 Android 環境。

6 min readRead the primary source
Source-provided image accompanying WM-R1 trains mobile GUI agents inside world models
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.27508
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

人工智慧(AI)
建構執行需要模式識別、推理、語言或決策的任務的系統的廣泛領域。
強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
基準測試
用於測量和比較模型性能的標準化測試或資料集。
測試一下自己AI 代理測驗

發生了什麼事

研究人員 Yu Han 和 Tianwen Qi 介紹了 WM-R1,這是一種強化學習框架,用於使用世界模型訓練行動圖形使用者介面代理。該論文稱,該系統在所有訓練部署期間都以模型生成的狀態轉換取代了真實的 Android 環境,從而允許代理在模擬環境中練習操作。

2026 年 8 月 27 日提交的 arXiv 論文提出了 WM-R1,其作者將其描述為行動 GUI 代理的強化學習框架。直接主題是人工智慧訓練方法:它旨在透過選擇動作、觀察結果狀態以及根據獎勵優化行為來教導智能體在行動平台上操作圖形介面。作者確認 Yu Han 和 Tianwen Qi 為該論文的作者,並將該工作歸類為人工智慧研究。

核心設計變更是在所有訓練推出期間使用世界模型作為狀態轉換的來源。在 GUI 代理的傳統強化學習設定中,訓練系統與真實環境(例如 Android 裝置或模擬器)重複互動。相反,WM-R1 以學習的世界模型取代了訓練循環內的環境,該模型可以預測動作後可能發生的情況。消息人士稱,這消除了訓練期間真實環境互動的需要;它並不能證明產生的代理商永遠不需要真實設備測試或部署保障措施。

該框架也將世界模型置於智能體的推理過程中。在選擇最終操作之前,代理可以使用模型來推理候選操作的後果。其既定目的是讓代理程式在執行操作之前評估可能的下一個狀態,這種方法對於不正確的點擊、導航選擇或資料輸入步驟代價高昂的任務可能很有用。原始程式碼沒有提供足夠的詳細資訊來確定模型如何表示 GUI 狀態、考慮了多少候選操作或預測錯誤如何影響決策。

為了提高訓練效率,作者表示 WM-R1 支援基於世界模型的大規模平行和步驟級粒度軌跡生成。他們還報告了一個包含 2,000 個任務的資料集,描述為涵蓋具有挑戰性的行動 GUI 任務。此框架使用基於規則的多維度獎勵:任務成功、軌跡效率和世界模型的使用。該論文報告稱,Android 移動基準測試表明,與僅 GRPO 基線和推理時間模擬方法相比,有顯著改進。這些是作者報告的結果,來源摘錄不包括分數、基準名稱、模型大小、硬體要求或有關比較協議的詳細資訊。

來源詳情: arxiv.org ↗

為什麼這很重要

如果報告的結果成立,該方法可以降低與收集大量真實設備互動相關的成本和不穩定性。它還提供了一種使 GUI 代理訓練更加並行和細粒度的方法,同時讓代理有機會在採取行動之前考慮可能的後果。

透過真實互動來訓練 GUI 代理的成本可能很高,因為每個操作都需要一個環境來執行、重置和記錄。當環境緩慢、有狀態或難以並行運作時,它也可能不穩定。 WM-R1 提議使用產生的狀態轉換直接解決該瓶頸。如果它的世界模型足夠準確,研究人員就可以以更低的營運成本產生更多的軌跡,並用它們更快地完善代理。

此方法還可以改變 GUI 代理訓練的規模和解析度。步驟級軌跡產生意味著系統可以專注於個人決策,而不是僅將整個任務視為學習單元。大規模並行化可以允許同時探索許多假設的動作序列。總而言之,這些功能可以使培訓代理更容易地完成長的、分支的工作流程,例如導航設定、填寫表格或通過多步驟行動應用程序,儘管原始程式碼沒有展示在任何特定消費者或公共服務工作流程中的效能。

在智能體的推理過程中嵌入世界模型可能比效率更重要。與僅對當前螢幕狀態做出反應的 GUI 代理相比,在採取行動之前評估可能後果的 GUI 代理可能能夠更好地避免不可逆或低效的選擇。報告的獎勵結構也試圖平衡三個目標,而不是只是優化任務完成情況。這可能會阻止不必要的長軌跡或在模擬器中使用不當時成功的行為。該論文並未顯示這些目標是否符合人類對安全或有用互動的判斷。

更廣泛的實際意義取決於模擬與現實之間的差距。世界模型可以產生豐富的訓練數據,但不準確的預測可能會教導代理人僅在模型內部有效的策略。行動介面發生變化,應用程式包含意外狀態,真實裝置可能會引入模擬器可能無法擷取的計時、權限、網路和渲染行為。因此,該論文報告的基準改進應被理解為研究方向的證據,而不是證明 WM-R1 已準備好在人們的設備或帳戶上進行無人監督的使用。

該消息來源還沒有解決重要的比較問題。它說 WM-R1 優於僅 GRPO 和推理時間模擬基線,但在提供的文本中沒有給出數值結果。它沒有指定程式碼、資料集、訓練模型、世界模型或評估環境是否公開可用,只是說程式碼可以透過 arXiv 連結的 URL 取得。需要獨立複製、更廣泛的任務覆蓋範圍以及對未見過的應用程式進行測試來確定結果的普遍性。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
互動式概念檢查+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

接下來看什麼

關鍵問題是世界模型如何準確地代表真實的 Android 行為、報告的收益轉移到不熟悉的應用程式和裝置的效果如何,以及當模擬偏離現實時該方法是否仍然可靠。消息來源將此作品確定為 arXiv 預印本,因此其聲明在此尚未獨立確立。

第一個驗證目標是論文全文及其實現。讀者應該尋找顯著改進背後的確切 Android 基準測試、任務定義、基準配置、評估指標和統計結果。比較是否使用等效計算以及世界模型訓練成本是否包含在效率分析中也很重要。

第二個問題是模型保真度。未來的評估應該衡量預測的 GUI 轉換與實際結果相符的頻率,包括佈局、權限、網路回應、延遲和應用程式狀態的變化。故意引入不熟悉的應用程式或介面變更的測試將有助於揭示代理是否已經學習了一般互動策略或主要利用了訓練環境中的規律性。

2000 個任務資料集的作用也值得仔細研究。其組成、許可、地理和語言覆蓋範圍、任務難度以及與評估任務的重疊可能會影響報告的結果。研究人員應該確定該資料集是否代表普通的行動使用情況,還是代表較小範圍的基準式操作集合。對任務和評估腳本的可重複存取將使結果更容易評估。

安全性和部署邊界是另一個觀察點。在訓練期間替換真實環境可能會降低實驗期間的操作風險,但並不能消除部署時的風險。操作真實介面的代理可以發送訊息、更改設定、進行購買、公開私人資訊或採取其他相應的操作。所提供的原始程式碼沒有描述權限控制、人工確認、回滾機製或針對世界模型錯誤的防禦,因此這些保護措施仍然未知。

最後,WM-R1 應該與其他結合了模擬、規劃和強化學習的代理方法進行比較。該論文稱自己是同類行動 GUI 代理中的第一個框架,但這是作者的主張,而不是所提供來源中獨立驗證的歷史發現。最有用的後續證據將是獨立複製、對新穎設備和應用的評估以及基於模擬的訓練後對現實世界可靠性的測量。

相關指引和測驗

人工智慧代理人工智慧模型解釋人工智慧培訓強化學習測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語關注 AI 模型發布追蹤器
覺得有用嗎?