Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

WM-R1 đào tạo các tác nhân GUI di động bên trong các mô hình thế giới

Bản in trước arXiv mới mô tả WM-R1, một khung học tập tăng cường đào tạo các tác nhân GUI di động hoàn toàn thông qua các tương tác do mô hình thế giới tạo ra thay vì truy cập nhiều lần vào môi trường Android thực.

6 min readRead the primary source
Source-provided image accompanying WM-R1 trains mobile GUI agents inside world models
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.27508
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Trí tuệ nhân tạo (AI)
Lĩnh vực rộng lớn của việc xây dựng các hệ thống thực hiện các nhiệm vụ yêu cầu nhận dạng mẫu, lý luận, ngôn ngữ hoặc ra quyết định.
Học tăng cường
Đào tạo bằng các tín hiệu khen thưởng trong đó nhân viên học các hành động nhằm tối đa hóa lợi nhuận dài hạn.
Điểm chuẩn
Một bài kiểm tra hoặc tập dữ liệu được tiêu chuẩn hóa dùng để đo lường và so sánh hiệu suất của mô hình.
Tự kiểm traCâu đố về đại lý AI

Chuyện gì đã xảy ra

Các nhà nghiên cứu Yu Han và Tianwen Qian đã giới thiệu WM-R1, một khung học tập tăng cường để đào tạo các tác nhân giao diện người dùng đồ họa di động với các mô hình thế giới. Bài báo cho biết hệ thống này sẽ thay thế môi trường Android thực trong tất cả các đợt triển khai đào tạo bằng các chuyển đổi trạng thái do mô hình tạo, cho phép tác nhân thực hành các hành động trong môi trường mô phỏng.

Một bài báo arXiv được gửi vào ngày 27 tháng 8 năm 2026, trình bày WM-R1, được các tác giả của nó mô tả như một khung học tập tăng cường cho các tác nhân GUI di động. Chủ đề trực tiếp là một phương pháp đào tạo AI: nó được thiết kế để dạy các tác nhân vận hành giao diện đồ họa trên nền tảng di động bằng cách chọn hành động, quan sát trạng thái kết quả và tối ưu hóa hành vi so với phần thưởng. Các tác giả xác định Yu Han và Tianwen Qian là tác giả của bài báo và phân loại tác phẩm vào mục nghiên cứu trí tuệ nhân tạo.

Thay đổi thiết kế trọng tâm là sử dụng các mô hình thế giới làm nguồn chuyển đổi trạng thái trong tất cả các đợt triển khai đào tạo. Trong các thiết lập học tăng cường thông thường dành cho tác nhân GUI, hệ thống đào tạo tương tác nhiều lần với môi trường thực, chẳng hạn như thiết bị Android hoặc trình mô phỏng. Thay vào đó, WM-R1 thay thế môi trường đó bên trong vòng huấn luyện bằng mô hình thế giới đã học để dự đoán điều gì có thể xảy ra sau một hành động. Nguồn tin cho biết điều này loại bỏ nhu cầu tương tác với môi trường thực trong quá trình đào tạo; nó không chứng minh rằng tác nhân kết quả không bao giờ cần các biện pháp bảo vệ triển khai hoặc thử nghiệm thiết bị thực.

Khung này cũng đặt các mô hình thế giới bên trong quá trình suy luận của tác nhân. Trước khi lựa chọn hành động cuối cùng, tác nhân có thể sử dụng mô hình để suy luận về hậu quả của hành động ứng cử viên. Mục đích đã nêu là để cho phép tác nhân đánh giá các trạng thái tiếp theo có thể có trước khi thực hiện một thao tác, một cách tiếp cận có thể hữu ích cho các tác vụ trong đó thao tác nhấn, lựa chọn điều hướng hoặc bước nhập dữ liệu không chính xác gây tốn kém. Nguồn không cung cấp đủ chi tiết để xác định cách mô hình thể hiện trạng thái GUI, số lượng hành động ứng cử viên được xem xét hoặc lỗi dự đoán ảnh hưởng đến quyết định như thế nào.

Để đạt được hiệu quả huấn luyện, các tác giả cho biết WM-R1 hỗ trợ việc tạo quỹ đạo song song ở mức độ lớn và theo từng bước dựa trên các mô hình thế giới. Họ cũng báo cáo một tập dữ liệu gồm 2.000 tác vụ được mô tả là bao gồm các tác vụ GUI di động đầy thách thức. Khung này sử dụng phần thưởng dựa trên quy tắc với nhiều khía cạnh: thành công của nhiệm vụ, hiệu quả quỹ đạo và sử dụng mô hình thế giới. Bài viết báo cáo rằng các thử nghiệm về điểm chuẩn dành cho thiết bị di động Android đã cho thấy những cải tiến đáng kể so với các đường cơ sở chỉ có GRPO và các phương pháp mô phỏng thời gian suy luận. Đó là kết quả được báo cáo của các tác giả và đoạn trích nguồn không bao gồm điểm số, tên điểm chuẩn, kích thước mô hình, yêu cầu phần cứng hoặc thông tin chi tiết về các giao thức so sánh.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Nếu kết quả được báo cáo đúng thì phương pháp này có thể giảm chi phí và tính không ổn định liên quan đến việc thu thập số lượng lớn tương tác trên thiết bị thực. Nó cũng cung cấp một cách để làm cho việc đào tạo tác nhân GUI trở nên song song và chi tiết hơn, đồng thời tạo cơ hội cho các tác nhân xem xét các hậu quả có thể xảy ra của các hành động trước khi thực hiện chúng.

Việc đào tạo các tác nhân GUI thông qua các tương tác thực tế có thể tốn kém vì mỗi hành động đều yêu cầu một môi trường để thực thi, đặt lại và ghi lại. Nó cũng có thể không ổn định khi môi trường chậm, có trạng thái hoặc khó chạy song song. Đề xuất sử dụng các chuyển đổi trạng thái được tạo của WM-R1 giải quyết trực tiếp tình trạng thắt cổ chai. Nếu các mô hình thế giới của nó đủ chính xác, các nhà nghiên cứu có thể tạo ra nhiều quỹ đạo hơn với chi phí vận hành thấp hơn và sử dụng chúng để tinh chỉnh các tác nhân nhanh hơn.

Cách tiếp cận này cũng có thể thay đổi quy mô và độ phân giải của việc đào tạo tác nhân GUI. Việc tạo quỹ đạo ở cấp độ bước có nghĩa là hệ thống có thể tập trung vào các quyết định riêng lẻ thay vì chỉ coi toàn bộ nhiệm vụ là đơn vị học tập. Sự song song hóa lớn có thể cho phép khám phá đồng thời nhiều chuỗi hành động giả định. Cùng với nhau, các tính năng đó có thể giúp đào tạo tổng đài viên về các quy trình làm việc dài, phân nhánh như điều hướng cài đặt, hoàn thành biểu mẫu hoặc di chuyển qua các ứng dụng di động nhiều bước dễ dàng hơn, mặc dù nguồn không thể hiện hiệu suất trong bất kỳ quy trình làm việc cụ thể nào dành cho người tiêu dùng hoặc dịch vụ công.

Việc đưa một mô hình thế giới vào quá trình suy luận của tác nhân có khả năng quan trọng hơn cả tính hiệu quả. Tác nhân GUI đánh giá các hậu quả có thể xảy ra trước khi hành động có thể được định vị tốt hơn để tránh các lựa chọn không thể đảo ngược hoặc không hiệu quả so với tác nhân chỉ phản ứng với trạng thái màn hình hiện tại. Cấu trúc khen thưởng được báo cáo cũng cố gắng cân bằng ba mục tiêu thay vì chỉ tối ưu hóa việc hoàn thành nhiệm vụ. Điều đó có thể ngăn cản các quỹ đạo hoặc hành vi dài không cần thiết thành công khi sử dụng trình mô phỏng kém. Bài viết không cho thấy liệu những mục tiêu đó có phù hợp với đánh giá của con người về sự tương tác an toàn hay hữu ích hay không.

Ý nghĩa thực tiễn rộng hơn phụ thuộc vào khoảng cách giữa mô phỏng và thực tế. Một mô hình thế giới có thể tạo ra nhiều dữ liệu huấn luyện nhưng những dự đoán không chính xác có thể dạy cho tác nhân các chiến lược chỉ hoạt động bên trong mô hình. Giao diện di động thay đổi, ứng dụng chứa các trạng thái không mong muốn và các thiết bị thực có thể đưa ra hành vi về thời gian, quyền, mạng và hiển thị mà trình mô phỏng có thể không nắm bắt được. Do đó, việc cải thiện điểm chuẩn được báo cáo của bài báo nên được hiểu là bằng chứng cho hướng nghiên cứu chứ không phải bằng chứng cho thấy WM-R1 đã sẵn sàng để sử dụng không giám sát trên thiết bị hoặc tài khoản của mọi người.

Nguồn cũng để lại những so sánh quan trọng chưa được giải quyết. Nó cho biết WM-R1 vượt trội hơn các đường cơ sở mô phỏng thời gian suy luận và chỉ GRPO, nhưng không đưa ra kết quả bằng số nào trong văn bản được cung cấp. Nó không chỉ định liệu mã, tập dữ liệu, mô hình được đào tạo, mô hình thế giới hoặc môi trường đánh giá có được cung cấp công khai hay không ngoài việc nói rằng mã đó có sẵn thông qua URL được liên kết với arXiv. Cần phải sao chép độc lập, phạm vi nhiệm vụ rộng hơn và thử nghiệm trên các ứng dụng chưa được nhìn thấy để xác định mức độ chung của kết quả.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Xem gì tiếp theo

Các câu hỏi chính là các mô hình trên thế giới thể hiện hành vi thực tế của Android chính xác đến mức nào, mức lợi nhuận được báo cáo chuyển sang các ứng dụng và thiết bị không quen thuộc tốt như thế nào và liệu phương pháp này có còn đáng tin cậy khi mô phỏng khác với thực tế hay không. Nguồn xác định tác phẩm là bản in trước của arXiv, vì vậy các tuyên bố của nó chưa được thiết lập độc lập ở đây.

Mục tiêu xác minh đầu tiên là bản đầy đủ và việc thực hiện nó. Người đọc nên tìm kiếm các điểm chuẩn chính xác của Android, định nghĩa tác vụ, cấu hình cơ bản, số liệu đánh giá và kết quả thống kê đằng sau tuyên bố về sự cải thiện đáng kể. Điều quan trọng nữa là liệu các so sánh có sử dụng tính toán tương đương hay không và liệu chi phí đào tạo theo mô hình thế giới có được đưa vào phân tích hiệu quả hay không.

Vấn đề thứ hai là độ trung thực của mô hình. Các đánh giá trong tương lai sẽ đo lường tần suất các chuyển đổi GUI được dự đoán phù hợp với kết quả thực tế, bao gồm các thay đổi về bố cục, quyền, phản hồi mạng, độ trễ và trạng thái ứng dụng. Các thử nghiệm cố tình giới thiệu các ứng dụng lạ hoặc thay đổi giao diện sẽ giúp tiết lộ liệu tác nhân đã học các chiến lược tương tác chung hay chủ yếu khai thác các quy luật trong môi trường đào tạo.

Vai trò của tập dữ liệu 2.000 tác vụ cũng đáng được xem xét kỹ lưỡng. Thành phần, cấp phép, phạm vi địa lý và ngôn ngữ, độ khó của nhiệm vụ và sự trùng lặp với các nhiệm vụ đánh giá có thể ảnh hưởng đến kết quả được báo cáo. Các nhà nghiên cứu nên xác định xem tập dữ liệu đại diện cho việc sử dụng di động thông thường hay một tập hợp hành động theo kiểu điểm chuẩn hẹp hơn. Khả năng truy cập có thể lặp lại vào các nhiệm vụ và tập lệnh đánh giá sẽ giúp đánh giá các phát hiện dễ dàng hơn.

Ranh giới an toàn và triển khai là một điểm quan sát khác. Việc thay thế môi trường thực trong quá trình đào tạo có thể giảm rủi ro vận hành trong khi đang tiến hành thử nghiệm nhưng không loại bỏ được rủi ro khi triển khai. Các tác nhân vận hành giao diện thực có thể gửi tin nhắn, thay đổi cài đặt, mua hàng, tiết lộ thông tin cá nhân hoặc thực hiện các hành động tiếp theo khác. Nguồn được cung cấp không mô tả các biện pháp kiểm soát quyền, xác nhận của con người, cơ chế khôi phục hoặc biện pháp bảo vệ chống lại các lỗi theo mô hình thế giới, vì vậy những biện pháp bảo vệ đó vẫn chưa được biết.

Cuối cùng, WM-R1 nên được so sánh với các phương pháp khác kết hợp mô phỏng, lập kế hoạch và học tăng cường cho các tổng đài viên. Bài viết tự gọi mình là khuôn khổ đầu tiên thuộc loại này dành cho tác nhân GUI di động, nhưng đó là tuyên bố của tác giả chứ không phải là phát hiện lịch sử được xác minh độc lập trong nguồn được cung cấp. Bằng chứng tiếp theo hữu ích nhất sẽ là sự sao chép độc lập, đánh giá trên các thiết bị và ứng dụng mới cũng như đo lường độ tin cậy trong thế giới thực sau quá trình đào tạo dựa trên mô phỏng.

Hướng dẫn và câu hỏi liên quan

Đại lý AIGiải thích về mô hình AIĐào tạo AIHọc tăng cườngKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?