Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το WM-R1 εκπαιδεύει κινητούς πράκτορες GUI σε μοντέλα του κόσμου

Μια νέα προεκτύπωση arXiv περιγράφει το WM-R1, ένα πλαίσιο ενισχυτικής μάθησης που εκπαιδεύει τους πράκτορες GUI για κινητές συσκευές εξ ολοκλήρου μέσω αλληλεπιδράσεων που δημιουργούνται από παγκόσμια μοντέλα αντί για επαναλαμβανόμενη πρόσβαση σε ένα πραγματικό περιβάλλον Android.

6 min readRead the primary source
Source-provided image accompanying WM-R1 trains mobile GUI agents inside world models
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2608.27508
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Τεχνητή Νοημοσύνη (AI)
Το ευρύ πεδίο κατασκευής συστημάτων που εκτελούν εργασίες που απαιτούν αναγνώριση προτύπων, συλλογισμό, γλώσσα ή λήψη αποφάσεων.
Ενισχυτική Μάθηση
Η εκπαίδευση μέσω ανταμοιβής σηματοδοτεί όπου ένας πράκτορας μαθαίνει ενέργειες που μεγιστοποιούν τη μακροπρόθεσμη απόδοση.
Σημείο αναφοράς
Μια τυποποιημένη δοκιμή ή σύνολο δεδομένων που χρησιμοποιείται για τη μέτρηση και τη σύγκριση της απόδοσης του μοντέλου.
Δοκιμάστε τον εαυτό σαςΚουίζ για πράκτορες AI

Τι έγινε

Οι ερευνητές Yu Han και Tianwen Qian εισήγαγαν το WM-R1, ένα πλαίσιο ενισχυτικής μάθησης για την εκπαίδευση πρακτόρων γραφικών-χρήστη-διασύνδεσης κινητών με παγκόσμια μοντέλα. Η εφημερίδα λέει ότι το σύστημα αντικαθιστά το πραγματικό περιβάλλον Android κατά τη διάρκεια όλων των εκδόσεων εκπαίδευσης με μεταβάσεις κατάστασης που δημιουργούνται από μοντέλα, επιτρέποντας στον πράκτορα να εξασκεί ενέργειες σε ένα προσομοιωμένο περιβάλλον.

Ένα έγγραφο arXiv που υποβλήθηκε στις 27 Αυγούστου 2026, παρουσιάζει το WM-R1, το οποίο οι συντάκτες του περιγράφουν ως ένα πλαίσιο ενίσχυσης μάθησης για πράκτορες GUI για κινητά. Το άμεσο θέμα είναι μια μέθοδος εκπαίδευσης AI: έχει σχεδιαστεί για να διδάσκει στους πράκτορες να χειρίζονται γραφικές διεπαφές σε κινητές πλατφόρμες επιλέγοντας ενέργειες, παρατηρώντας τις προκύπτουσες καταστάσεις και βελτιστοποιώντας τη συμπεριφορά έναντι ανταμοιβών. Οι συγγραφείς προσδιορίζουν τους Yu Han και Tianwen Qian ως συγγραφείς της εργασίας και ταξινομούν το έργο στην έρευνα τεχνητής νοημοσύνης.

Η κεντρική αλλαγή σχεδίασης είναι η χρήση παγκόσμιων μοντέλων ως πηγής μεταβάσεων κατάστασης κατά τη διάρκεια όλων των προπονήσεων. Σε συμβατικές ρυθμίσεις ενίσχυσης-εκμάθησης για πράκτορες GUI, το σύστημα εκπαίδευσης αλληλεπιδρά επανειλημμένα με ένα πραγματικό περιβάλλον, όπως μια συσκευή Android ή εξομοιωτή. Το WM-R1 αντικαθιστά αυτό το περιβάλλον εντός του βρόχου εκπαίδευσης με ένα μοντέλο μαθημένου κόσμου που προβλέπει τι μπορεί να συμβεί μετά από μια ενέργεια. Η πηγή λέει ότι αυτό αφαιρεί την ανάγκη για αλληλεπίδραση σε πραγματικό περιβάλλον κατά τη διάρκεια της εκπαίδευσης. δεν αποδεικνύει ότι ο παράγοντας που προκύπτει δεν χρειάζεται ποτέ δοκιμές πραγματικής συσκευής ή διασφαλίσεις ανάπτυξης.

Το πλαίσιο τοποθετεί επίσης τα μοντέλα του κόσμου μέσα στη συλλογιστική διαδικασία του πράκτορα. Πριν επιλέξει μια τελική ενέργεια, ο πράκτορας μπορεί να χρησιμοποιήσει το μοντέλο για να αιτιολογήσει τις συνέπειες των υποψήφιων ενεργειών. Ο δηλωμένος σκοπός είναι να αφήσει τον πράκτορα να αξιολογήσει πιθανές επόμενες καταστάσεις προτού δεσμευτεί σε μια λειτουργία, μια προσέγγιση που θα μπορούσε να είναι χρήσιμη για εργασίες στις οποίες ένα εσφαλμένο πάτημα, επιλογή πλοήγησης ή βήμα εισαγωγής δεδομένων είναι δαπανηρή. Η πηγή δεν παρέχει αρκετές λεπτομέρειες για να προσδιορίσει πώς το μοντέλο αντιπροσωπεύει την κατάσταση GUI, πόσες υποψήφιες ενέργειες λαμβάνονται υπόψη ή πώς τα σφάλματα πρόβλεψης επηρεάζουν τις αποφάσεις.

Για την αποτελεσματικότητα της εκπαίδευσης, οι συγγραφείς λένε ότι το WM-R1 υποστηρίζει μαζικά παραλληλισμένη και κοκκώδη δημιουργία τροχιών σε επίπεδο βήματος, βασισμένη σε παγκόσμια μοντέλα. Αναφέρουν επίσης ένα σύνολο δεδομένων 2.000 εργασιών που περιγράφεται ότι καλύπτει δύσκολες εργασίες GUI για κινητά. Το πλαίσιο χρησιμοποιεί μια ανταμοιβή βασισμένη σε κανόνες με πολλαπλές διαστάσεις: επιτυχία εργασίας, αποτελεσματικότητα τροχιάς και χρήση του παγκόσμιου μοντέλου. Το έγγραφο αναφέρει ότι τα πειράματα σε δείκτες αναφοράς για κινητά Android έδειξαν σημαντικές βελτιώσεις σε σχέση με τις βασικές γραμμές βάσης μόνο για GRPO και τις μεθόδους προσομοίωσης χρόνου συμπερασμάτων. Αυτά είναι τα αναφερόμενα αποτελέσματα των συγγραφέων και το απόσπασμα πηγής δεν περιλαμβάνει βαθμολογίες, ονόματα συγκριτικής αξιολόγησης, μεγέθη μοντέλων, απαιτήσεις υλικού ή λεπτομέρειες σχετικά με τα πρωτόκολλα σύγκρισης.

Στοιχεία πηγής: arxiv.org ↗

Γιατί έχει σημασία

Εάν τα αναφερόμενα αποτελέσματα επιμείνουν, η προσέγγιση θα μπορούσε να μειώσει το κόστος και την αστάθεια που σχετίζονται με τη συλλογή μεγάλου αριθμού αλληλεπιδράσεων με πραγματική συσκευή. Προσφέρει επίσης έναν τρόπο να γίνει η εκπαίδευση των πρακτόρων GUI πιο παράλληλη και λεπτομερής, ενώ δίνει στους πράκτορες την ευκαιρία να εξετάσουν τις πιθανές συνέπειες των ενεργειών πριν τις λάβουν.

Η εκπαίδευση πρακτόρων GUI μέσω πραγματικών αλληλεπιδράσεων μπορεί να είναι δαπανηρή επειδή κάθε ενέργεια απαιτεί ένα περιβάλλον για εκτέλεση, επαναφορά και εγγραφή. Μπορεί επίσης να είναι ασταθές όταν το περιβάλλον είναι αργό, σε κατάσταση κατάστασης ή είναι δύσκολο να λειτουργήσει παράλληλα. Η προτεινόμενη χρήση του WM-R1 των παραγόμενων μεταβάσεων καταστάσεων αντιμετωπίζει άμεσα αυτό το σημείο συμφόρησης. Εάν τα παγκόσμια μοντέλα του είναι επαρκώς ακριβή, οι ερευνητές θα μπορούσαν να παράγουν περισσότερες τροχιές με χαμηλότερο λειτουργικό κόστος και να τις χρησιμοποιήσουν για να βελτιώσουν τους πράκτορες πιο γρήγορα.

Η προσέγγιση θα μπορούσε επίσης να αλλάξει την κλίμακα και την ανάλυση της εκπαίδευσης πρακτόρων GUI. Η δημιουργία τροχιάς σε επίπεδο βήματος σημαίνει ότι το σύστημα μπορεί να επικεντρωθεί σε μεμονωμένες αποφάσεις αντί να αντιμετωπίζει μόνο μια ολόκληρη εργασία ως μονάδα μάθησης. Ο μαζικός παραλληλισμός θα μπορούσε να επιτρέψει την ταυτόχρονη εξερεύνηση πολλών υποθετικών ακολουθιών ενεργειών. Μαζί, αυτές οι δυνατότητες μπορεί να διευκολύνουν την εκπαίδευση πρακτόρων σε μακροχρόνιες, διακλαδισμένες ροές εργασίας, όπως η πλοήγηση σε ρυθμίσεις, η συμπλήρωση φορμών ή η μετακίνηση μέσω εφαρμογών για κινητά πολλαπλών βημάτων, αν και η πηγή δεν δείχνει απόδοση σε καμία συγκεκριμένη ροή εργασίας καταναλωτή ή δημόσιας υπηρεσίας.

Η ενσωμάτωση ενός παγκόσμιου μοντέλου στη διαδικασία συλλογιστικής του πράκτορα είναι δυνητικά σημαντική πέρα ​​από την αποτελεσματικότητα. Ένας πράκτορας GUI που αξιολογεί πιθανές συνέπειες πριν ενεργήσει μπορεί να είναι σε καλύτερη θέση για να αποφύγει μη αναστρέψιμες ή αναποτελεσματικές επιλογές από έναν παράγοντα που απλώς αντιδρά στην τρέχουσα κατάσταση της οθόνης. Η αναφερόμενη δομή ανταμοιβής επιχειρεί επίσης να εξισορροπήσει τρεις στόχους αντί να βελτιστοποιήσει μόνο την ολοκλήρωση της εργασίας. Αυτό θα μπορούσε να αποθαρρύνει τις άσκοπες μεγάλες τροχιές ή τη συμπεριφορά που πετυχαίνει ενώ κάνει κακή χρήση του προσομοιωτή. Το έγγραφο δεν δείχνει εάν αυτοί οι στόχοι αντιστοιχούν σε ανθρώπινες κρίσεις για ασφαλή ή χρήσιμη αλληλεπίδραση.

Η ευρύτερη πρακτική σημασία εξαρτάται από το χάσμα μεταξύ προσομοίωσης και πραγματικότητας. Ένα παγκόσμιο μοντέλο μπορεί να δημιουργήσει άφθονα δεδομένα εκπαίδευσης, αλλά οι ανακριβείς προβλέψεις μπορεί να διδάξουν σε έναν πράκτορα στρατηγικές που λειτουργούν μόνο μέσα στο μοντέλο. Οι διεπαφές για φορητές συσκευές αλλάζουν, οι εφαρμογές περιέχουν απροσδόκητες καταστάσεις και οι πραγματικές συσκευές μπορούν να εισάγουν συμπεριφορά χρονισμού, άδειας, δικτύου και απόδοσης που μπορεί να μην καταγράψει ένας προσομοιωτής. Επομένως, η αναφερόμενη βελτίωση του σημείου αναφοράς της εργασίας θα πρέπει να γίνει κατανοητή ως απόδειξη για μια ερευνητική κατεύθυνση, όχι ως απόδειξη ότι το WM-R1 είναι έτοιμο για χρήση χωρίς επίβλεψη σε συσκευές ή λογαριασμούς χρηστών.

Η πηγή αφήνει επίσης σημαντικές συγκρίσεις ανεπίλυτες. Λέει ότι το WM-R1 ξεπέρασε τις βασικές γραμμές προσομοίωσης μόνο για GRPO και χρόνο συμπερασμάτων, αλλά δεν δίνει αριθμητικά αποτελέσματα στο παρεχόμενο κείμενο. Δεν προσδιορίζει εάν ο κώδικας, το σύνολο δεδομένων, τα εκπαιδευμένα μοντέλα, τα παγκόσμια μοντέλα ή τα περιβάλλοντα αξιολόγησης είναι δημόσια διαθέσιμα, πέρα ​​από το ότι ο κώδικας είναι διαθέσιμος μέσω μιας διεύθυνσης URL που συνδέεται με arXiv. Θα χρειαζόταν ανεξάρτητη αναπαραγωγή, ευρύτερη κάλυψη εργασιών και δοκιμή σε μη εμφανείς εφαρμογές για να διαπιστωθεί πόσο γενικό είναι το αποτέλεσμα.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Τι να παρακολουθήσετε στη συνέχεια

Τα βασικά ερωτήματα είναι πόσο ακριβή αντιπροσωπεύουν τα παγκόσμια μοντέλα πραγματικής συμπεριφοράς Android, πόσο καλά μεταφέρονται τα αναφερόμενα κέρδη σε άγνωστες εφαρμογές και συσκευές και αν η μέθοδος παραμένει αξιόπιστη όταν οι προσομοιώσεις αποκλίνουν από την πραγματικότητα. Η πηγή προσδιορίζει το έργο ως προεκτύπωση arXiv, επομένως οι ισχυρισμοί του δεν έχουν τεκμηριωθεί ανεξάρτητα εδώ.

Ο πρώτος στόχος επαλήθευσης είναι το πλήρες έγγραφο και η εφαρμογή του. Οι αναγνώστες θα πρέπει να αναζητήσουν τα ακριβή σημεία αναφοράς Android, ορισμούς εργασιών, διαμορφώσεις βασικής γραμμής, μετρήσεις αξιολόγησης και στατιστικά αποτελέσματα πίσω από τον ισχυρισμό της σημαντικής βελτίωσης. Θα έχει επίσης σημασία εάν οι συγκρίσεις χρησιμοποιούν ισοδύναμο υπολογισμό και εάν το κόστος εκπαίδευσης παγκόσμιου μοντέλου περιλαμβάνεται στην ανάλυση απόδοσης.

Ένα δεύτερο ζήτημα είναι η πιστότητα του μοντέλου. Οι μελλοντικές αξιολογήσεις θα πρέπει να μετρούν πόσο συχνά οι προβλεπόμενες μεταβάσεις GUI ταιριάζουν με τα πραγματικά αποτελέσματα, συμπεριλαμβανομένων των αλλαγών στη διάταξη, τα δικαιώματα, τις αποκρίσεις δικτύου, τον λανθάνοντα χρόνο και την κατάσταση εφαρμογής. Δοκιμές που εισάγουν σκόπιμα άγνωστες εφαρμογές ή αλλαγές διεπαφής θα βοηθούσαν να αποκαλυφθεί εάν ο πράκτορας έχει μάθει γενικές στρατηγικές αλληλεπίδρασης ή έχει εκμεταλλευτεί κυρίως κανονικότητες στα εκπαιδευτικά περιβάλλοντα.

Ο ρόλος του συνόλου δεδομένων 2.000 εργασιών αξίζει επίσης να εξεταστεί. Η σύνθεσή του, η αδειοδότηση, η γεωγραφική και γλωσσική κάλυψη, η δυσκολία εργασίας και η επικάλυψη με εργασίες αξιολόγησης θα μπορούσαν να επηρεάσουν τα αναφερόμενα αποτελέσματα. Οι ερευνητές θα πρέπει να προσδιορίσουν εάν το σύνολο δεδομένων αντιπροσωπεύει τη συνηθισμένη χρήση κινητών ή μια πιο στενή συλλογή ενεργειών σε στυλ αναφοράς. Η αναπαραγώγιμη πρόσβαση στις εργασίες και τα σενάρια αξιολόγησης θα έκανε ευκολότερη την αξιολόγηση των ευρημάτων.

Τα όρια ασφάλειας και ανάπτυξης είναι ένα άλλο σημείο επιτήρησης. Η αντικατάσταση πραγματικών περιβαλλόντων κατά τη διάρκεια της εκπαίδευσης μπορεί να μειώσει τον λειτουργικό κίνδυνο όσο βρίσκεται σε εξέλιξη ο πειραματισμός, αλλά δεν εξαλείφει τους κινδύνους κατά την ανάπτυξη. Οι πράκτορες που λειτουργούν πραγματικές διεπαφές θα μπορούσαν να στέλνουν μηνύματα, να αλλάζουν ρυθμίσεις, να κάνουν αγορές, να αποκαλύπτουν προσωπικές πληροφορίες ή να προβαίνουν σε άλλες επακόλουθες ενέργειες. Η παρεχόμενη πηγή δεν περιγράφει ελέγχους αδειών, ανθρώπινη επιβεβαίωση, μηχανισμούς επαναφοράς ή άμυνες έναντι λαθών παγκόσμιου μοντέλου, επομένως αυτές οι διασφαλίσεις παραμένουν άγνωστες.

Τέλος, το WM-R1 θα πρέπει να συγκριθεί με άλλες προσεγγίσεις που συνδυάζουν την προσομοίωση, τον προγραμματισμό και την ενίσχυση της μάθησης για πράκτορες. Το έγγραφο αυτοαποκαλείται το πρώτο πλαίσιο του είδους του για κινητούς πράκτορες GUI, αλλά αυτό είναι ένας ισχυρισμός του συγγραφέα και όχι ένα ανεξάρτητα επαληθευμένο ιστορικό εύρημα στην παρεχόμενη πηγή. Τα πιο χρήσιμα στοιχεία παρακολούθησης θα ήταν η ανεξάρτητη αναπαραγωγή, οι αξιολογήσεις σε νέες συσκευές και εφαρμογές και οι μετρήσεις της αξιοπιστίας του πραγματικού κόσμου μετά από εκπαίδευση βασισμένη σε προσομοίωση.

Σχετικοί οδηγοί και κουίζ

Πράκτορες AIΕπεξήγηση μοντέλων AIΕκπαίδευση AIΕνισχυτική ΜάθησηΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;