Τι έγινε
Οι ερευνητές δημοσίευσαν ένα έγγραφο που περιγράφει το Unwritten , το οποίο ζητά από τα πολυτροπικά μοντέλα να αναγνωρίσουν λέξεις που γράφτηκαν χρησιμοποιώντας μόνο τον ήχο ενός στυλό και βίντεο ενός κινούμενου χεριού, χωρίς ορατό μελάνι. Η περίληψη αναφέρει την ακρίβεια γραμμάτων με εντολή ανθρώπου πάνω από 80% και κορυφαία μοντέλα, συμπεριλαμβανομένων των GPT-4o και Gemini 2.5-Pro, κάτω από 10%, και λέει ότι ο συνδυασμός των δύο τρόπων υποβάθμισε συχνά την απόδοση του μοντέλου αντί να τη βελτιώσει.
Τρεις ερευνητές - οι Garima Arya Yadav, Nilay Yilmaz και Yezhou Yang - δημοσίευσαν μια εργασία που παρουσιάζουν αυτό που αποκαλούν The Unwritten , μια δοκιμή για το εάν τα πολυτροπικά μοντέλα μηχανικής μάθησης μπορούν να καταλάβουν τι γράφει ένα άτομο χωρίς να δει ποτέ το ίδιο το γραπτό. Το χαρτί καταχωρείται στο arXiv ως 2608.14558, αρχειοθετημένο στο πλαίσιο της τεχνητής νοημοσύνης με διασταυρούμενη λίστα με την όραση υπολογιστή και την αναγνώριση προτύπων. Οι συγγραφείς ορίζουν το βασικό έργο ως "ακουστο-κινητική εξαγωγή λέξης": σε ένα μοντέλο δίνεται μόνο ο ήχος από γρατσουνιές στυλό και βίντεο κινήσεων των χεριών, χωρίς ορατό ίχνος μελανιού και πρέπει να αποκρυπτογραφήσει τη λέξη που γράφεται. Η περίληψη λέει ότι η εργασία καλύπτει τρία διαφορετικά στυλ γραφής. Η καταχώριση arXiv δίνει ημερομηνία υποβολής τις 15 Μαΐου 2026 και φέρει ένα σχόλιο που αναφέρει ότι η εργασία πρόκειται να δημοσιευθεί στο CVPR Findings 2026.
Το αποτέλεσμα του τίτλου είναι ένα κενό. Σύμφωνα με την περίληψη, οι άνθρωποι που συμμετέχουν επιτυγχάνουν υψηλή ακρίβεια γραμμάτων - λένε οι συγγραφείς πάνω από 80% - ενώ τα κορυφαία πολυτροπικά μοντέλα αποτυγχάνουν να ξεπεράσουν το 10%. Τα δύο μοντέλα που αναφέρονται στην περίληψη είναι τα GPT-4o και Gemini 2.5-Pro. Το χαρτί το πλαισιώνει αυτό όχι ως μια στενή αποτυχία αναγνώρισης, αλλά ως απόδειξη των ορίων στη διατροπική αιτιολογική αιτιολογία και σε αυτό που οι συγγραφείς αποκαλούν μικρο-κινητική της γραφής: οι λεπτές, γρήγορες κινήσεις του χεριού και του στυλό που μεταφέρουν πληροφορίες σχετικά με το γράμμα που σχηματίζεται.
Το δεύτερο αναφερόμενο εύρημα είναι λιγότερο αναμενόμενο. Οι συγγραφείς περιγράφουν ένα «παράδοξο φαινόμενο σύντηξης», στο οποίο η παροχή ήχου και βίντεο σε ένα μοντέλο συχνά υποβαθμίζει την απόδοσή του σε σύγκριση με την παροχή ενός μόνο τρόπου. Το διάβασαν ως διάσπαση της ικανότητας των μοντέλων να συνθέτουν συμπληρωματικά αντιληπτικά στοιχεία. Η περίληψη δεν αναφέρει βαθμολογίες ανά τρόπο λειτουργίας, επομένως το μέγεθος αυτής της υποβάθμισης και το αν εμφανίστηκε για κάθε μοντέλο που δοκιμάστηκε, δεν καθορίζονται από το υλικό που εξετάζεται εδώ.
Αυτός ο λογαριασμός προέρχεται μόνο από την περίληψη του arXiv. το πλήρες έγγραφο, τα παραρτήματά του και τυχόν δημοσιευμένο υλικό δεν εξετάστηκαν. Αρκετές λεπτομέρειες που θα είχαν σημασία για την κρίση του αποτελέσματος δεν αναφέρονται εκεί. Η περίληψη δεν δίνει τον αριθμό των λέξεων ή των αποσπασμάτων στο σύνολο δεδομένων, τον αριθμό των ανθρώπινων συμμετεχόντων ή τις συνθήκες υπό τις οποίες δοκιμάστηκαν, τη γλώσσα ή το σενάριο που εμπλέκονται, τον ακριβή ορισμό της ακρίβειας διατεταγμένων γραμμάτων, τον τρόπο προτροπής των μοντέλων, τον τρόπο δειγματοληψίας και διαβίβασης βίντεο και ήχου ή εάν τα δεδομένα και ο κώδικας θα δημοσιευτούν. Η εργασία αναφέρεται επίσης ως προσεχής σε ένα κομμάτι ευρημάτων συνεδρίου και όχι ως ολοκληρωμένη δημοσίευση με κριτές και δεν είναι γνωστή σε αυτό το σημείο ανεξάρτητη αναπαραγωγή.
Γιατί έχει σημασία
Οι περισσότερες πολυτροπικές αξιολογήσεις ελέγχουν την αναγνώριση του τι είναι άμεσα ορατό ή ακουστό. Αυτό δοκιμάζει το συμπέρασμα για κάτι που δεν εμφανίστηκε ποτέ και αναφέρει ότι η προσθήκη μιας δεύτερης τροπικότητας μπορεί να βλάψει - ένα αποτέλεσμα που έρχεται σε αντίθεση με την κοινή υπόθεση ότι η σύντηξη ήχου και βίντεο είναι προσθετική. Αν αντέξει, δείχνει μια αδυναμία στον τρόπο με τον οποίο τα τρέχοντα συστήματα συνδυάζουν αντιληπτικά κανάλια, όχι μόνο σε μια δύσκολη εργασία.
Τα πιο ευρέως χρησιμοποιούμενα πολυτροπικά σημεία αναφοράς ελέγχουν εάν ένα σύστημα μπορεί να ονομάσει αυτό που υπάρχει σε μια εικόνα, ένα βίντεο ή ένα κλιπ ήχου. Αυτό αφαιρεί σκόπιμα την απάντηση από την εισαγωγή. Η λέξη δεν εμφανίζεται ποτέ. πρέπει να ανακατασκευαστεί από τη φυσική διαδικασία που το παρήγαγε. Αυτός ο σχεδιασμός στοχεύει σε μια ικανότητα — συνάγοντας μια αόρατη αιτία από δυναμικά στοιχεία — που είναι πιο κοντά στο πώς οι άνθρωποι διαβάζουν μια σκηνή παρά στην αντιστοίχιση μοτίβων σε στατικό περιεχόμενο και είναι μια δυνατότητα που οι τρέχουσες σουίτες αξιολόγησης σε μεγάλο βαθμό δεν απομονώνουν.
Το αποτέλεσμα της σύντηξης είναι αναμφισβήτητα το πιο συνεπές από τους δύο ισχυρισμούς. Πολλοί από τη μηχανική προϊόντων υποθέτουν ότι η παροχή σε ένα μοντέλο πιο αντιληπτικών καναλιών μπορεί μόνο να βοηθήσει: οι βοηθοί συναντήσεων συνδυάζουν την ομιλία με το βίντεο οθόνης, τα εργαλεία προσβασιμότητας συνδυάζουν είσοδο κάμερας και μικροφώνου και οι στοίβες ρομποτικής συγχωνεύουν αρκετούς αισθητήρες με την υπόθεση ότι ο πλεονασμός είναι προστατευτικός. Εάν μια δεύτερη μέθοδος μπορεί αξιόπιστα να κάνει ένα μοντέλο χειρότερο σε μια εργασία όπου και τα δύο κανάλια μεταφέρουν πραγματικό σήμα, αυτή η υπόθεση χρειάζεται δοκιμή αντί για εμπιστοσύνη. Το έγγραφο δεν αποδεικνύει ότι αυτό συμβαίνει γενικά - το αναφέρει σε μια εργασία, με ένα μικρό σύνολο ονομασμένων μοντέλων - αλλά είναι μια συγκεκριμένη περίπτωση όπου περισσότερες πληροφορίες παρήγαγαν χειρότερη απάντηση.
Η εργασία βρίσκεται επίσης κοντά σε δύο πρακτικούς τομείς. Το ένα είναι η προσβασιμότητα και η ψηφιοποίηση: η καταγραφή χειρογράφου από ήχο και κίνηση, χωρίς έξυπνο στυλό ή σαρωτή, θα ήταν χρήσιμη για τη λήψη σημειώσεων και για άτομα που γράφουν σε συνηθισμένο χαρτί. Το άλλο είναι η ιδιωτικότητα. Το συμπέρασμα γραπτού περιεχομένου από τυχαία ακουστικά και οπτικά σήματα είναι, καταρχήν, ένα πρόβλημα πλευρικού καναλιού και οι επιθέσεις πλευρικών καναλιών σε πληκτρολόγια από ήχο έχουν μελετηθεί εδώ και χρόνια. Σύμφωνα με τα στοιχεία αυτής της περίληψης, τα τρέχοντα μοντέλα γενικής χρήσης απέχουν πολύ από το να το κάνουν αυτό - κάτω από το 10% είναι σχεδόν αχρησιμοποίητο - ενώ οι άνθρωποι φέρεται να μπορούν. Αυτό είναι ένα εύρημα για τις δυνατότητες του σημερινού μοντέλου, όχι μια διαρκής εγγύηση.
Οι περιορισμοί τρέχουν και προς τις δύο κατευθύνσεις και αξίζει να δηλωθούν ξεκάθαρα. Οι πολύ χαμηλές βαθμολογίες σε ένα νέο σημείο αναφοράς είναι σύνηθες και από μόνες τους δεν κάνουν διάκριση ανάμεσα σε ένα γνήσιο έλλειμμα συλλογισμού, μια αναντιστοιχία μεταξύ της μορφής εργασίας και του τρόπου με τον οποίο αυτά τα μοντέλα απορροφούν βίντεο και ήχο, και μια ζώνη αξιολόγησης που δεν έχει ρυθμιστεί για την εργασία. Τα δύο μοντέλα που ονομάζονται είναι εμπορικά συστήματα γενικής χρήσης, όχι συστήματα κατασκευασμένα ή προσαρμοσμένα για λεπτομερή ανάλυση κίνησης και ισχυρότερα ή πιο πρόσφατα μοντέλα ενδέχεται να μην έχουν δοκιμαστεί. Η ανθρώπινη γραμμή αναφοράς αναφέρεται ως ένας μεμονωμένος αριθμός χωρίς περιγραφόμενες συνθήκες. Και ένα σημείο αναφοράς που συντάχθηκε από την ίδια ομάδα που αναφέρει το χάσμα δεν έχει ακόμη δοκιμαστεί από κανέναν άλλο.
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
What is the best response when AI Models Explained makes a mistake in production?
Τι να παρακολουθήσετε στη συνέχεια
Εάν το σύνολο δεδομένων, ο κώδικας και το πρωτόκολλο ανθρώπινης γραμμής βάσης κυκλοφορούν και αναπαράγονται ανεξάρτητα. είτε νεότερα μοντέλα είτε διαφορετικές προτροπές κλείνουν το χάσμα. και εάν η αναφερόμενη υποβάθμιση της σύντηξης εμφανίζεται σε άλλες εργασίες ήχου-βίντεο ή αποδεικνύεται ότι είναι συγκεκριμένη για αυτό το σημείο αναφοράς.
Το πρώτο πράγμα που πρέπει να παρακολουθήσετε είναι η απελευθέρωση και η αναπαραγωγιμότητα. Το αν οι συγγραφείς δημοσιεύουν το σύνολο δεδομένων, τον κώδικα αξιολόγησης και το ακριβές πρωτόκολλο ανθρώπινης μελέτης θα καθορίσουν πόσο γρήγορα μπορούν να ελεγχθούν οι αριθμοί των επικεφαλίδων. Η καταχώριση arXiv που εξετάζεται εδώ δεν υποδεικνύει κωδικό ή σύνδεσμο δεδομένων. Ένα σημείο αναφοράς που αναφέρει ένα χάσμα 70 σημείων ανθρώπου-μηχανής απαιτεί ανεξάρτητη αναπαραγωγή και η αξία του ισχυρισμού εξαρτάται σε μεγάλο βαθμό από το εάν άλλες ομάδες μπορούν να αναπαράγουν τόσο τις βαθμολογίες του μοντέλου όσο και την ανθρώπινη γραμμή βάσης.
Το δεύτερο είναι αν το κενό επιβιώνει σε επαφή με καλύτερες ρυθμίσεις. Οι βαθμολογίες σε νέες πολυτροπικές εργασίες συχνά μετακινούνται ουσιαστικά με αλλαγές που δεν έχουν καμία σχέση με τη συλλογιστική - ρυθμός καρέ, δειγματοληψία ήχου και προεπεξεργασία, πόσα καρέ πραγματικά βλέπει ένα μοντέλο, δομή άμεσης επικοινωνίας ή μέτριος όγκος λεπτομέρειας για συγκεκριμένη εργασία. Εάν μια μικρή αλλαγή μηχανικής ανυψώνει τα μοντέλα πολύ πάνω από 10%, το αποτέλεσμα εμφανίζεται κυρίως ως πρόβλημα αγωγού εισόδου. Εάν ο προσεκτικός συντονισμός τους αφήνει κοντά στο πάτωμα, ο ισχυρότερος ισχυρισμός των συγγραφέων σχετικά με τη διατροπική αιτιολογική αιτιολογία γίνεται πιο δύσκολο να απορριφθεί.
Τρίτο είναι το φαινόμενο σύντηξης. Το ενδιαφέρον ερώτημα είναι εάν η υποβάθμιση από την προσθήκη μιας τροπικότητας εμφανίζεται σε άλλες εργασίες ήχου-βίντεο ή αν είναι συγκεκριμένη για αυτήν. Εάν άλλες ομάδες βρουν το ίδιο μοτίβο αλλού, θα υποδείκνυε κάτι δομικό στον τρόπο με τον οποίο τα σημερινά μοντέλα ζυγίζουν και συνδυάζουν κανάλια και όχι μια ιδιορρυθμία από γρατσουνιές με στυλό και κίνηση των χεριών. Οι εκτομές ανά τρόπο λειτουργίας στο πλήρες χαρτί και οι προσπάθειες αναπαραγωγής τους, είναι το μέρος που τακτοποιείται.
Τέλος, προσέξτε για υιοθεσία. Τα σημεία αναφοράς έχουν σημασία όταν άλλα εργαστήρια αναφέρουν βαθμολογίες για αυτά και όταν οι αριθμοί μετακινούνται σε διαδοχικές γενιές μοντέλων. Είτε αυτό εμφανίζεται στο ίχνος ευρημάτων CVPR 2026 όπως αναφέρεται, εάν τα συνοριακά εργαστήρια το περιλαμβάνουν στις αναφορές αξιολόγησης και εάν οι ερευνητές απορρήτου και ασφάλειας θα επιλέξουν το πλαίσιο του πλευρικού καναλιού θα είναι όλα ορατά τους επόμενους μήνες. Αξίζει επίσης να σημειωθεί ότι ένα σημείο αναφοράς που απέχει πολύ από τον κορεσμό δίνει ένα σαφές μήνυμα για λίγο - έως ότου δεν το κάνει, οπότε το ερώτημα είναι αν τα μοντέλα έμαθαν την ικανότητα ή το σύνολο δεδομένων.