Τι έγινε
Το MIT Technology Review δημοσίευσε ένα διαδραστικό χαρακτηριστικό που δημιουργήθηκε γύρω από επτά παζλ που διερευνούν τον τρόπο με τον οποίο τα μοντέλα AI συλλογίζονται. Το άρθρο αναφέρει ότι τα μοντέλα έχουν βελτιωθεί γρήγορα σε ορισμένες εργασίες, αλλά εξακολουθούν να παλεύουν με τη χωρική χειραγώγηση, τις λεπτές παραλλαγές οικείων προβλημάτων, την οπτική αφαίρεση και τη ολοένα και πιο περίπλοκη συλλογιστική πολλαπλών βημάτων.
Το MIT Technology Review αναφέρει ότι το χαρακτηριστικό του παρουσιάζει επτά δοκιμές που καλύπτουν τη χωρική λογική, τη μνήμη και την προσαρμοστικότητα, την αφηρημένη και οπτική συλλογιστική, την ανθρώπινη διαίσθηση και την αυξανόμενη πολυπλοκότητα. Το άρθρο τοποθετεί την επίλυση παζλ στη μεγαλύτερη ιστορία της αξιολόγησης της τεχνητής νοημοσύνης, σημειώνοντας ότι παιχνίδια όπως το πούλι, το σκάκι και το Go χρησιμοποιούνται ως κρεβάτια δοκιμών από τα πρώτα χρόνια του γηπέδου. Λέει ότι η απόδοση του παζλ έχει βελτιωθεί σημαντικά: μια ομάδα του Πανεπιστημίου της Κολούμπια διαπίστωσε στα τέλη του 2024 ότι κορυφαία μοντέλα έλυσαν μόνο το 18% των παζλ των New York Times Connections, ενώ στις αρχές του 2025 ορισμένα μοντέλα μπορούσαν να τα λύσουν σχεδόν τέλεια κάθε φορά. Η πηγή δεν προσδιορίζει τα μοντέλα ούτε παρέχει μια τυποποιημένη σύγκριση μεταξύ των παραδειγμάτων της δυνατότητας.
Το MIT Technology Review λέει ότι ο χωρικός συλλογισμός παραμένει μια σημαντική αδυναμία. Η ενότητα της νοητικής περιστροφής ζητά από τους αναγνώστες να αναγνωρίσουν ένα τρισδιάστατο αντικείμενο που φαίνεται από άλλη γωνία και το άρθρο αναφέρει ότι τα γλωσσικά μοντέλα με δυνατότητες οπτικής εισαγωγής εξακολουθούν να έχουν πολύ κακή απόδοση σε τέτοιες εργασίες. Το χαρακτηριστικό συνδέει αυτή τη δυσκολία με ισχυρισμούς σχετικά με συστήματα τεχνητής νοημοσύνης που αναπτύσσουν παγκόσμια μοντέλα, υποστηρίζοντας ότι τα τρέχοντα μεγάλα γλωσσικά μοντέλα δεν φαίνεται να χειρίζονται τρισδιάστατα αντικείμενα με τον ίδιο τρόπο που θα μπορούσαν οι ειδικοί στον χώρο. Το άρθρο περιγράφει επίσης ένα πρόβλημα μνήμης και προσαρμοστικότητας: τα μοντέλα που έχουν εκπαιδευτεί σε μεγάλες ποσότητες πληροφοριών μπορεί να αναγνωρίσουν ένα οικείο μοτίβο παζλ και να παραβλέψουν μια μικρή αλλαγή. Αναφέρει μια μελέτη Google του 2024 και το Πανεπιστήμιο του Illinois Urbana-Champaign που περιλαμβάνει παραλλαγές παζλ Knights και Knaves ως απόδειξη αυτής της ανησυχίας.
Στη συνέχεια, το χαρακτηριστικό στρέφεται σε δισδιάστατη αφαίρεση και οπτικό συλλογισμό. Το MIT Technology Review αναφέρει ότι τα μοντέλα αποδίδουν καλύτερα σε παζλ ARC-AGI όταν τα πλέγματα παρέχονται ως αριθμητικές συμβολοσειρές που κωδικοποιούν χρώματα κελιών παρά ως εικόνες. Λέει επίσης ότι η έρευνα έχει βρει ότι τα μοντέλα μπορούν μερικές φορές να φτάσουν στη σωστή απάντηση μέσω περίπλοκων, μη γενικεύσιμων κανόνων, ενώ οι άνθρωποι μπορεί να βασίζονται σε απλούστερες οπτικές έννοιες. Το άρθρο παρουσιάζει ερωτήσεις SimpleBench, προβλήματα Knights και Knaves και ένα παζλ μετασχηματισμού ARC-AGI ως παραδείγματα εργασιών που μπορούν να εκθέσουν αυτές τις διαφορές.
Περιγράφει χωριστά τεστ διαίσθησης στα οποία οι άνθρωποι δίνουν συχνά γρήγορες αλλά λανθασμένες απαντήσεις, ενώ τα μοντέλα μπορεί να ανταποκρίνονται πιο εσκεμμένα. Ένα παράδειγμα ρωτά πόσο χρόνο θα χρειαζόταν μια σπηλιά για να γεμίσει κατά το ήμισυ όταν ο πληθυσμός της νυχτερίδας διπλασιάζεται καθημερινά. Ένας άλλος ζητά από τους αναγνώστες να προσδιορίσουν ένα απόσπασμα που σχετίζεται με την Αλίκη.
Τέλος, το MIT Technology Review αναφέρει ότι η απόδοση συχνά επιδεινώνεται καθώς τα προβλήματα γίνονται πιο περίπλοκα. Επικαλείται μια μελέτη Apple που διαπίστωσε ότι τα μοντέλα γλώσσας θα μπορούσαν να λύσουν απλές εκδόσεις του Πύργου του Ανόι και προβλήματα διέλευσης ποταμού, αλλά άρχισαν να παραπαίουν όταν ο αριθμός των δίσκων ή των ατόμων έφτασε τους έξι ή περισσότερους. Αναφέρει επίσης εργασίες ερευνητών στο Πανεπιστήμιο της Ουάσιγκτον, στο Πανεπιστήμιο του Στάνφορντ και στο Ινστιτούτο Άλεν που βρίσκουν παρόμοιες δυσκολίες με παζλ λογικού πλέγματος. Το χαρακτηριστικό σημειώνει ότι οι σχολιαστές αμφισβήτησαν εάν αυτά τα αποτελέσματα αποκαλύπτουν έναν μοναδικό περιορισμό συλλογιστικής παρόμοιας με μηχανή ή απλώς αντικατοπτρίζουν το γεγονός ότι οι άνθρωποι κάνουν επίσης περισσότερα λάθη καθώς αυξάνεται η πολυπλοκότητα. Επομένως, τα παραδείγματά του από τη διέλευση του ποταμού και το λογικό πλέγμα δοκιμάζουν όχι μόνο εάν ένα μοντέλο μπορεί να δώσει μια απάντηση, αλλά αν μπορεί να διατηρήσει περιορισμούς σε πολλαπλές συνδεδεμένες αφαιρέσεις.
Στοιχεία πηγής: technologyreview.com ↗
Γιατί έχει σημασία
Το χαρακτηριστικό δείχνει γιατί οι ευρείες ισχυρισμοί σχετικά με την ευφυΐα AI μπορεί να είναι παραπλανητικές. Ένα μοντέλο μπορεί να έχει καλή απόδοση σε ασήμαντα στοιχεία ή σε ένα οικείο σημείο αναφοράς, ενώ αποτυγχάνει μια μικρή αλλαγή στη διατύπωση, έναν οπτικό μετασχηματισμό ή ένα πρόβλημα που απαιτεί πολλά εξαρτημένα βήματα. Αυτές οι διαφορές έχουν σημασία όταν τα συστήματα χρησιμοποιούνται για αποφάσεις και όχι για επιδείξεις.
Το κεντρικό μάθημα είναι ότι η απόδοση σε μια κατηγορία τεστ δεν πρέπει να αντιμετωπίζεται ως γενικό μέτρο ευφυΐας. Τα παραδείγματα του MIT Technology Review καλύπτουν εργασίες που φαίνονται επιφανειακά απλές, αλλά απαιτούν διαφορετικές δυνατότητες: περιστροφή ενός αντικειμένου νοερά, παρακολούθηση αλήθειας και ψεύδους σε δηλώσεις, συμπέρασμα ενός οπτικού κανόνα, αντίσταση σε μια παραπλανητική διαίσθηση ή σχεδιασμός μιας ακολουθίας υπό περιορισμούς. Ένα σύστημα μπορεί να είναι ασυνήθιστα ισχυρό σε έναν τομέα και αναξιόπιστο σε έναν άλλο. Αυτή η ανομοιομορφία είναι ιδιαίτερα σημαντική όταν οι χρήστες ερμηνεύουν τις ρέουσες απαντήσεις ως απόδειξη ότι ένα μοντέλο κατανοούσε το υποκείμενο πρόβλημα.
Το άρθρο επισημαίνει επίσης ένα πρόβλημα αξιολόγησης: η μορφή μιας εργασίας μπορεί να επηρεάσει ουσιαστικά το αποτέλεσμα. Το MIT Technology Review αναφέρει ότι η απόδοση του ARC-AGI βελτιώνεται όταν τα οπτικά πλέγματα μετατρέπονται σε αριθμητικές αναπαραστάσεις. Αυτό υποδηλώνει ότι μια βαθμολογία μπορεί να αντικατοπτρίζει όχι μόνο τη συλλογιστική ικανότητα του μοντέλου αλλά και τον τρόπο που κωδικοποιείται και παρουσιάζεται το πρόβλημα. Η ίδια ανησυχία ισχύει και για γνωστά παζλ. Εάν ένα μοντέλο έχει συναντήσει μια κοντινή παραλλαγή κατά τη διάρκεια της εκπαίδευσης, μια σωστή απάντηση μπορεί να αντικατοπτρίζει την αναγνώριση ή την ανάκτηση προτύπων παρά την ικανότητα προσαρμογής ενός κανόνα σε μια νέα περίπτωση. Η πηγή δεν καθορίζει πόσο συχνά εμφανίζεται κάποιος μηχανισμός στα αναπτυγμένα συστήματα.
Αυτοί οι περιορισμοί έχουν πρακτικές συνέπειες για οποιονδήποτε χρησιμοποιεί τεχνητή νοημοσύνη στην εκπαίδευση, το λογισμικό, την έρευνα, τη διοίκηση ή άλλες ρυθμίσεις που περιλαμβάνουν άγνωστες περιπτώσεις. Ένα μοντέλο που πετυχαίνει σε παραδείγματα ρουτίνας μπορεί να εξακολουθεί να αποτυγχάνει όταν αλλάζει η διατύπωση, όταν αλληλεπιδρούν αρκετοί περιορισμοί ή οι σχετικές πληροφορίες είναι οπτικές και όχι κειμενικές. Η δυνατότητα δεν αναφέρει μια κυκλοφορία νέου προϊόντος, μια νέα έκδοση μοντέλου ή μια ελεγχόμενη αξιολόγηση ενός συγκεκριμένου εμπορικού συστήματος. Η αξία του είναι επεξηγηματική: δίνει στους αναγνώστες συγκεκριμένους τρόπους να καταλάβουν γιατί τα κέρδη αναφοράς και η εκλεπτυσμένη γλώσσα δεν καθιερώνουν από μόνα τους ισχυρή συλλογιστική. Το άρθρο διατηρεί επίσης ένα σημαντικό προσόν: οι άνθρωποι έχουν τις δικές τους προκαταλήψεις και μπορούν να είναι πιο αργοί ή λιγότερο αξιόπιστοι σε ορισμένα προβλήματα.
Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα
Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.
Which component of an AI application is the machine-learning model itself?
Τι να παρακολουθήσετε στη συνέχεια
Οι μελλοντικές αξιολογήσεις θα πρέπει να δοκιμάσουν περισσότερα από τα αποτελέσματα των επικεφαλίδων. Τα σημαντικά ερωτήματα περιλαμβάνουν εάν τα μοντέλα μπορούν να γενικευθούν σε άγνωστα προβλήματα, εάν οι απαντήσεις τους εξαρτώνται από τον τρόπο αναπαράστασης των πληροφοριών, πώς αλλάζει η απόδοση καθώς αυξάνεται η πολυπλοκότητα και εάν η επιτυχία αντανακλά μια επαναχρησιμοποιήσιμη στρατηγική ή απομνημονευμένα μοτίβα.
Η επόμενη χρήσιμη ανάπτυξη θα ήταν η ευρύτερη, αναπαραγώγιμη δοκιμή σε μοντέλα και μορφές εργασιών. Η δυνατότητα του MIT Technology Review δεν παρέχει ούτε μία κάρτα βαθμολογίας που να καλύπτει και τις επτά δοκιμές, ούτε η πηγή καθορίζει ονόματα μοντέλων, εκδόσεις, μεγέθη δειγμάτων, συνθήκες προτροπής ή ποσοστά σφαλμάτων για τα περισσότερα παραδείγματα. Αυτές οι λεπτομέρειες θα χρειαστούν για να καθοριστεί εάν οι αναφερόμενες αδυναμίες είναι ευρέως διαδεδομένες, συγκεντρωμένες σε συγκεκριμένες οικογένειες μοντέλων ή ευαίσθητες στον τρόπο χορήγησης των δοκιμών.
Οι ανεξάρτητες αξιολογήσεις θα πρέπει επίσης να διαχωρίζουν τις αποτυχίες οπτικής αντίληψης από τις αποτυχίες συλλογισμού, διατηρώντας σταθερό το υποκείμενο παζλ ενώ μεταβάλλεται η αναπαράστασή του. Οι ερευνητές και οι αξιολογητές θα πρέπει επίσης να παρακολουθούν εάν τα μοντέλα βελτιώνονται μέσω της γνήσιας γενίκευσης ή μέσω της μεγαλύτερης έκθεσης σε υλικό που μοιάζει με σημείο αναφοράς. Η συζήτηση του άρθρου για τα παζλ Connections και τις παραλλαγές των Knights and Knaves δείχνει γιατί η μόλυνση και η εξοικείωση έχουν σημασία. Ένα μοντέλο που έχει καλή απόδοση σε δημοσιευμένες ή στενά συνδεδεμένες ερωτήσεις μπορεί να μην είναι εξίσου ικανό σε προβλήματα που δημιουργούνται πρόσφατα με την ίδια υποκείμενη δομή. Επομένως, η δοκιμή θα πρέπει να περιλαμβάνει παζλ, αλλαγμένη διατύπωση, άγνωστες οπτικές διατάξεις και εργασίες που απαιτούν επεξήγηση ή έλεγχο ενδιάμεσων περιορισμών χωρίς να υποθέσουμε ότι μια πειστική απάντηση είναι σωστή.
Η πολυπλοκότητα και η μεταφορά στον πραγματικό κόσμο παραμένουν ανοιχτά ερωτήματα. Το MIT Technology Review αναφέρει ότι η απόδοση μπορεί να χαλάσει καθώς αυξάνεται ο αριθμός των στοιχείων ή των απαιτούμενων βημάτων, αλλά η πηγή δεν καθορίζει πώς αυτά τα ευρήματα μεταφράζονται σε πρακτικά συστήματα με εργαλεία, ανάκτηση, εξωτερική μνήμη ή ανθρώπινη επίβλεψη. Οι μελλοντικές αναφορές θα πρέπει να παρακολουθούν εάν τέτοιες προσθήκες βελτιώνουν την αξιοπιστία, απλώς βοηθούν τα μοντέλα να αναζητούν πιο αποτελεσματικά ή εισάγουν νέους τρόπους αποτυχίας. Οι αναγνώστες θα πρέπει επίσης να προσέχουν για αξιολογήσεις που μετρούν την ποιότητα της στρατηγικής, όχι μόνο την τελική απάντηση, επειδή ένα σωστό αποτέλεσμα που επιτυγχάνεται μέσω ενός εύθραυστου ή μη γενικευμένου κανόνα μπορεί να μην επιβιώσει από μια μικρή αλλαγή στο πρόβλημα.