Τι έγινε
Μια νέα μελέτη περίπτωσης arXiv περιγράφει πώς ένα ερευνητικό σύστημα τεχνητής νοημοσύνης βοήθησε τους μαθηματικούς να βελτιώσουν τα γνωστά όρια της σταθεράς Grothendieck, ένα ανοιχτό πρόβλημα που χρονολογείται από το 1953. Η εργασία παρουσιάζει τόσο το μαθηματικό αποτέλεσμα όσο και μια λεπτομερή καταγραφή του πού το σύστημα εκτελούσε καλά, πού έπρεπε να το κατευθύνουν οι άνθρωποι και ποιοι ισχυρισμοί παραμένουν ανθρώπινες-μηχανής.
Η σταθερά Grothendieck μετρά το χάσμα μεταξύ ενός σκληρού συνδυαστικού προβλήματος βελτιστοποίησης και μιας πιο εύκολης ημικαθορισμένης χαλάρωσης. Οι συγγραφείς αναφέρουν ένα νέο διάστημα με κατώτερο όριο 6pi/11, περίπου 1,7135, και άνω όριο περίπου 1,7818. Το συνοδευτικό μαθηματικό χαρτί παρέχει τις αποδείξεις. Το αποτέλεσμα του κατώτερου ορίου είναι αξιοσημείωτο επειδή δεν δημιουργεί ένα σκληρό παράδειγμα. Αντίθετα, δημιουργεί ένα εμπόδιο που εφαρμόζεται στα σχετικά σχήματα στρογγυλοποίησης.
Το ερευνητικό σύστημα συνδύασε ένα συλλογιστικό μοντέλο με έναν παράγοντα κωδικοποίησης. Η εφημερίδα λέει ότι η εκτέλεση χρησιμοποίησε το GPT-5.5-Pro και αργότερα το GPT-5.6-Sol για συλλογισμό, το Claude Code με το Opus και αργότερα το Fable 5 για εκτέλεση και έναν κόμβο τεσσάρων GPU για αριθμητικές αναζητήσεις. Οι περίοδοι σύνδεσης έφεραν συνέχεια μέσω αρχείων, μεταγραφών, αρχείων καταγραφής πειραμάτων και μιας σύνοψης που κατέγραφε αξιώσεις ως αποδεδειγμένες, υποστηριζόμενες αριθμητικά, εικασιακές ή ευρετικές αντί να βασίζονται σε ένα αδιάκοπο περιβάλλον.
Η σειρά κάλυψε περίπου 240 ερευνητικές συνεδρίες από τις 16 Ιουνίου έως τις 24 Ιουλίου, με 2.091 κλήσεις συλλογιστικού μοντέλου και εκτιμώμενα 152 εκατομμύρια διακριτικά με εκτιμώμενο κόστος API 5.400 $. Περίπου 40 χρονολογημένες οδηγίες για τον άνθρωπο καθοδήγησαν το έργο. Όταν η αναζήτηση στο άνω όριο σημείωσε πλάκα, οι χειριστές αναγνώρισαν ότι οι επαναλαμβανόμενες αποτυχίες μπορεί να υποδεικνύουν ένα γενικό εμπόδιο και ανακατεύθυναν το σύστημα προς ένα όρισμα κατώτερου ορίου. Η εργασία περιγράφει αυτή την αλλαγή στην κατεύθυνση της έρευνας ως ανθρώπινη παρέμβαση και όχι ως αυτόνομη απόφαση.
Το σύστημα παρήγαγε ένα κεντρικό αναπλαίσιο και μια πλήρη απόδειξη για το κάτω όριο 6pi/11, το οποίο στη συνέχεια αναθεώρησαν οι συγγραφείς και επαλήθευσαν ανεξάρτητα. Δημιούργησε επίσης ισχυρότερους αριθμούς άνω και κάτω υποψηφίους που πέρασαν το πρωτόκολλο εσωτερικού ελέγχου, αλλά οι συγγραφείς δεν έχουν επαληθεύσει ανεξάρτητα αυτά τα πιστοποιητικά και δεν τα δηλώνουν ως θεωρήματα. Ως εκ τούτου, το έγγραφο διαχωρίζει το επαληθευμένο μαθηματικό αποτέλεσμα από τα πιο εικαστικά αποτελέσματα του συστήματος ή τα αποτελέσματα που έχουν δοκιμαστεί από μηχανή.
Στοιχεία πηγής: Long-horizon AI mathematics case study on arXiv ↗
Γιατί έχει σημασία
Η μελέτη προσφέρει ασυνήθιστα συγκεκριμένα στοιχεία σχετικά με την τεχνητή νοημοσύνη που χρησιμοποιείται σε ένα ερευνητικό πρόγραμμα και όχι σε μία εργασία αναφοράς. Το πιο σημαντικό εύρημα είναι ο καταμερισμός της εργασίας: το σύστημα ήταν ισχυρό στην τεχνική εκτέλεση, ενώ οι ανθρώπινοι ερευνητές παρέμειναν υπεύθυνοι για τον καθορισμό της ατζέντας, την κρίση και την τελική επαλήθευση.
Η έρευνα μακρού ορίζοντα είναι δύσκολη για ένα σύστημα τεχνητής νοημοσύνης, επειδή ο στόχος μπορεί να αλλάξει καθώς συσσωρεύονται αποτυχημένες προσεγγίσεις. Ένας χρήσιμος συνεργάτης πρέπει να διατηρήσει αυτό που δοκιμάστηκε, να διακρίνει ένα αδιέξοδο από μια άλυτη ιδέα και να αποφασίσει πότε μια νέα ερώτηση είναι πιο πολύτιμη από μια άλλη τοπική βελτιστοποίηση. Οι ετικέτες μνήμης και αξιώσεων που βασίζονται σε αρχεία των συγγραφέων είναι μια προσπάθεια να γίνει ορατή και ελεγχόμενη αυτή η κατάσταση της έρευνας αντί να επιτρέψει σε μια εύρυθμη απάντηση να υποστηρίξει την πρόοδο.
Η ανακάλυψη με το κάτω όριο δείχνει γιατί η ανθρώπινη κρίση εξακολουθεί να έχει σημασία ακόμα και όταν ένας πράκτορας μπορεί να εκτελέσει μαθηματικά. Οι χειριστές παρατήρησαν ότι πολλές απόπειρες κατασκευών απέτυχαν με τον ίδιο τρόπο και παρείχαν τον εννοιολογικό άξονα: αποδείξτε την ίδια την επαναλαμβανόμενη απόφραξη. Το σύστημα βοήθησε στη συνέχεια να επισημοποιηθεί και να πιστοποιηθεί το επιχείρημα. Αυτή η ακολουθία είναι πιο κοντά στην εποπτευόμενη εξερεύνηση παρά σε έναν ανεξάρτητο μαθηματικό μηχανών, και η διάκριση έχει σημασία όταν περιγράφεται τι υποστηρίζουν τα στοιχεία.
Η ανεξάρτητη επαλήθευση είναι η πύλη απελευθέρωσης για το αποτέλεσμα. Η μελέτη περίπτωσης λέει ότι το κάτω όριο ελέγχθηκε από τους συγγραφείς και ότι πλήρεις αποδείξεις εμφανίζονται σε ένα συνοδευτικό έγγραφο. Δεν λέει ότι κάθε αριθμός που παράγεται κατά τη διάρκεια της εκτέλεσης είναι σωστός. Η διατήρηση των αξιώσεων σε επίπεδο θεωρημάτων, των υποψηφίων που ελέγχονται από μηχανή και των υποθέσεων χωριστά δίνει στους αναγνώστες έναν τρόπο να αξιολογήσουν τη συνεισφορά χωρίς να αποδεχτούν την εσωτερική εμπιστοσύνη του συστήματος AI ως μαθηματική απόδειξη.
Για τους ερευνητικούς οργανισμούς, το πρακτικό μάθημα είναι λειτουργικό. Ένα σύστημα τεχνητής νοημοσύνης μπορεί να αναζητήσει βιβλιογραφία, να γράψει κώδικα, να εκτελέσει πειράματα, να διατηρήσει αποτυχημένες προσπάθειες και να προτείνει μετασχηματισμούς, αλλά η γύρω ροή εργασιών χρειάζεται προέλευση, αναπαραγόμενους υπολογισμούς, ρητά ανθρώπινα σημεία ελέγχου και έναν τρόπο να ανακατασκευάσει γιατί η ομάδα άλλαξε κατεύθυνση. Το αναφερόμενο κόστος και ο υπολογισμός καθιστούν επίσης σαφές ότι η ικανότητα μακροπρόθεσμου ορίζοντα δεν είναι μόνο ζήτημα ευφυΐας του μοντέλου. εξαρτάται από τη σκαλωσιά, τον χρόνο και τη διαρκή επίβλεψη.
Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα
Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.
What most distinguishes an AI agent from a basic chatbot?
Τι να παρακολουθήσετε στη συνέχεια
Το επόμενο ερώτημα είναι αν αυτό το μοτίβο συνεργασίας γενικεύεται πέρα από ένα πρόβλημα και μια ομάδα και αν οι ανεξάρτητοι ερευνητές μπορούν να αναπαράγουν το επαληθευμένο αποτέλεσμα ενώ μετρούν το κόστος και την αξιοπιστία κάθε συνεισφοράς ανθρώπου και τεχνητής νοημοσύνης.
Η αναπαραγωγή θα πρέπει να δοκιμάσει άλλους μαθηματικούς τομείς, τύπους προβλημάτων και ερευνητικά συστήματα με διαφορετική μνήμη και σχέδια εργαλείων. Το πρόβλημα του Grothendieck ήρθε ήδη με ένα ουσιαστικό ανθρώπινο πλαίσιο, συσσωρευμένες σημειώσεις, μηχανήματα πιστοποίησης και οδηγίες υποψηφίων. Αυτή η προηγούμενη δομή βοήθησε την εκτέλεση, επομένως μελλοντικές μελέτες θα πρέπει να αναφέρουν πόσο από την κατάσταση της έρευνας παρασχέθηκε εκ των προτέρων και πώς αλλάζουν τα αποτελέσματα όταν το σύστημα πρέπει να καθορίσει το ίδιο το πρόβλημα.
Οι ερευνητές θα πρέπει επίσης να συγκρίνουν την τεχνική εκτέλεση με την κρίση της έρευνας χρησιμοποιώντας προοπτικά μέτρα. Οι χρήσιμες μετρήσεις θα μπορούσαν να περιλαμβάνουν την ποιότητα των επιλεγμένων κατευθύνσεων, τον χρόνο εγκατάλειψης μιας αποτυχημένης διαδρομής, το ποσοστό των μη υποστηριζόμενων αξιώσεων, τον αριθμό των ανθρώπινων παρεμβάσεων και το κλάσμα των αποτελεσμάτων που επιβιώνουν από ανεξάρτητους ελέγχους. Μια λεπτομερής μελέτη περίπτωσης μπορεί να δείξει τι συνέβη, αλλά απαιτούνται ελεγχόμενες συγκρίσεις για να εκτιμηθεί πότε ένας συνεργάτης τεχνητής νοημοσύνης βελτιώνει τη διαδικασία αντί απλώς να προσθέσει ένα άλλο επίπεδο αξιολόγησης.
Το όριο μεταξύ της επαλήθευσης μηχανής και της ανθρώπινης επαλήθευσης αξίζει συνεχούς προσοχής. Η αριθμητική διαστήματος, οι βοηθοί απόδειξης, οι δοκιμές και οι αντίθετοι έλεγχοι μπορούν να εντοπίσουν πολλά σφάλματα, ωστόσο ένα πιστοποιητικό μπορεί να κωδικοποιεί λάθος στόχο ή να εξαρτάται από υποθέσεις που δεν αμφισβητήθηκαν ποτέ. Η εργασία παρακολούθησης θα πρέπει να δημοσιεύει πλήρη τεχνουργήματα, να επαναλαμβάνει τα ισχυρότερα μη επαληθευμένα όρια και να κάνει τα αποτυχημένα ή αποσυρθέντα αποτελέσματα τόσο ορατά όσο και τα επιτυχημένα.
Τέλος, οι εκδόσεις μοντέλων, οι προτροπές, οι οδηγίες διεύθυνσης, ο κώδικας, ο υπολογισμός και οι μεταγραφές θα πρέπει να διατηρούνται όπου το επιτρέπουν η άδεια χρήσης και το απόρρητο. Το τρέχον έγγραφο είναι πολύτιμο εν μέρει επειδή αναφέρει αυτές τις συνθήκες και περιγράφει τις αδυναμίες του συστήματος, συμπεριλαμβανομένης της εύθραυστης εκπροσώπησης του κράτους έρευνας και της περιορισμένης αυτονομίας στην κρίση. Έως ότου άλλες ομάδες αναπαράγουν το μοτίβο, αυτό είναι ισχυρή απόδειξη μαθηματικής προόδου με τη βοήθεια τεχνητής νοημοσύνης, όχι απόδειξη ότι τα συστήματα τεχνητής νοημοσύνης μπορούν να διεξάγουν ανεξάρτητα έρευνα ανοιχτού τύπου.