Τι έγινε
Οι ερευνητές Michael Wu και Arquimedes Canedo προτείνουν "συμβόλαια ακυρότητας", ένα επίπεδο πρωτοκόλλου για πράκτορες AI που αποθηκεύουν στην κρυφή μνήμη προτάσεις ανάκτησης από σφάλματα API σε όλα τα επεισόδια. Τα συμβόλαια επισυνάπτουν σφραγίδες έκδοσης και υποδείξεις αποθήκευσης κρυφής μνήμης σε κάθε πρόταση, ώστε οι πελάτες να μπορούν να αφαιρούν παλιές καταχωρήσεις μετά από μετατόπιση δεδομένων από την πλευρά του διακομιστή, διατηρώντας παράλληλα καταχωρήσεις που παραμένουν έγκυρες.
Το έγγραφο απευθύνεται σε πράκτορες τεχνητής νοημοσύνης που διατηρούν προτάσεις ανάκτησης μετά την αντιμετώπιση σφαλμάτων API. Η κεντρική του ανησυχία είναι ότι μια πρόταση που λειτούργησε σε ένα επεισόδιο μπορεί να γίνει λανθασμένη μετά από αλλαγές δεδομένων από την πλευρά του διακομιστή. Η επανάληψη μιας επιδιόρθωσης σε κάθε επεισόδιο μπορεί να αποφύγει αυτή τη λειτουργία αποτυχίας, αλλά οι συγγραφείς λένε ότι επιστρέφει τις εξοικονομήσεις από την προσωρινή αποθήκευση. Η προτεινόμενη λύση τους, που ονομάζεται συμβόλαια ακυρότητας, προσθέτει μεταδεδομένα πρωτοκόλλου σε κάθε πρόταση ανάκτησης αντί να αντιμετωπίζει την κρυφή μνήμη ως ένα αδιαφοροποίητο μπλοκ.
Το συμβόλαιο επισυνάπτει σφραγίδες έκδοσης και υποδείξεις προσωρινής αποθήκευσης σε προτάσεις. Στη συνέχεια, ο πελάτης μπορεί να εξαλείψει εγγραφές που σχετίζονται με αλλαγμένα δεδομένα, διατηρώντας παράλληλα τις εγγραφές που εξακολουθούν να είναι έγκυρες. Οι συγγραφείς διαχωρίζουν την εξοικονόμηση που προκύπτει σε εγκυρότητα - το κλάσμα των αποθηκευμένων προτάσεων που παραμένουν σωστές μετά από ένα συμβάν drift - και τη συμμόρφωση - το κλάσμα που εφαρμόζει σωστά ένας σχεδιαστής στην πρώτη του προσπάθεια. Το έγγραφο λέει ότι η εγκυρότητα καθορίζεται από το πρωτόκολλο και είναι ανεξάρτητη από τον προμηθευτή, ενώ η συμμόρφωση εξαρτάται από το μοντέλο σχεδιασμού.
Η αξιολόγηση κάλυψε επτά μοντέλα, τρεις διαδρομές εξυπηρέτησης, δύο τομείς και περίπου 9.400 επεισόδια. Η περίληψη αναφέρει ότι η ακύρωση σε επίπεδο σειράς αύξησε τη συμμόρφωση μεταξύ 0 και 66,7 ποσοστιαίες μονάδες στα μοντέλα. τρία μοντέλα σημείωσαν κέρδη μεταξύ 55,6 και 66,7 μονάδων. Τέσσερα από τα επτά μοντέλα ανάκτησαν το 29% έως το 33% του βασικού κόστους διακριτικού. Η δημοσίευση αναφέρει επίσης τέλεια ακρίβεια εξώθησης, 1,00, σε ευθυγράμμιση σειράς κάτω από το μαντείο σε επίπεδο σειράς που περιγράφεται στην Ενότητα 4.1.
Τα αποτελέσματα διέφεραν απότομα ανά μοντέλο. Οι συγγραφείς αναφέρουν 100% συμμόρφωση με την πρώτη δοκιμή για το Claude Haiku 4.5 με πανομοιότυπα byte καλωδίων, σε σύγκριση με 11% ή λιγότερο για το Claude Sonnet 5. Αποδίδουν τη συμπεριφορά του Sonnet στον συντηρητισμό του σχήματος εισόδου: η άρνηση διορθώσεων που προσθέτουν τα αρχικά πεδία απουσιάζουν. Αντίθετα, η ακύρωση σε επίπεδο πίνακα κατέστρεψε τις εγγραφές που τοποθετούνταν μαζί και μείωσε τα ποσοστά πρώτης δοκιμής μετά τη μετακίνηση σε 0% σε πέντε από τα επτά μοντέλα. Η σύμβαση πρόσθεσε 15% στο ωφέλιμο φορτίο απόκρισης και οι συγγραφείς αναφέρουν μηδενικές αποτυχίες συμβολαίου σε όλη την αξιολόγηση.
Γιατί έχει σημασία
Το χαρτί πλαισιώνει τη μόνιμη μνήμη πράκτορα ως πρόβλημα αξιοπιστίας και αποτελεσματικότητας: ο επανυπολογισμός διορθώνει κάθε φορά αποφεύγει τις μπαγιάτικες συμβουλές, αλλά θυσιάζει την εξοικονόμηση διακριτικού και κλήσεων μοντέλου που μπορεί να προσφέρει η προσωρινή αποθήκευση. Τα αναφερθέντα αποτελέσματά του υποδηλώνουν ότι η ακύρωση της μνήμης σε επίπεδο σειράς μπορεί να διατηρήσει χρήσιμες καταχωρήσεις κρυφής μνήμης, αν και τα ευρήματα προέρχονται από την αξιολόγηση μιας προεκτύπωσης και δεν καθορίζουν την απόδοση παραγωγής.
Το πρακτικό ζήτημα δεν είναι απλώς αν ένας πράκτορας μπορεί να θυμάται. Είναι αν η μνήμη παραμένει ασφαλής για χρήση όταν αλλάζει μια εξωτερική υπηρεσία. Μια πρόταση ανάκτησης στην κρυφή μνήμη μπορεί να μειώσει την επαναλαμβανόμενη συλλογιστική, τη χρήση διακριτικών και τις κλήσεις μοντέλων, αλλά η ίδια συντόμευση μπορεί να γίνει σιωπηλή αποτυχία εάν το περιβάλλον API ή τα δεδομένα έχουν παρασυρθεί. Το προτεινόμενο πρωτόκολλο καθιστά τις πληροφορίες φρεσκάδας μέρος της αλληλεπίδρασης μεταξύ της υπηρεσίας και του πελάτη.
Η διάκριση του εγγράφου μεταξύ εγκυρότητας και συμμόρφωσης είναι χρήσιμη επειδή διαχωρίζει δύο διαφορετικές πηγές αστοχίας. Ένα πρωτόκολλο μπορεί να προσδιορίσει ποιες καταχωρήσεις προσωρινής αποθήκευσης πρέπει να απορριφθούν, ωστόσο ένας πράκτορας μπορεί να μην εφαρμόσει μια έγκυρη πρόταση. Η αναφερόμενη αντίθεση μεταξύ του Haiku 4.5 και του Sonnet 5 δείχνει ότι η σχεδίαση πρωτοκόλλου από μόνη της δεν μπορεί να καθορίσει εάν ένας σχεδιαστής επωφελείται από τη διατηρημένη μνήμη. Η συμπεριφορά του μοντέλου παραμένει ξεχωριστός λειτουργικός περιορισμός.
Τα αναφερόμενα αποτελέσματα σε επίπεδο σειράς υποδηλώνουν μια πιθανή αρχή σχεδιασμού για συστήματα που αποθηκεύουν πολλές προτάσεις ανάκτησης μαζί: ακυρώστε μόνο τις επηρεαζόμενες καταχωρήσεις όταν το πρωτόκολλο μπορεί να τις αναγνωρίσει. Η σύγκριση σε επίπεδο πίνακα είναι συνεπής στις δοκιμές του χαρτιού, επειδή η ευρεία ακύρωση εξάλειψε άσχετες εγγραφές και παρήγαγε μηδενικούς ρυθμούς πρώτης δοκιμής μετά τη μετατόπιση στα περισσότερα δοκιμασμένα μοντέλα. Αυτό το εύρημα, εάν επαναληφθεί, θα έχει σημασία για το κόστος και την αξιοπιστία των μακροχρόνιων πρακτόρων.
Ο ισχυρισμός αποτελεσματικότητας είναι επίσης περιορισμένος. Οι συγγραφείς αναφέρουν ανάκτηση 29% έως 33% του βασικού κόστους διακριτικού σε τέσσερα μοντέλα, όχι και στα επτά, και το πρωτόκολλο προσθέτει 15% στα ωφέλιμα φορτία απόκρισης. Η πηγή δεν αναφέρει πώς αυτά τα κόστη μεταφράζονται σε καθυστέρηση, εύρος ζώνης, κόστος υποδομής ή αξιοπιστία ορατή από τον χρήστη στην παραγωγή. Ούτε η περίληψη αποδεικνύει ότι οι ελεγμένοι τομείς ή οι διαδρομές εξυπηρέτησης αντιπροσωπεύουν το εύρος των API που χρησιμοποιούνται από τους αναπτυγμένους πράκτορες.
Αυτό είναι μια προεκτύπωση και όχι ένα ανεξάρτητα επικυρωμένο αποτέλεσμα παραγωγής. Η πηγή προσδιορίζει το μέγεθος της αξιολόγησης και τα βασικά αποτελέσματα, αλλά δεν παρέχει τις ταυτότητες πέντε από τα επτά μοντέλα, τα ονόματα των δύο τομέων, τα ακριβή σενάρια μετατόπισης ή εκτιμήσεις αβεβαιότητας. Η τέλεια ακρίβεια εξώθησης συνδέεται ρητά με έναν χρησμό σε επίπεδο σειράς, επομένως δεν πρέπει να θεωρείται ως απόδειξη ότι οι αναπτυγμένοι πελάτες θα γνωρίζουν πάντα ποιες σειρές είναι μπαγιάτικες.
Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα
Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Τι να παρακολουθήσετε στη συνέχεια
Τα βασικά ανοιχτά ερωτήματα είναι εάν το πρωτόκολλο λειτουργεί με περισσότερους σχεδιαστές, υπηρεσίες, τομείς και μοτίβα μετατόπισης του πραγματικού κόσμου και εάν το 15% του ωφέλιμου φορτίου απόκρισης είναι αποδεκτό σε αναπτυγμένα συστήματα. Περαιτέρω έλεγχος θα πρέπει επίσης να εξετάσει την αξιολόγηση της εξώθησης που βασίζεται στο μαντείο, τα άγνωστα μοντέλα μεταξύ των επτά που δοκιμάστηκαν και τα αίτια του μεγάλου κενού συμμόρφωσης μεταξύ των ονομαζόμενων μοντέλων Claude.
Η αναπαραγωγή θα πρέπει να ελέγχει εάν η εγκυρότητα της σφραγίδας έκδοσης παραμένει ντετερμινιστική όταν οι υπηρεσίες αλλάζουν σχήματα, σημασιολογία ή δεδομένα με διαφορετικούς ρυθμούς. Το έγγραφο αναφέρει πανομοιότυπα αποτελέσματα εγκυρότητας σε κάθε μοντέλο και διαδρομή εξυπηρέτησης και μηδενικές αποτυχίες συμβολαίου, αλλά η πηγή δεν περιγράφει το εύρος των γεγονότων drift με αρκετή λεπτομέρεια για να προσδιορίσει πόσο ευρέως ισχύει αυτό το αποτέλεσμα.
Η συμμόρφωση από την πλευρά του μοντέλου αξίζει ξεχωριστή έρευνα. Το αναφερόμενο χάσμα μεταξύ 100% συμμόρφωσης με την πρώτη δοκιμή στο Claude Haiku 4.5 και 11% ή χαμηλότερο στο Claude Sonnet 5 υποδηλώνει ότι οι πράκτορες μπορεί να ερμηνεύουν διαφορετικά το ίδιο ωφέλιμο φορτίο πρωτοκόλλου. Οι μελλοντικές αξιολογήσεις θα πρέπει να διευκρινίσουν εάν το πρόβλημα είναι συγκεκριμένο για τα μοντέλα που ονομάζονται, για σχεδιασμό προτροπής ή σχήματος ή για μια ευρύτερη τάση μεταξύ των σχεδιαστών να απορρίπτουν δομικά άγνωστες διορθώσεις.
Η αντιστάθμιση κόστους θα πρέπει να μετράται πέρα από τα διακριτικά. Η αύξηση του ωφέλιμου φορτίου απόκρισης κατά 15% θα μπορούσε να είναι μικρή ή σημαντική, ανάλογα με τη διάρκεια του επεισοδίου, τις συνθήκες δικτύου και τη συχνότητα επαναχρησιμοποίησης των αποθηκευμένων προτάσεων στην κρυφή μνήμη. Η πηγή αναφέρει ανάκτηση κόστους διακριτικού για τέσσερα μοντέλα, αλλά δεν παρέχει αποτελέσματα καθυστέρησης, εύρους ζώνης, νομισματικά ή ποσοστού αποτυχίας, επομένως αυτά παραμένουν σημαντικά άγνωστα για τους εφαρμοστές.
Ο χρησμός της αξιολόγησης σε επίπεδο σειράς είναι ένα άλλο σημείο που πρέπει να εξεταστεί. Η τέλεια ακρίβεια κάτω από ένα μαντείο δείχνει τη συμπεριφορά της προτεινόμενης ευαισθησίας όταν είναι γνωστή η επηρεαζόμενη σειρά, αλλά δεν αποδεικνύει ότι ένας πραγματικός πελάτης μπορεί να αναγνωρίσει τη σωστή σειρά από συνηθισμένα σήματα υπηρεσίας. Τα στοιχεία σχετικά με την αυτόματη ανίχνευση, τα ψευδώς αρνητικά και τα ψευδώς θετικά θα καθόριζαν πόσο από το αναφερόμενο όφελος επιβιώνει εκτός της πειραματικής ρύθμισης.
Τέλος, η εργασία θα πρέπει να συγκριθεί με άλλες προσεγγίσεις για την ακύρωση της κατάστασης του παράγοντα και της μνήμης υπό τις ίδιες εργασίες και συνθήκες μετατόπισης. Η πηγή δημιουργεί μια πρόταση πρωτοκόλλου και ένα αναφερόμενο σημείο αναφοράς, αλλά δεν καθορίζει τη διαθεσιμότητα, την υιοθέτηση, την ανεξάρτητη αναπαραγωγή ή την υπεροχή της ανάπτυξης σε σχέση με απροσδιόριστες εναλλακτικές λύσεις.