Τι έγινε
Μια νέα προεκτύπωση που δημοσιεύτηκε στις 11 Αυγούστου ονομάζει μια παρατηρούμενη λειτουργία αποτυχίας σε αποθετήρια αντιπροσώπων κωδικοποίησης "καταστροφική ανάμνηση": τα αρχεία οδηγιών έργου συνεχίζουν να συσσωρεύουν κανόνες επειδή η προσθήκη μιας προφύλαξης είναι φθηνή, ενώ η ασφαλής διαγραφή ενός παλιού κανόνα γίνεται πιο δύσκολη αφού εξαφανιστεί η αρχική του λογική.
Οι ερευνητές συγκέντρωσαν 247.694 χρόνους ζωής εντολών και 299.440 μεταβάσεις δέσμευσης σε δέσμευση από 1.867 δημόσιους χώρους αποθήκευσης που περιείχαν αρχεία όπως το CLAUDE.md. Παρακολούθησαν μεμονωμένες οδηγίες μέσω τροποποιήσεων και αναφέρουν ότι τα αρχεία αυξήθηκαν κατά 226% κατά τη διάρκεια ζωής τους, προσθέτοντας κατά μέσο όρο 4,9 καθαρές οδηγίες ανά δέσμευση τροποποίησης. Η μελέτη αντιμετωπίζει αυτά τα στοιχεία ως απόδειξη της επίμονης συσσώρευσης στο δείγμα της, όχι ως απόδειξη ότι κάθε οδηγία ήταν περιττή ή ότι όλα τα έργα κωδικοποίησης πρακτόρων συμπεριφέρονται με τον ίδιο τρόπο.
Ο κεντρικός μηχανισμός του χαρτιού είναι η ασύμμετρη απόδειξη. Ένας συντηρητής ή ένας παράγοντας κωδικοποίησης μπορεί να προσαρτήσει μια νέα εντολή μετά από ένα λάθος χωρίς να ανακατασκευάσει κάθε αλληλεπίδραση μεταξύ των κανόνων που υπάρχουν ήδη. Η μεταγενέστερη διαγραφή είναι πιο επικίνδυνη: από τη στιγμή που η αιτία αποτυχίας και το περιβάλλον περιβάλλον εξαφανιστούν, η κατάργηση μιας οδηγίας μπορεί να απαιτεί έλεγχο εάν εξακολουθεί να αποτρέπει μια παλινδρόμηση σε πολλούς συνδυασμούς των υπόλοιπων οδηγιών. Στα δεδομένα του αποθετηρίου, ο εκτιμώμενος κίνδυνος διαγραφής μειώθηκε καθώς η οδηγία παλαίωσε, με αναφερόμενη κλίση log-hazard -0,032 ανά δέσμευση.
Για να δοκιμάσουν μια πιθανή λύση, οι συγγραφείς δημιούργησαν εργασίες που ακολουθούν τις οδηγίες αντιστρέφοντας τους περιορισμούς IFEval και στη συνέχεια συνέκριναν τις προτροπές που περιείχαν απλούς κανόνες με τις προτροπές που διατήρησαν επίσης σύντομα σχόλια εξηγώντας γιατί υπήρχε κάθε κανόνας. Στην ελεγχόμενη ρύθμισή τους, τα μη σχολιασμένα μηνύματα συσσώρευσαν 211,3% επιπλέον οδηγίες, ενώ τα σχολιασμένα μηνύματα έληξαν με 1,4% υπέρβαση. Τα σχόλια δεν ήταν επιπλέον εντολές για το μοντέλο. ήταν συμπαγής προέλευσης που προορίζονταν να καταστήσουν ελεγχόμενες τις μεταγενέστερες αποφάσεις αφαίρεσης.
Η ομάδα αξιολόγησε επίσης εάν μικρότερες, καλύτερα τεκμηριωμένες προτροπές βοήθησαν τους πράκτορες να ακολουθήσουν οδηγίες. Στο σημείο αναφοράς που προέρχεται από το WildIFEval, η εφημερίδα αναφέρει κέρδη έως και 23,1 ποσοστιαίες μονάδες όταν διατηρήθηκαν οι συλλογισμοί και μπορούσαν να αφαιρεθούν οι απαρχαιωμένοι κανόνες. Αυτά τα αποτελέσματα είναι αξιώσεις από μια πρόσφατα δημοσιευμένη προεκτύπωση που δεν έχει αξιολογηθεί από ομοτίμους. Η εργασία δεν αποδεικνύει ότι τα σχόλια από μόνα τους θα βελτιώσουν κάθε παράγοντα κωδικοποίησης, αποθετήριο, γλώσσα ή ροή εργασιών παραγωγής.
Στοιχεία πηγής: Catastrophic remembering research paper on arXiv ↗
Γιατί έχει σημασία
Τα αρχεία εντολών σε επίπεδο αποθετηρίου γίνονται ανθεκτική λειτουργική μνήμη για πράκτορες κωδικοποίησης, επομένως η ανεξέλεγκτη ανάπτυξη μπορεί να αυξήσει το κόστος συμβολαίων, να διατηρήσει τους απαρχαιωμένους περιορισμούς και να κάνει τους κανόνες που διέπουν τις αυτοματοποιημένες αλλαγές κώδικα πιο δύσκολους για τους χρήστες.
Ο πρακτικός κίνδυνος δεν είναι απλώς ένα μακρύ αρχείο. Κάθε οδηγία ανταγωνίζεται για την προσοχή ενός μοντέλου και μπορεί να αλληλεπιδράσει με νεότερους κανόνες, περιγραφές εργαλείων, περιβάλλον κώδικα και αίτημα του χρήστη. Μια οδηγία που συντάχθηκε για την αποτροπή μιας ιστορικής αποτυχίας μπορεί να γίνει άσχετη μετά τις αλλαγές της βάσης κώδικα, να έρχεται σε σύγκρουση με μια νεότερη πολιτική ή να περιορίσει υπερβολικά άσχετη εργασία. Εάν κανείς δεν μπορεί να ανακατασκευάσει γιατί υπάρχει, η ασφαλέστερη τοπική επιλογή είναι συχνά η διατήρησή του, γεγονός που μεταφέρει το κόστος καθαρισμού σε μελλοντικές δεσμεύσεις.
Αυτό το μοτίβο έχει σημασία πέρα από το CLAUDE.md. Οι ομάδες αποθηκεύουν ολοένα και περισσότερο συμβάσεις, όρια ασφαλείας, εντολές δοκιμών, αρχιτεκτονικές αποφάσεις και προφυλάξεις κατά την ανάπτυξη στην καθοδήγηση έργου που είναι αναγνώσιμη από μηχανή. Αυτά τα αρχεία μπορούν να βελτιώσουν τη συνοχή και να μειώσουν τα επαναλαμβανόμενα λάθη, αλλά γίνονται επίσης επιφάνεια διακυβέρνησης: οι άνθρωποι θα πρέπει να είναι σε θέση να προσδιορίζουν ποιος εισήγαγε έναν επακόλουθο κανόνα, ποια στοιχεία τον δικαιολογούσαν και ποια προϋπόθεση θα επέτρεπε την απόσυρσή του. Ένα αιτιολογικό σχόλιο είναι μια ελαφριά εκδοχή αυτής της διαδρομής ελέγχου.
Το αποτέλεσμα προτείνει μια χρήσιμη αρχή σχεδιασμού για τη μνήμη του πράκτορα: η ανάμνηση πρέπει να περιλαμβάνει τις προϋποθέσεις για τη λήθη. Αντί να καταγράφει μόνο το "πάντα να κάνεις X", ένα σύστημα μπορεί να διατηρήσει την παρατηρούμενη αποτυχία, το πεδίο εφαρμογής του κανόνα, το σχετικό στοιχείο ή δοκιμή και μια ενεργοποίηση ελέγχου. Αυτό δεν αυτοματοποιεί τη διαγραφή, αλλά παρέχει σε έναν μεταγενέστερο συντηρητή στοιχεία για να αποφασίσει εάν ο περιορισμός εξακολουθεί να προστατεύει την ορθότητα ή απλώς αντανακλά ένα παλιό περιβάλλον.
Υπάρχει επίσης μια οπτική γωνία δημοσίου συμφέροντος, καθώς οι πράκτορες κωδικοποίησης αγγίζουν πιο επακόλουθο λογισμικό. Οι συσσωρευμένες ιδιωτικές οδηγίες μπορούν να διαμορφώσουν αθόρυβα αποφάσεις ασφάλειας, συμπεριφορά προσβασιμότητας, χειρισμό δεδομένων ή πώς ένας πράκτορας αποκρίνεται σε αποτυχίες. Τα μικρότερα αρχεία δεν είναι αυτόματα ασφαλέστερα και ο επιθετικός καθαρισμός θα μπορούσε να καταργήσει μια ζωτική προστασία. Το χρήσιμο αποτέλεσμα είναι η ιχνηλασιμότητα: λιγότεροι ανεξήγητοι κανόνες, ρητή ιδιοκτησία και πρακτικές αναθεώρησης που επιτρέπουν στους ανθρώπους να αμφισβητούν τόσο τις προσθήκες όσο και τις διαγραφές.
Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα
Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Τι να παρακολουθήσετε στη συνέχεια
Η επόμενη δοκιμή είναι η ανεξάρτητη αναπαραγωγή σε γλώσσες, οργανισμούς, προϊόντα αντιπροσώπων και αποθετήρια μεγαλύτερης διάρκειας, ακολουθούμενη από μελλοντικές δοκιμές που μετρούν εάν η τεκμηριωμένη εκκαθάριση βελτιώνει την ποιότητα του κώδικα χωρίς να διαγράφει σημαντικές διασφαλίσεις.
Το δείγμα παρατήρησης έχει όρια επιλογής. Τα δημόσια αποθετήρια που δεσμεύουν αρχεία εντολών πράκτορα μπορεί να διαφέρουν από τις βάσεις κώδικα ιδιωτικών επιχειρήσεων και το ιστορικό αποθετηρίων δεν μπορεί να αποκαλύψει κάθε συζήτηση ή περιστατικό εκτός πλατφόρμας που οδήγησε σε έναν κανόνα. Η ανάπτυξη μπορεί επίσης να είναι ορθολογική όταν ένα έργο επεκτείνεται. Οι μελλοντικές αναλύσεις θα πρέπει να διαχωρίζουν τη χρήσιμη κάλυψη νέων στοιχείων από τις διπλότυπες, αντιφατικές ή παρωχημένες οδηγίες και να αναφέρουν πώς διαφέρουν τα αποτελέσματα ανάλογα με την ηλικία, το μέγεθος, τη γλώσσα, τον αριθμό των συντελεστών και την πλατφόρμα πρακτόρων.
Τα ελεγχόμενα πειράματα χρειάζονται ευρύτερη επικύρωση. Οι εργασίες προέκυψαν από δείκτες αναφοράς που ακολουθούν τις οδηγίες και όχι από μήνες ζωντανής συντήρησης λογισμικού και η αντιστοίχιση του χαρτιού ελέγχθηκε σε ένα δείγμα 50 μετάβασης. Ένας συγγραφέας δημιούργησε τον σχολιασμό με το χέρι που χρησιμοποιήθηκε σε μέρος της επικύρωσης. Η μελέτη δεν κάλυπτε μη αγγλικά αρχεία οδηγιών και δεν σάρωνε κάθε όριο που χρησιμοποιείται για να αποφασίσει πότε μια αλλαγή υπολογίζεται ως επανεγγραφή και όχι ως συνέχεια μιας εντολής.
Τα σχόλια μπορούν να διατηρήσουν λανθασμένες αιτιολογίες τόσο εύκολα όσο και σωστές. Ως εκ τούτου, οι ομάδες θα πρέπει να δοκιμάσουν τη δομημένη προέλευση έναντι εναλλακτικών, όπως συνδεδεμένα ζητήματα, αποτυχημένες δοκιμές παλινδρόμησης, ημερομηνίες λήξης, πεδία ιδιοκτησίας ή αυτοματοποιημένους ελέγχους που επισημαίνουν διπλότυπες και αντικρουόμενες οδηγίες. Η ασφαλέστερη ροή εργασιών θα πρότεινε αφαιρέσεις, θα έδειχνε τα αποδεικτικά στοιχεία και τις επηρεαζόμενες δοκιμές και θα απαιτούσε επανεξέταση για κανόνες υψηλού αντίκτυπου αντί να επιτρέψει σε έναν πράκτορα να περικόψει οδηγίες αποκλειστικά για να αποθηκεύσει μάρκες.
Χρήσιμα στοιχεία παρακολούθησης θα μετρούσαν τα αποτελέσματα από άκρο σε άκρο: μέγεθος προτροπής, συμμόρφωση εντολών, επιτυχία εργασίας, παλινδρομήσεις, χρόνος αναθεώρησης και αριθμός κανόνων που αποκαταστάθηκαν μετά τη διαγραφή. Οι ερευνητές θα πρέπει επίσης να ελέγξουν εάν τα μοντέλα χρησιμοποιούν πραγματικά ορθολογικά σχόλια όπως επιδιώκουν ή μερικές φορές τα μπερδεύουν ως πρόσθετες απαιτήσεις. Μέχρι να φτάσουν αυτά τα αποτελέσματα, η καταστροφική ανάμνηση είναι μια καλά υποστηριζόμενη περιγραφή του συνόλου δεδομένων και των πειραμάτων των συγγραφέων, όχι ένας παγκόσμιος νόμος ή ένας λόγος για να διαγραφεί χονδρική η καθοδήγηση ώριμου έργου.