Τι έγινε
Μια ερευνητική εργασία που δημοσιεύτηκε στις 5 Αυγούστου εφαρμόζει μια μέθοδο από εκπαιδευτικές δοκιμές για τη μέτρηση των σημείων αναφοράς ασφάλειας τεχνητής νοημοσύνης, την επιλογή μικρότερων συνόλων χρήσιμων προτροπών και τον έλεγχο αλλαγών στη συμπεριφορά του μοντέλου.
Δύο ανεξάρτητοι ερευνητές και δύο ερευνητές που συνδέονται με το Ινστιτούτο Ασφάλειας AI του Ηνωμένου Βασιλείου αξιολόγησαν 192 μοντέλα συνομιλίας σε οκτώ σημεία αναφοράς που καλύπτουν την άρνηση επιβλαβών αιτημάτων, την υπερβολική απόρριψη καλοήθων αιτημάτων, τη συμφραζόμενη βλάβη και την αλήθεια. Η πλήρης σουίτα περιείχε 5.255 προτροπές πριν από την προεπεξεργασία. η ανάλυση διατήρησε 5.067 αφού αφαιρέθηκαν οι μη βαθμολογημένες απαντήσεις και τα στοιχεία που δεν ξεχώριζαν μεταξύ των μοντέλων που δοκιμάστηκαν.
Η ομάδα αντιμετώπισε τα μοντέλα ως υποψηφίους και τις προτροπές αναφοράς ως δοκιμαστικά στοιχεία, χρησιμοποιώντας τη θεωρία απόκρισης στοιχείων για να εκτιμήσει ποιες προτροπές ήταν δύσκολες και ποια μοντέλα χώρισαν καλύτερα. Στην κύρια παραγοντική της ανάλυση, μια λύση τριών παραγόντων - που συνοψίζεται ως αυστηρότητα άρνησης, ειλικρίνεια και βλάβη στο πλαίσιο - εξήγησε το 77% της διακύμανσης στις ικανότητες του μοντέλου, σε σύγκριση με το 47% για έναν μόνο παράγοντα.
Σε 20 κρατημένες αξιολογήσεις, τρεις σταθερές δοκιμές 25 προτροπών ανέκτησαν αυτούς τους τρεις παράγοντες χρησιμοποιώντας λιγότερο από το 2% της σουίτας. Για τα HarmBench, SORRY-Bench και OR-Bench-Hard, περίπου 10 προσαρμοστικά επιλεγμένες προτροπές αναπαρήγαγαν ταξινομήσεις πλήρους αναφοράς με συσχετίσεις 0,92 έως 0,94 και μείωσαν τον αριθμό των προτροπών κατά 97–99%. το πλεονέκτημα περιορίστηκε καθώς ο προϋπολογισμός των δοκιμών μεγάλωνε.
Η συμπίεση δεν είναι απλώς τυχαία δειγματοληψία. Η θεωρία απόκρισης στοιχείων εκτιμά πόσο δύσκολη είναι κάθε ερώτηση και πόσο καλά διαχωρίζει μοντέλα με διαφορετικά μοτίβα απόκρισης και, στη συνέχεια, επιλέγει στοιχεία που διατηρούν τη δομή της μεγαλύτερης δοκιμής. Οι συγγραφείς συνέκριναν σταθερές σύντομες φόρμες με προσαρμοστική επιλογή και πραγματοποίησαν αξιολογήσεις αντί να μετρήσουν μόνο τα δεδομένα που χρησιμοποιήθηκαν για την επιλογή προτροπών. Αυτός ο σχεδιασμός υποστηρίζει τον στενότερο ισχυρισμό ότι ορισμένες υπάρχουσες κατατάξεις αναφοράς μπορούν να αναπαραχθούν αποτελεσματικά. δεν δείχνει ότι μια δοκιμή 10 ή 25 στοιχείων μπορεί να ανακαλύψει μια εντελώς νέα λειτουργία αποτυχίας.
Στοιχεία πηγής: Rivera and colleagues' research paper on arXiv ↗
Γιατί έχει σημασία
Η μελέτη προτείνει ότι τα καλύτερα επιλεγμένα μηνύματα θα μπορούσαν να κάνουν τους συχνούς ελέγχους ασφάλειας τεχνητής νοημοσύνης φθηνότερους χωρίς να προσποιούμαστε ότι κάθε σημείο αναφοράς μετρά μια καθολική βαθμολογία ασφάλειας.
Οι φθηνότερες δοκιμές θα μπορούσαν να επιτρέψουν σε προγραμματιστές, μικρά εργαστήρια και ανεξάρτητους αξιολογητές να ελέγξουν περισσότερες εκδόσεις μοντέλων κατά τη διάρκεια της εκπαίδευσης, της προσαρμογής, της κβαντοποίησης και των αλλαγών που ζητούνται από το σύστημα. Το αποτέλεσμα αφορά την αποτελεσματική αναπαραγωγή των υπαρχουσών μετρήσεων αναφοράς, όχι την επέκταση του τι μπορούν να ανιχνεύσουν αυτά τα σημεία αναφοράς.
Η παραγοντική ανάλυση εκθέτει επίσης μια αντιστάθμιση βαθμολόγησης. Τα σημεία αναφοράς που επιβραβεύουν την άρνηση μπορεί να αλληλοεπικαλύπτονται, ενώ ένα σημείο αναφοράς για την αποφυγή περιττών αρνήσεων επιβραβεύει την αντίθετη συμπεριφορά. Ο μέσος όρος τους χωρίς να εξηγήσει τα βάρη μπορεί να κρύψει εάν ένα μοντέλο έγινε πιο ασφαλές, απλώς πιο περιοριστικό ή λιγότερο χρήσιμο σε καλοήθη αιτήματα.
Η δημοσίευση δοκίμασε επίσης μεθόδους ελέγχου μαύρου κουτιού σχετικά με τη σκόπιμα προκληθείσα συμπεριφορά σακούλας άμμου. Ένας έλεγχος μοτίβου απόκρισης εντόπισε επιλεκτική υποαπόδοση αλλά έχασε την πιο ομοιόμορφη υποαπόδοση. Η προσθήκη ενός ιστορικού ελέγχου ικανότητας αύξησε τη συνδυασμένη ανίχνευση σε 94–97% στις προσομοιωμένες περιπτώσεις. Αυτό υποστηρίζει πολυεπίπεδους ελέγχους αντί να βασίζεται σε ένα μόνο σκορ.
Για τους προγραμματιστές, η λειτουργική τιμή είναι η συχνότητα. Μια συντομότερη αξιολόγηση μπορεί να επαναληφθεί μετά από αλλαγή προτροπής συστήματος, πέρασμα κβαντοποίησης, τελειοποίηση, ενημέρωση εργαλείου ή αναθεώρηση πολιτικής ασφάλειας χωρίς να καταναλώνεται κάθε φορά ο προϋπολογισμός ενός πλήρους σημείου αναφοράς. Αλλά το αποτέλεσμα είναι χρήσιμο μόνο όταν οι ομάδες διατηρούν την αρχική σουίτα ως περιοδικό έλεγχο, εναλλάσσουν τις προτροπές που μένουν εκτός λειτουργίας και διερευνούν εκπληκτικές αλλαγές αντί να βελτιστοποιούν απευθείας για τη συμπιεσμένη δοκιμή. Διαφορετικά η φθηνή επιταγή μπορεί να γίνει ένας άλλος στόχος για υπερπροσαρμογή.
Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα
Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Τι να παρακολουθήσετε στη συνέχεια
Παρακολουθήστε για ανεξάρτητη αναπαραγωγή, επικύρωση σε μελλοντικές οικογένειες μοντέλων και στοιχεία ότι οι συντομευμένες δοκιμές προβλέπουν συμπεριφορά εκτός των σημείων αναφοράς που σχεδιάστηκαν να αναπαράγουν.
Αυτή είναι μια νέα προεκτύπωση, όχι μια ολοκληρωμένη ετυμηγορία αξιολόγησης από ομοτίμους. Η ανάλυση λανθάνουσας δομής χρησιμοποίησε 134 μοντέλα, τα οποία οι συγγραφείς σημειώνουν ότι είναι μικρά σύμφωνα με τα συμβατικά ψυχομετρικά πρότυπα, και μια εναλλακτική μέθοδος εξαγωγής διατήρησε δύο παράγοντες αντί για τρεις. Τα ονόματα των παραγόντων είναι εμπειρικές περιλήψεις και όχι επικυρωμένοι ορισμοί ασφάλειας.
Κάθε μοντέλο παρήγαγε μία απόκριση ανά διαθέσιμη προτροπή μέσω του OpenRouter και κάθε σημείο αναφοράς χρησιμοποιούσε τον προβλεπόμενο αυτοματοποιημένο κριτή του. Οι σύντομες δοκιμασίες που προκύπτουν μπορεί να κληρονομήσουν ελαττώματα στις αρχικές προτροπές, τους κανόνες βαθμολόγησης, τη γλωσσική κάλυψη και τους κριτές. Οι συγγραφείς λένε ρητά ότι η συμπίεση δεν δείχνει ότι ένα σημείο αναφοράς προβλέπει την ασφάλεια ανάπτυξης ή ότι παραμένει ενημερωτικό για μελλοντικά μοντέλα.
Οι δοκιμές σακουλών άμμου που χρησιμοποιήθηκαν ώθησαν τους οργανισμούς μοντέλων αντί για μοντέλα που είχαν βελτιωθεί ώστε να αποφεύγουν την αξιολόγηση, κάτι που μπορεί να είναι ευκολότερο να ανιχνευθεί. Οι έλεγχοι API καθορίζουν τη συμπεριφορά της συνέχειας, όχι την ταυτότητα των κρυφών βαρών του μοντέλου και η μελέτη δεν εξέτασε έναν αντίπαλο ειδικά εκπαιδευμένο να νικήσει τις μεθόδους ελέγχου.
Το πιο σημαντικό όριο του χαρτιού είναι μεταξύ της αποτελεσματικότητας της μέτρησης και της διασφάλισης ασφάλειας. Μια σύντομη φόρμα μπορεί να εκτιμήσει τους λανθάνοντες παράγοντες που υπάρχουν στο αρχικό σημείο αναφοράς, αλλά κληρονομεί τη γλώσσα αυτού του σημείου αναφοράς, την κρίση, το άμεσο καδράρισμα και τα τυφλά σημεία. Οι μελλοντικές αξιολογήσεις θα πρέπει να δοκιμάσουν πολύγλωσσες προτροπές, πράκτορες με δυνατότητα χρήσης εργαλείων, μακροσκελείς συνομιλίες, αντίθετα προσαρμοσμένα μοντέλα και ανεξάρτητες ανθρώπινες κρίσεις. Θα πρέπει επίσης να αναφέρουν πότε μια συμπιεσμένη βαθμολογία γίνεται ασταθής, επειδή μια τακτοποιημένη συσχέτιση σε συγκρατημένα δεδομένα μπορεί να κρύψει μια αποτυχία στην επόμενη οικογένεια μοντέλων.
Ένας πρακτικός κανόνας υιοθέτησης απορρέει από αυτούς τους περιορισμούς: χρησιμοποιήστε συμπιεσμένα τεστ ως φρουρούς, όχι ως ετυμηγορίες. Οι ομάδες μπορούν να τις εκτελούν συχνά για να καταγράφουν παλινδρομήσεις και, στη συνέχεια, να κλιμακώσουν μια αλλαγή στο πλήρες σημείο αναφοράς και τον ανθρώπινο έλεγχο όταν η σύντομη φόρμα μετακινηθεί απροσδόκητα. Τα στοιχεία της ίδιας της μελέτης υποστηρίζουν αυτή την πολυεπίπεδη ροή εργασίας, επειδή η δομή των παραγόντων προήλθε από συγκεκριμένες προτροπές, κριτές και αποτελέσματα μοντέλων. Η δημοσίευση των επιλεγμένων στοιχείων, του κωδικού επιλογής, των αποτελεσμάτων και του ιστορικού εκδόσεων θα επιτρέψει σε ανεξάρτητους αξιολογητές να ελέγξουν εάν οι σύντομες δοκιμές παραμένουν ενημερωτικές αφού τις δουν οι προγραμματιστές και αφού οι οικογένειες νέων μοντέλων αλλάξουν την κατανομή των απαντήσεων.
Η ίδια διαφάνεια έχει σημασία όταν ένα μοντέλο ενημερώνεται. Μια σύντομη δοκιμή βαθμονομημένη σε μία γενιά μπορεί να γίνει πολύ εύκολη, πολύ στενή ή να ευθυγραμμιστεί κατά λάθος με ένα νέο μήνυμα συστήματος. Οι ομάδες θα πρέπει να διατηρούν προηγούμενες εκδόσεις, να αποκαλύπτουν πότε αλλάζει ένα αντικείμενο ή να κρίνουν και να αναφέρουν διαστήματα εμπιστοσύνης αντί να παρουσιάζουν μια συμπιεσμένη κατάταξη ως ακριβή βαθμολογία ασφαλείας. Αυτές οι πρακτικές μετατρέπουν το αποτέλεσμα της αποτελεσματικότητας του χαρτιού σε ένα ελεγχόμενο πρόγραμμα παρακολούθησης, διατηρώντας παράλληλα το αρχικό σημείο αναφοράς διαθέσιμο για βαθύτερη αναθεώρηση.