Το Paper προτείνει βαθμολόγηση αντιπροσώπων ασφαλείας AI χωρίς ετικέτες με τη μέτρηση της σύγκλισης σε ένα ισχυρότερο μοντέλο
Μια νέα προεκτύπωση του arXiv υποστηρίζει ότι οι ομάδες ασφαλείας μπορούν να κρίνουν εάν ένας πράκτορας τεχνητής νοημοσύνης εξοπλισμένος με μνήμη ή ανάκτηση μαθαίνει μετρώντας πόσο κλείνει το χάσμα σε ένα ισχυρότερο μοντέλο «δασκάλου» και όχι σε επισημασμένα σημεία αναφοράς που είναι συχνά σπάνια ή μπαγιάτικα. Κρίνοντας από ένα μοντέλο παρόμοιας ισχύος δεν έδωσε κανένα χρησιμοποιήσιμο σήμα.