W artykule zaproponowano klasyfikację agentów bezpieczeństwa AI bez etykiet poprzez pomiar zbieżności z silniejszym modelem
Nowy wydruk wstępny arXiv dowodzi, że zespoły ds. bezpieczeństwa mogą ocenić, czy agent AI wyposażony w pamięć lub funkcję odzyskiwania uczy się, mierząc, w jakim stopniu zmniejsza to lukę w stosunku do silniejszego modelu „nauczyciela”, a nie na podstawie oznaczonych etykietami testów porównawczych, które są często rzadkie lub nieaktualne. Sądząc po modelu o podobnej mocy, nie dał on żadnego użytecznego sygnału.