Dokument navrhuje klasifikaci bezpečnostních agentů AI bez štítků měřením konvergence k silnějšímu modelu
Nový předtisk arXiv tvrdí, že bezpečnostní týmy mohou posoudit, zda se agent umělé inteligence vybavený pamětí nebo vyhledáváním učí tím, že měří, jak dalece zaplňuje mezeru vůči silnějšímu „učitelskému“ modelu, spíše než podle označených benchmarků, které jsou často vzácné nebo zastaralé. Soudě podle podobně poháněného modelu nedal žádný použitelný signál.