Paper propose de classer les agents de sécurité IA sans étiquette en mesurant la convergence vers un modèle plus solide
Une nouvelle prépublication d'arXiv affirme que les équipes de sécurité peuvent juger si un agent d'IA équipé de mémoire ou de récupération apprend en mesurant dans quelle mesure il réduit l'écart par rapport à un modèle « enseignant » plus fort, plutôt qu'en se basant sur des références étiquetées qui sont souvent rares ou obsolètes. À en juger par un modèle de puissance similaire, il n’a donné aucun signal utilisable.