Paper föreslår klassificering av AI-säkerhetsagenter utan etiketter genom att mäta konvergens till en starkare modell
En ny arXiv preprint hävdar att säkerhetsteam kan bedöma om en minnes- eller hämtningsutrustad AI-agent lär sig genom att mäta hur långt den stänger gapet till en starkare "lärarmodell", snarare än på märkta riktmärken som ofta är knappa eller inaktuella. Att döma av en liknande driven modell gav ingen användbar signal.