Paper foreslår å gradere AI-sikkerhetsagenter uten etiketter ved å måle konvergens til en sterkere modell
Et nytt arXiv preprint argumenterer for at sikkerhetsteam kan vurdere om en minne- eller gjenfinningsutstyrt AI-agent lærer ved å måle hvor langt den lukker gapet til en sterkere "lærer"-modell, i stedet for på merkede benchmarks som ofte er knappe eller foreldede. Å dømme etter en tilsvarende drevet modell ga ikke noe brukbart signal.