Paper Mencadangkan Penggredan Ejen Keselamatan AI Tanpa Label dengan Mengukur Penumpuan kepada Model yang Lebih Kuat
Pracetak arXiv baharu berhujah bahawa pasukan keselamatan boleh menilai sama ada ejen AI yang dilengkapi memori atau pengambilan sedang belajar dengan mengukur sejauh mana ia merapatkan jurang kepada model "guru" yang lebih kukuh, dan bukannya pada penanda aras berlabel yang selalunya jarang atau basi. Berdasarkan model berkuasa serupa tidak memberikan isyarat yang boleh digunakan.