Apa yang berlaku
Kertas penyelidikan yang disiarkan pada 5 Ogos menggunakan kaedah daripada ujian pendidikan untuk mengukur perkara yang ditangkap oleh penanda aras keselamatan AI, memilih set gesaan berguna yang lebih kecil dan perubahan audit dalam tingkah laku model.
Dua penyelidik bebas dan dua penyelidik yang bergabung dengan UK AI Security Institute menilai 192 model sembang pada lapan penanda aras meliputi penolakan permintaan berbahaya, penolakan berlebihan terhadap permintaan jinak, bahaya kontekstual dan kebenaran. Suite penuh mengandungi 5,255 gesaan sebelum prapemprosesan; analisis mengekalkan 5,067 selepas mengalih keluar respons tidak diberi markah dan item yang tidak membezakan antara model yang diuji.
Pasukan ini menganggap model sebagai pengambil ujian dan gesaan penanda aras sebagai item ujian, menggunakan teori tindak balas item untuk menganggarkan gesaan yang sukar dan model yang dipisahkan dengan terbaik. Dalam analisis faktor utamanya, penyelesaian tiga faktor—diringkaskan sebagai ketegasan penolakan, kebenaran dan bahaya kontekstual—menerangkan 77% daripada variasi dalam kebolehan model, berbanding dengan 47% untuk satu faktor.
Merentasi 20 penilaian yang ditahan, tiga ujian tetap 25-kecepatan memulihkan ketiga-tiga faktor tersebut menggunakan kurang daripada 2% daripada suite. Untuk HarmBench, SORRY-Bench dan OR-Bench-Hard, kira-kira 10 gesaan yang dipilih secara adaptif menghasilkan semula kedudukan penanda aras penuh dengan korelasi 0.92 hingga 0.94 dan mengurangkan bilangan gesaan sebanyak 97–99%; kelebihan mengecil apabila belanjawan ujian meningkat.
Mampatan bukan sekadar persampelan rawak. Teori tindak balas item menganggarkan betapa sukarnya setiap gesaan dan sejauh mana ia memisahkan model dengan corak tindak balas yang berbeza, kemudian memilih item yang mengekalkan struktur ujian yang lebih besar. Penulis membandingkan bentuk pendek tetap dengan pemilihan penyesuaian dan mengadakan penilaian dan bukannya mengukur hanya data yang digunakan untuk memilih gesaan. Reka bentuk itu menyokong dakwaan yang lebih sempit bahawa beberapa penanda aras kedudukan sedia ada boleh diterbitkan semula dengan cekap; ia tidak menunjukkan bahawa ujian 10 atau 25 item boleh menemui mod kegagalan yang sama sekali baharu.
Butiran sumber: Rivera and colleagues' research paper on arXiv ↗
Mengapa ia penting
Kajian itu mencadangkan bahawa gesaan yang dipilih dengan lebih baik boleh menjadikan pemeriksaan keselamatan AI yang kerap lebih murah tanpa berpura-pura bahawa setiap penanda aras mengukur satu skor keselamatan sejagat.
Ujian yang lebih murah boleh membenarkan pembangun, makmal kecil dan penilai bebas menyemak lebih banyak versi model semasa latihan, penalaan halus, pengkuantitian dan perubahan segera sistem. Hasilnya ialah tentang menghasilkan semula ukuran penanda aras sedia ada dengan cekap, bukan mengembangkan perkara yang boleh dikesan oleh penanda aras tersebut.
Analisis faktor juga mendedahkan pertukaran markah. Penanda aras bahawa penolakan ganjaran boleh bertindih antara satu sama lain, manakala penanda aras untuk mengelakkan penolakan yang tidak perlu memberi ganjaran kepada tingkah laku yang bertentangan. Purata mereka tanpa menjelaskan pemberat boleh menyembunyikan sama ada model menjadi lebih selamat, hanya lebih ketat, atau kurang berguna pada permintaan jinak.
Kertas kerja itu juga menguji kaedah audit kotak hitam mengenai tingkah laku membendung pasir yang sengaja didorong. Semakan corak tindak balas mendapati prestasi kurang selektif tetapi terlepas kebanyakan prestasi kurang seragam; menambahkan semakan keupayaan sejarah meningkatkan pengesanan gabungan kepada 94–97% merentas kes simulasi. Itu menyokong audit berlapis dan bukannya bergantung pada satu skor.
Bagi pembangun, nilai operasi ialah kekerapan. Penilaian yang lebih pendek boleh dijalankan semula selepas perubahan segera sistem, pas pengkuantitian, penalaan halus, kemas kini alat atau semakan dasar keselamatan tanpa menggunakan belanjawan penanda aras penuh setiap kali. Tetapi hasilnya hanya berguna apabila pasukan mengekalkan suite asal sebagai audit berkala, memutarkan gesaan yang ditahan dan menyiasat perubahan yang mengejutkan dan bukannya mengoptimumkan terus untuk ujian termampat. Jika tidak cek murah boleh menjadi sasaran lain untuk overfitting.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Apa yang perlu ditonton seterusnya
Perhatikan replikasi bebas, pengesahan pada keluarga model masa hadapan dan bukti bahawa ujian yang dipendekkan meramalkan tingkah laku di luar penanda aras yang direka bentuk untuk menghasilkan semula.
Ini ialah pracetak baharu, bukan keputusan semakan rakan sebaya yang lengkap. Analisis struktur terpendam menggunakan 134 model, yang penulis perhatikan adalah kecil mengikut piawaian psikometrik konvensional, dan kaedah pengekstrakan alternatif mengekalkan dua faktor dan bukannya tiga. Nama faktor adalah ringkasan empirikal, bukan definisi keselamatan yang disahkan.
Setiap model menghasilkan satu respons setiap gesaan yang tersedia melalui OpenRouter, dan setiap penanda aras menggunakan hakim automatik yang ditetapkan. Ujian pendek yang terhasil boleh mewarisi kelemahan dalam gesaan asal, peraturan pemarkahan, liputan bahasa dan hakim; pengarang secara eksplisit mengatakan pemampatan tidak menunjukkan bahawa penanda aras meramalkan keselamatan penggunaan atau kekal bermaklumat untuk model masa hadapan.
Ujian beg pasir yang digunakan mendorong organisma model dan bukannya model yang disesuaikan untuk mengelakkan penilaian, yang mungkin lebih mudah untuk dikesan. Pemeriksaan API mewujudkan kesinambungan tingkah laku, bukan identiti pemberat model tersembunyi, dan kajian itu tidak menguji musuh yang dilatih secara khusus untuk mengalahkan kaedah audit.
Sempadan paling penting kertas itu ialah antara kecekapan pengukuran dan jaminan keselamatan. Bentuk pendek boleh menganggarkan faktor terpendam yang terdapat dalam penanda aras asal, tetapi ia mewarisi bahasa penanda aras, hakim, pembingkaian segera dan titik buta itu. Penilaian masa depan harus menguji gesaan berbilang bahasa, ejen yang didayakan alat, perbualan panjang, model yang diperhalusi secara berlawanan, dan pertimbangan manusia yang bebas. Mereka juga harus melaporkan apabila skor yang dimampatkan menjadi tidak stabil, kerana korelasi yang kemas pada data yang disimpan boleh menyembunyikan kegagalan pada keluarga model seterusnya.
Peraturan penggunaan praktikal mengikuti daripada batasan tersebut: gunakan ujian termampat sebagai pengawal, bukan keputusan. Pasukan boleh menjalankannya dengan kerap untuk menangkap regresi, kemudian meningkatkan perubahan kepada penanda aras penuh dan semakan manusia apabila bentuk pendek bergerak secara tidak dijangka. Bukti kajian sendiri menyokong aliran kerja berlapis itu kerana struktur faktor diperoleh daripada gesaan, hakim dan output model tertentu. Menerbitkan item yang dipilih, kod pemilihan, keputusan yang ditangguhkan dan sejarah versi akan membenarkan penilai bebas menyemak sama ada ujian pendek kekal bermaklumat selepas pembangun melihatnya dan selepas keluarga model baharu menukar pengedaran respons.
Ketelusan yang sama penting apabila model dikemas kini. Ujian pendek yang ditentukur pada satu generasi boleh menjadi terlalu mudah, terlalu sempit atau diselaraskan secara tidak sengaja dengan gesaan sistem baharu. Pasukan harus mengekalkan versi terdahulu, mendedahkan apabila item atau hakim berubah, dan melaporkan selang keyakinan dan bukannya membentangkan kedudukan termampat sebagai skor keselamatan yang tepat. Amalan tersebut menjadikan hasil kecekapan kertas kerja menjadi program pemantauan yang boleh diaudit sambil mengekalkan penanda aras asal tersedia untuk semakan yang lebih mendalam.