Ne oldu?
5 Ağustos'ta yayınlanan bir araştırma makalesi, AI güvenlik kriterlerinin neyi yakaladığını ölçmek, daha küçük yararlı istem kümelerini seçmek ve model davranışındaki değişiklikleri denetlemek için eğitim testlerinden bir yöntem uyguluyor.
İki bağımsız araştırmacı ve Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü'ne bağlı iki araştırmacı, 192 sohbet modelini, zararlı isteklerin reddedilmesi, zararsız isteklerin aşırı reddedilmesi, bağlamsal zarar ve doğruluk gibi sekiz kriter üzerinde değerlendirdi. Paketin tamamı, ön işlemeden önce 5.255 bilgi istemi içeriyordu; puanlanmamış yanıtlar ve test edilen modeller arasında ayrım yapmayan öğeler çıkarıldıktan sonra analiz 5.067'yi korudu.
Ekip, hangi istemlerin zor olduğunu ve hangi modellerin en iyi şekilde ayrıldığını tahmin etmek için madde yanıt teorisini kullanarak modelleri test katılımcıları ve kıyaslama istemlerini test öğeleri olarak ele aldı. Ana faktör analizinde, reddetme katılığı, doğruluk ve bağlamsal zarar olarak özetlenen üç faktörlü bir çözüm, model yeteneklerindeki varyasyonun %77'sini açıklarken, tek bir faktör için bu oran %47'ydi.
Uzun süren 20 değerlendirmede, 25 soruluk üç sabit test, paketin %2'sinden daha azını kullanarak bu üç faktörü kurtardı. HarmBench, SORRY-Bench ve OR-Bench-Hard için, uyarlamalı olarak seçilen kabaca 10 istem, 0,92 ila 0,94 korelasyonla tam kıyaslama sıralamasını yeniden üretti ve istem sayısını %97-99 oranında azalttı; Test bütçesi büyüdükçe avantaj daraldı.
Sıkıştırma sadece rastgele örnekleme değildir. Madde yanıt teorisi, her bir ipucunun ne kadar zor olduğunu ve farklı yanıt modellerine sahip modelleri ne kadar iyi ayırdığını tahmin eder, ardından daha büyük testin yapısını koruyan maddeleri seçer. Yazarlar sabit kısa formları uyarlanabilir seçimle karşılaştırdılar ve yalnızca istemleri seçmek için kullanılan verileri ölçmek yerine değerlendirmeler yaptılar. Bu tasarım, mevcut bazı kıyaslama sıralamalarının verimli bir şekilde yeniden üretilebileceği yönündeki daha dar kapsamlı iddiayı desteklemektedir; 10 veya 25 maddelik bir testin tamamen yeni bir hata modu keşfedebileceğini göstermez.
Kaynak ayrıntıları: Rivera and colleagues' research paper on arXiv ↗
Neden önemli?
Çalışma, daha iyi seçilmiş istemlerin, her kıyaslamanın tek bir evrensel güvenlik puanını ölçtüğü iddiasına gerek kalmadan, sık sık yapılan yapay zeka güvenlik kontrollerini daha ucuz hale getirebileceğini öne sürüyor.
Daha ucuz testler, geliştiricilerin, küçük laboratuvarların ve bağımsız değerlendiricilerin eğitim, ince ayar, nicemleme ve sistem istemi değişiklikleri sırasında daha fazla model versiyonunu kontrol etmesine olanak tanıyabilir. Sonuç, bu kıyaslamaların tespit edebildiklerini genişletmek değil, mevcut kıyaslama ölçümlerini verimli bir şekilde yeniden üretmektir.
Faktör analizi aynı zamanda bir puanlama değiş tokuşunu da ortaya koymaktadır. Reddetmeyi ödüllendiren kıyaslamalar birbiriyle örtüşebilirken, gereksiz retlerden kaçınmaya yönelik bir kıyaslama tam tersi davranışı ödüllendirir. Ağırlıkları açıklamadan bunların ortalamasını almak, bir modelin daha güvenli mi, yalnızca daha kısıtlayıcı mı yoksa iyi niyetli istekler karşısında daha az kullanışlı mı hale geldiğini gizleyebilir.
Makale ayrıca, kasıtlı olarak teşvik edilen kum torbası davranışına ilişkin kara kutu denetim yöntemlerini de test etti. Bir tepki modeli kontrolü, seçici düşük performansı yakaladı ancak çoğu tekdüze düşük performansı gözden kaçırdı; Geçmiş yetenek kontrolünün eklenmesi, simüle edilen vakalarda birleşik tespit oranını %94-97'ye yükseltti. Bu, tek bir puana güvenmek yerine katmanlı denetimleri destekler.
Geliştiriciler için operasyonel değer frekanstır. Daha kısa bir değerlendirme, sistem isteminde yapılan bir değişiklik, nicelik belirleme geçişi, ince ayar, araç güncellemesi veya güvenlik politikası revizyonundan sonra, her seferinde tam bir kıyaslama bütçesi tüketilmeden yeniden çalıştırılabilir. Ancak sonuç, yalnızca ekipler orijinal paketi periyodik bir denetim olarak tuttuğunda, uzatılmış istemleri dönüşümlü olarak uyguladığında ve sıkıştırılmış test için doğrudan optimizasyon yapmak yerine şaşırtıcı değişiklikleri araştırdığında faydalıdır. Aksi takdirde ucuz çek, aşırı uyum için başka bir hedef haline gelebilir.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Bundan sonra ne izlenecek?
Bağımsız kopyalamayı, gelecekteki model ailelerinin doğrulanmasını ve kısaltılmış testlerin, yeniden üretmek üzere tasarlandıkları kriterlerin dışındaki davranışları tahmin ettiğini gösteren kanıtları izleyin.
Bu yeni bir ön baskıdır, tamamlanmış bir hakem değerlendirmesi kararı değildir. Gizli yapı analizinde, yazarların geleneksel psikometrik standartlara göre küçük olduğunu belirttiği 134 model kullanıldı ve alternatif bir çıkarma yöntemi, üç yerine iki faktörü korudu. Faktör adları ampirik özetlerdir, güvenliğin doğrulanmış tanımları değildir.
Her model, OpenRouter aracılığıyla mevcut istem başına bir yanıt üretti ve her kıyaslama, kendi belirlenmiş otomatik değerlendirmesini kullandı. Ortaya çıkan kısa testler, orijinal istemlerdeki, puanlama kurallarındaki, dil kapsamındaki ve hakemlerdeki kusurları devralabilir; Yazarlar, sıkıştırmanın, bir karşılaştırmalı değerlendirmenin dağıtım güvenliğini öngördüğünü veya gelecekteki modeller için bilgilendirici kaldığını göstermediğini açıkça söylüyorlar.
Kum torbası testlerinde, tespit edilmesi daha kolay olabilecek, değerlendirmeden kaçınmak için ince ayar yapılmış modeller yerine harekete geçirilmiş model organizmalar kullanıldı. API kontrolleri, gizli model ağırlıklarının kimliğini değil, davranışsal sürekliliği belirler ve çalışma, denetim yöntemlerini yenmek için özel olarak eğitilmiş bir rakibi test etmedi.
Makalenin en önemli sınırı ölçüm verimliliği ile güvenlik güvencesi arasındadır. Kısa bir form, orijinal kıyaslamada mevcut olan gizli faktörleri tahmin edebilir, ancak o kıyaslamanın dilini, değerlendirmesini, hızlı çerçevelemesini ve kör noktalarını miras alır. Gelecekteki değerlendirmeler, çok dilli istemleri, araç-etkin aracıları, uzun konuşmaları, rakiplere göre ince ayarlı modelleri ve bağımsız insan yargılarını test etmelidir. Ayrıca, sıkıştırılmış bir puan kararsız hale geldiğinde de rapor vermelidirler çünkü uzatılmış veriler üzerindeki düzgün bir korelasyon, bir sonraki model ailesindeki bir başarısızlığı gizleyebilir.
Bu sınırlamalardan pratik bir benimseme kuralı çıkar: Sıkıştırılmış testleri karar olarak değil, koruyucu olarak kullanın. Ekipler, gerilemeleri yakalamak için bunları sık sık çalıştırabilir, ardından kısa form beklenmedik bir şekilde hareket ettiğinde değişikliği tam karşılaştırmaya ve insan incelemesine aktarabilir. Çalışmanın kendi kanıtları bu katmanlı iş akışını desteklemektedir çünkü faktör yapısı belirli yönlendirmelerden, değerlendirmelerden ve model çıktılarından türetilmiştir. Seçilen öğelerin, seçim kodunun, uzatılan sonuçların ve sürüm geçmişinin yayınlanması, bağımsız değerlendiricilerin, geliştiriciler bunları gördükten ve yeni model aileleri yanıtların dağılımını değiştirdikten sonra kısa testlerin bilgilendirici olup olmadığını kontrol etmesine olanak tanıyacaktır.
Bir model güncellendiğinde aynı şeffaflık önemlidir. Bir nesil için kalibre edilmiş kısa bir test çok kolay olabilir, çok dar kapsamlı olabilir veya yanlışlıkla yeni bir sistem istemiyle uyumlu hale gelebilir. Takımlar, kesin bir güvenlik puanı olarak sıkıştırılmış bir sıralama sunmak yerine önceki versiyonları korumalı, bir öğe veya hakem değiştiğinde bunu açıklamalı ve güven aralıklarını raporlamalıdır. Bu uygulamalar, belgenin verimlilik sonucunu denetlenebilir bir izleme programına dönüştürürken, orijinal kıyaslamayı daha derinlemesine incelemeye açık tutar.