Ne oldu?
Help Net Security, AWS'nin yapay zeka modellerinin gerçek yazılım güvenlik açıklarını yanıltıcı güvenlik açığı kalıpları içeren güvenli kodlardan ayırt edip edemediğini test eden Aldatma Karşılaştırmasını kamuya açıkladığını bildirdi. Karşılaştırma, 16 programlama dilini ve 70'ten fazla CWE kategorisini kapsayan 14.822 örneği içermektedir; 9.695 puanlanmış ve 5.127 puanlanmamış numune olarak karıştırılmıştır.
Help Net Security, AWS'nin, yanlış pozitifler etrafında tasarlanmış bir kıyaslama kullanarak beş sağlayıcının 12 genel amaçlı modelini değerlendirdiğini bildiriyor. Karşılaştırmanın güvenli örnekleri, istismarı önleyen korumaların yanı sıra gerçek güvenlik açığı modellerini de içeriyor. Kubernetes ağ politikaları gibi bazı zorluklar dağıtım koşullarını değiştirdiğinden, bir modelin hem kodu hem de ortamını dikkate alması gerekir.
Rapora göre AWS, sınıflandırılması çok kolay olan örnekleri hariç tutarak sınır modellerine göre örnekler oluşturdu ve geliştirdi. AWS, bu sürecin on milyarlarca token tükettiğini söylüyor. Şirket numuneleri kamuya açıklıyor ancak etiketlerini gizliyor; kullanıcılar doğrulanmış puanlama için tahminlerini AWS'ye gönderir. Kaynak, puanlamaya erişimin bir ücret veya başka uygunluk koşulları içerip içermediğini belirtmiyor.
Help Net Security, bağımsız incelemecilerin birbirlerinin kararlarını veya asıl gerekçeyi görmeden etiketleri kontrol ettiğini bildirmektedir. Tartışmalı örnekler daha ayrıntılı incelemeye tabi tutulur ve çözülmemiş vakalar puanlanmamış gruba taşınır. AWS, puanlanan örneklerin %3'ünden daha azının incelemeden sonra tartışmalı kaldığını, %1'den daha azının insan incelemesinden sağ çıkmasının hedeflendiğini söylüyor ve rastgele seçilen 100 puanlı örneğin incelemesinde hiçbir etiketleme hatası bildirmiyor. Bu iddialar burada bağımsız olarak doğrulanmadı.
Kaynak ayrıntıları: helpnetsecurity.com ↗
Neden önemli?
Sonuçlar, şüpheli kodu bulma konusundaki güçlü performansın mutlaka güvenilir bir güvenlik açığı önceliklendirmesi anlamına gelmediğini göstermektedir. Yüksek yanlış pozitif oranları, güvenlik ekiplerine yük oluşturabilir ve uyarılara olan güveni zayıflatabilir; daha katı kanıt gereklilikleri ise modellerin gerçek güvenlik açıklarını gözden kaçırmasına neden olabilir. Bulgular, yapay zeka destekli kod incelemesi veya güvenlik operasyonlarını düşünen kuruluşlarla ilgilidir ancak ticari güvenlik ürünlerinin tamamını ölçemez.
Karşılaştırma, yapay zeka destekli güvenlikteki pratik bir zayıflığı ele alıyor: Bir model, istismarı önleyen kontrolleri anlamadan tehlikeli görünen bir modeli tanıyabilir. Help Net Security, doğrudan yönlendirmenin %41 ile %99 arasında hatalı pozitif oranlar ürettiğini, hassasiyetin ise %52 ile %71 arasında değiştiğini bildirmektedir.
Rapora göre, modellerden bir güvenlik açığından gerçekten yararlanılabileceğini göstermelerini istemek, hatalı pozitifleri yüzde 17 ila 74 puan azalttı, ancak yanlış negatif oranlarını %7 ila %44 arasına çıkardı. AWS'nin belirtilen minimum üretim çubuğu her iki ölçüm için de %10'un altındaydı ve test edilen konfigürasyonların hiçbiri her iki eşiği de karşılamadı.
Bu sonuçlar, tam güvenlik ürünlerinin sıralaması olarak okunmamalıdır. AWS, tek dönüşlü istemleri araçlar, tekrarlanan doğrulama veya aracılı iş akışları kullanan amaca yönelik olarak oluşturulmuş sistemlerde değil, genel amaçlı modellerde test etti. Bu nedenle kaynak, yapay zeka güvenlik ürünlerinin bir bütün olarak başarısız olduğu sonucunu değil, model düzeyindeki güvenlik açığı kararlarına ilişkin uyarıyı destekliyor.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Yayımlanan örneklerin kullanıldığı bağımsız değerlendirmeleri, araç kullanımından veya çok adımlı güvenlik sistemlerinden elde edilen sonuçları ve gerçek üretim ortamlarındaki performansa ilişkin kanıtları izleyin. Kaynak, fiyatlandırmayı, hizmet düzeyi erişimini veya AWS'nin puanlama sürecinin kısıtlama olmaksızın kullanılabilir olup olmadığını belgelemiyor. Ayrıca test edilen modellerin açıklanmayan kurumsal kod üzerinde benzer şekilde performans gösterdiğini belirlemez.
Bağımsız araştırmacılar, AWS'nin rapor edilen veri oluşturma maliyetlerini yeniden oluşturmadan halka açık örnekleri ve değerlendirme sürecini kullanabilir, ancak gizli etiketler ve AWS doğrulanmış puanlamanın, karşılaştırmaya özgü optimizasyonu sınırlaması amaçlanmaktadır. Dış gruplar tarafından çoğaltılması, rapor edilen sonuçların ve etiketleme kalitesinin test edilmesine yardımcı olacaktır.
Gelecekteki değerlendirmeler, tek geçişli modelleri, depoları denetleyen, kodu güvenli bir şekilde çalıştıran, dağıtım yapılandırması üzerinde mantık yürüten ve bir uyarı yayınlamadan önce kanıt gerektiren sistemlerle karşılaştırmalıdır. Bu testler, pratik güvenlik araçlarının yalnızca model sonuçlarına göre ne kadar geliştiğini daha iyi gösterebilir.
Kaynak, önemli bilinmeyenler bırakıyor: test edilen 12 model konfigürasyonunu tanımlamıyor, model başına sonuçları sağlanan metinde raporlamıyor, belge fiyatlandırmasını veya doğrulanmış puanlama için erişim koşullarını göstermiyor veya performansın özel kod tabanlarına ve canlı güvenlik operasyonlarına nasıl aktarıldığını göstermiyor.