Haberlere Geri Dön
GüvenlikAI Understanding brifing

AWS karşılaştırması, AI güvenlik açığı dedektörlerinin güvenli kodu işaretlediğini tespit ediyor

Help Net Security, AWS'nin, sömürülebilir güvenlik açıklarını yalnızca tehlikeli görünen güvenli kodlardan ayırmak için tasarlanmış bir kıyaslamada 12 AI modelini test ettiğini bildirdi. Hiçbiri AWS'nin hem yanlış pozitif hem de yanlış negatif oranlar için belirtilen üretim eşiğini karşılamadı.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
Kaynak referansıKaynak kaydedildi
Yayıncı
helpnetsecurity.com
Kaynak bağlantısı
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Kaynak türü
Bağlantılı kaynak — birincil kaynak durumu belirlenmedi.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Karşılaştırma
Model performansını ölçmek ve karşılaştırmak için kullanılan standartlaştırılmış bir test veya veri kümesi.
Hassasiyet
Gerçekte doğru olan tahmin edilen pozitiflerin oranı.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Help Net Security, AWS'nin yapay zeka modellerinin gerçek yazılım güvenlik açıklarını yanıltıcı güvenlik açığı kalıpları içeren güvenli kodlardan ayırt edip edemediğini test eden Aldatma Karşılaştırmasını kamuya açıkladığını bildirdi. Karşılaştırma, 16 programlama dilini ve 70'ten fazla CWE kategorisini kapsayan 14.822 örneği içermektedir; 9.695 puanlanmış ve 5.127 puanlanmamış numune olarak karıştırılmıştır.

Help Net Security, AWS'nin, yanlış pozitifler etrafında tasarlanmış bir kıyaslama kullanarak beş sağlayıcının 12 genel amaçlı modelini değerlendirdiğini bildiriyor. Karşılaştırmanın güvenli örnekleri, istismarı önleyen korumaların yanı sıra gerçek güvenlik açığı modellerini de içeriyor. Kubernetes ağ politikaları gibi bazı zorluklar dağıtım koşullarını değiştirdiğinden, bir modelin hem kodu hem de ortamını dikkate alması gerekir.

Rapora göre AWS, sınıflandırılması çok kolay olan örnekleri hariç tutarak sınır modellerine göre örnekler oluşturdu ve geliştirdi. AWS, bu sürecin on milyarlarca token tükettiğini söylüyor. Şirket numuneleri kamuya açıklıyor ancak etiketlerini gizliyor; kullanıcılar doğrulanmış puanlama için tahminlerini AWS'ye gönderir. Kaynak, puanlamaya erişimin bir ücret veya başka uygunluk koşulları içerip içermediğini belirtmiyor.

Help Net Security, bağımsız incelemecilerin birbirlerinin kararlarını veya asıl gerekçeyi görmeden etiketleri kontrol ettiğini bildirmektedir. Tartışmalı örnekler daha ayrıntılı incelemeye tabi tutulur ve çözülmemiş vakalar puanlanmamış gruba taşınır. AWS, puanlanan örneklerin %3'ünden daha azının incelemeden sonra tartışmalı kaldığını, %1'den daha azının insan incelemesinden sağ çıkmasının hedeflendiğini söylüyor ve rastgele seçilen 100 puanlı örneğin incelemesinde hiçbir etiketleme hatası bildirmiyor. Bu iddialar burada bağımsız olarak doğrulanmadı.

Kaynak ayrıntıları: helpnetsecurity.com ↗

Neden önemli?

Sonuçlar, şüpheli kodu bulma konusundaki güçlü performansın mutlaka güvenilir bir güvenlik açığı önceliklendirmesi anlamına gelmediğini göstermektedir. Yüksek yanlış pozitif oranları, güvenlik ekiplerine yük oluşturabilir ve uyarılara olan güveni zayıflatabilir; daha katı kanıt gereklilikleri ise modellerin gerçek güvenlik açıklarını gözden kaçırmasına neden olabilir. Bulgular, yapay zeka destekli kod incelemesi veya güvenlik operasyonlarını düşünen kuruluşlarla ilgilidir ancak ticari güvenlik ürünlerinin tamamını ölçemez.

Karşılaştırma, yapay zeka destekli güvenlikteki pratik bir zayıflığı ele alıyor: Bir model, istismarı önleyen kontrolleri anlamadan tehlikeli görünen bir modeli tanıyabilir. Help Net Security, doğrudan yönlendirmenin %41 ile %99 arasında hatalı pozitif oranlar ürettiğini, hassasiyetin ise %52 ile %71 arasında değiştiğini bildirmektedir.

Rapora göre, modellerden bir güvenlik açığından gerçekten yararlanılabileceğini göstermelerini istemek, hatalı pozitifleri yüzde 17 ila 74 puan azalttı, ancak yanlış negatif oranlarını %7 ila %44 arasına çıkardı. AWS'nin belirtilen minimum üretim çubuğu her iki ölçüm için de %10'un altındaydı ve test edilen konfigürasyonların hiçbiri her iki eşiği de karşılamadı.

Bu sonuçlar, tam güvenlik ürünlerinin sıralaması olarak okunmamalıdır. AWS, tek dönüşlü istemleri araçlar, tekrarlanan doğrulama veya aracılı iş akışları kullanan amaca yönelik olarak oluşturulmuş sistemlerde değil, genel amaçlı modellerde test etti. Bu nedenle kaynak, yapay zeka güvenlik ürünlerinin bir bütün olarak başarısız olduğu sonucunu değil, model düzeyindeki güvenlik açığı kararlarına ilişkin uyarıyı destekliyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Yayımlanan örneklerin kullanıldığı bağımsız değerlendirmeleri, araç kullanımından veya çok adımlı güvenlik sistemlerinden elde edilen sonuçları ve gerçek üretim ortamlarındaki performansa ilişkin kanıtları izleyin. Kaynak, fiyatlandırmayı, hizmet düzeyi erişimini veya AWS'nin puanlama sürecinin kısıtlama olmaksızın kullanılabilir olup olmadığını belgelemiyor. Ayrıca test edilen modellerin açıklanmayan kurumsal kod üzerinde benzer şekilde performans gösterdiğini belirlemez.

Bağımsız araştırmacılar, AWS'nin rapor edilen veri oluşturma maliyetlerini yeniden oluşturmadan halka açık örnekleri ve değerlendirme sürecini kullanabilir, ancak gizli etiketler ve AWS doğrulanmış puanlamanın, karşılaştırmaya özgü optimizasyonu sınırlaması amaçlanmaktadır. Dış gruplar tarafından çoğaltılması, rapor edilen sonuçların ve etiketleme kalitesinin test edilmesine yardımcı olacaktır.

Gelecekteki değerlendirmeler, tek geçişli modelleri, depoları denetleyen, kodu güvenli bir şekilde çalıştıran, dağıtım yapılandırması üzerinde mantık yürüten ve bir uyarı yayınlamadan önce kanıt gerektiren sistemlerle karşılaştırmalıdır. Bu testler, pratik güvenlik araçlarının yalnızca model sonuçlarına göre ne kadar geliştiğini daha iyi gösterebilir.

Kaynak, önemli bilinmeyenler bırakıyor: test edilen 12 model konfigürasyonunu tanımlamıyor, model başına sonuçları sağlanan metinde raporlamıyor, belge fiyatlandırmasını veya doğrulanmış puanlama için erişim koşullarını göstermiyor veya performansın özel kod tabanlarına ve canlı güvenlik operasyonlarına nasıl aktarıldığını göstermiyor.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıYapay Zeka EtiğiPrompt EngineeringBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınYapay zeka düzenleme izleyicisini takip edin
Bunu yararlı buldunuz mu?