Înapoi la Știri
SecuritateAI Understanding briefing

Benchmarkul AWS găsește detectorii de vulnerabilități AI semnalează codul sigur

Help Net Security raportează că AWS a testat 12 modele AI pe un benchmark conceput pentru a distinge vulnerabilitățile exploatabile de codul sigur care pare doar periculos. Niciunul nu a îndeplinit pragul de producție declarat de AWS atât pentru ratele fals pozitive, cât și fals negative.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
Referință la sursăSursa înregistrată
Editor
helpnetsecurity.com
Link sursă
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Tip sursă
Sursă conectată — starea sursei primare nu a fost stabilită.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Precizie
Proporția de pozitive prezise care sunt de fapt corecte.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

Help Net Security raportează că AWS a lansat public Deception , care testează dacă modelele AI pot distinge vulnerabilitățile software autentice de codul sigur care conține modele de vulnerabilitate înșelătoare. Benchmark-ul include 14.822 de mostre care acoperă 16 limbaje de programare și peste 70 de categorii CWE; 9.695 sunt marcate și 5.127 sunt amestecate ca eșantioane fără punctaj.

Help Net Security raportează că AWS a evaluat 12 modele de uz general de la cinci furnizori utilizând un conceput în jurul rezultatelor false pozitive. Exemplele sigure ale benchmark-ului conțin modele reale de vulnerabilitate alături de protecții care împiedică exploatarea. Unele provocări variază condițiile de implementare, cum ar fi politicile de rețea Kubernetes, așa că un model trebuie să ia în considerare atât codul, cât și mediul său.

Potrivit raportului, AWS a generat și rafinat exemple împotriva modelelor de frontieră, excluzând eșantioanele care erau prea ușor de clasificat. AWS spune că acest proces a consumat zeci de miliarde de jetoane. Compania eliberează public mostrele, dar le reține etichetele; utilizatorii trimit predicții către AWS pentru punctaj verificat. Sursa nu precizează dacă accesul la punctaj implică o taxă sau alte cerințe de eligibilitate.

Help Net Security raportează că recenzenții independenți verifică etichetele fără a vedea deciziile celuilalt sau raționamentul inițial. Mostrele contestate primesc o analiză suplimentară, iar cazurile nerezolvate sunt mutate în setul fără punctaj. AWS spune că mai puțin de 3% dintre mostrele cu punctaj rămân contestate după revizuire, cu o țintă de mai puțin de 1% care supraviețuiesc analizei umane și nu raportează nicio eroare de etichetare într-o examinare a 100 de mostre selectate aleatoriu. Aceste afirmații nu au fost confirmate în mod independent aici.

Detalii sursa: helpnetsecurity.com ↗

De ce contează

Rezultatele sugerează că performanța puternică la găsirea codului suspect nu se traduce neapărat într-un triaj fiabil al vulnerabilităților. Ratele ridicate de fals pozitive pot împovăra echipele de securitate și pot slăbi încrederea în alerte, în timp ce cerințele mai stricte de dovezi pot determina modelele să rateze vulnerabilități reale. Descoperirile sunt relevante pentru organizațiile care iau în considerare revizuirea codului asistată de AI sau operațiunile de securitate, dar nu măsoară produse de securitate comerciale complete.

-ul abordează o slăbiciune practică în securitatea asistată de AI: un model poate recunoaște un model cu aspect periculos fără a înțelege controalele care împiedică exploatarea. Help Net Security raportează că solicitarea directă a produs rate de fals pozitive de 41% până la 99%, în timp ce precizia a variat de la 52% la 71%.

Cererea modelelor să demonstreze că o vulnerabilitate ar putea fi efectiv exploatată a redus fals pozitive cu 17 până la 74 de puncte procentuale, conform raportului, dar a crescut ratele fals-negative la între 7% și 44%. Bara minimă de producție declarată de AWS a fost sub 10% pentru ambele măsuri și niciuna dintre configurațiile testate nu a atins ambele praguri.

Aceste rezultate nu trebuie citite ca un clasament al produselor de securitate complete. AWS a testat solicitări cu o singură rotație pe modele de uz general, nu pe sisteme create special care utilizează instrumente, validare repetată sau fluxuri de lucru agentice. Prin urmare, sursa susține prudență cu privire la judecățile de vulnerabilitate la nivel de model, nu o concluzie că produsele de securitate AI în ansamblu eșuează.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ce să urmărești în continuare

Urmăriți evaluări independente folosind mostrele lansate, rezultate din sistemele de securitate cu ajutorul instrumentelor sau în mai mulți pași și dovezi despre performanța în medii reale de producție. Sursa nu documentează prețurile, accesul la nivel de serviciu sau dacă procesul de notare al AWS este disponibil fără restricții. De asemenea, nu stabilește că modelele testate funcționează similar în cazul unui cod de întreprindere nedezvăluit.

Cercetătorii independenți pot utiliza mostrele publice și procesul de evaluare fără a recrea costurile raportate de generare de date ale AWS, dar etichetele reținute și scorul verificat de AWS au scopul de a limita optimizarea specifică -ului. Replicarea de către grupuri externe ar ajuta la testarea rezultatelor raportate și a calității etichetării.

Evaluările viitoare ar trebui să compare modelele cu o singură trecere cu sisteme care inspectează depozitele, execută codul în siguranță, motivează configurația implementării și necesită dovezi înainte de a lansa o alertă. Aceste teste ar indica mai bine cât de mult îmbunătățesc instrumentele practice de securitate asupra rezultatelor doar modelului.

Sursa lasă necunoscute importante: nu identifică cele 12 configurații de model testate, nu raportează rezultatele per model în textul furnizat, prețurile documentelor sau condițiile de acces pentru scorul verificat sau nu arată cum se transferă performanța către bazele de cod proprietare și operațiunile de securitate live.

Ghiduri și chestionare conexe

Modelele AI explicateEtica IAPrompt EngineeringTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a reglementărilor AI
Ai găsit asta util?