Ce sa întâmplat
Help Net Security raportează că AWS a lansat public Deception , care testează dacă modelele AI pot distinge vulnerabilitățile software autentice de codul sigur care conține modele de vulnerabilitate înșelătoare. Benchmark-ul include 14.822 de mostre care acoperă 16 limbaje de programare și peste 70 de categorii CWE; 9.695 sunt marcate și 5.127 sunt amestecate ca eșantioane fără punctaj.
Help Net Security raportează că AWS a evaluat 12 modele de uz general de la cinci furnizori utilizând un conceput în jurul rezultatelor false pozitive. Exemplele sigure ale benchmark-ului conțin modele reale de vulnerabilitate alături de protecții care împiedică exploatarea. Unele provocări variază condițiile de implementare, cum ar fi politicile de rețea Kubernetes, așa că un model trebuie să ia în considerare atât codul, cât și mediul său.
Potrivit raportului, AWS a generat și rafinat exemple împotriva modelelor de frontieră, excluzând eșantioanele care erau prea ușor de clasificat. AWS spune că acest proces a consumat zeci de miliarde de jetoane. Compania eliberează public mostrele, dar le reține etichetele; utilizatorii trimit predicții către AWS pentru punctaj verificat. Sursa nu precizează dacă accesul la punctaj implică o taxă sau alte cerințe de eligibilitate.
Help Net Security raportează că recenzenții independenți verifică etichetele fără a vedea deciziile celuilalt sau raționamentul inițial. Mostrele contestate primesc o analiză suplimentară, iar cazurile nerezolvate sunt mutate în setul fără punctaj. AWS spune că mai puțin de 3% dintre mostrele cu punctaj rămân contestate după revizuire, cu o țintă de mai puțin de 1% care supraviețuiesc analizei umane și nu raportează nicio eroare de etichetare într-o examinare a 100 de mostre selectate aleatoriu. Aceste afirmații nu au fost confirmate în mod independent aici.
Detalii sursa: helpnetsecurity.com ↗
De ce contează
Rezultatele sugerează că performanța puternică la găsirea codului suspect nu se traduce neapărat într-un triaj fiabil al vulnerabilităților. Ratele ridicate de fals pozitive pot împovăra echipele de securitate și pot slăbi încrederea în alerte, în timp ce cerințele mai stricte de dovezi pot determina modelele să rateze vulnerabilități reale. Descoperirile sunt relevante pentru organizațiile care iau în considerare revizuirea codului asistată de AI sau operațiunile de securitate, dar nu măsoară produse de securitate comerciale complete.
-ul abordează o slăbiciune practică în securitatea asistată de AI: un model poate recunoaște un model cu aspect periculos fără a înțelege controalele care împiedică exploatarea. Help Net Security raportează că solicitarea directă a produs rate de fals pozitive de 41% până la 99%, în timp ce precizia a variat de la 52% la 71%.
Cererea modelelor să demonstreze că o vulnerabilitate ar putea fi efectiv exploatată a redus fals pozitive cu 17 până la 74 de puncte procentuale, conform raportului, dar a crescut ratele fals-negative la între 7% și 44%. Bara minimă de producție declarată de AWS a fost sub 10% pentru ambele măsuri și niciuna dintre configurațiile testate nu a atins ambele praguri.
Aceste rezultate nu trebuie citite ca un clasament al produselor de securitate complete. AWS a testat solicitări cu o singură rotație pe modele de uz general, nu pe sisteme create special care utilizează instrumente, validare repetată sau fluxuri de lucru agentice. Prin urmare, sursa susține prudență cu privire la judecățile de vulnerabilitate la nivel de model, nu o concluzie că produsele de securitate AI în ansamblu eșuează.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
Which component of an AI application is the machine-learning model itself?
Ce să urmărești în continuare
Urmăriți evaluări independente folosind mostrele lansate, rezultate din sistemele de securitate cu ajutorul instrumentelor sau în mai mulți pași și dovezi despre performanța în medii reale de producție. Sursa nu documentează prețurile, accesul la nivel de serviciu sau dacă procesul de notare al AWS este disponibil fără restricții. De asemenea, nu stabilește că modelele testate funcționează similar în cazul unui cod de întreprindere nedezvăluit.
Cercetătorii independenți pot utiliza mostrele publice și procesul de evaluare fără a recrea costurile raportate de generare de date ale AWS, dar etichetele reținute și scorul verificat de AWS au scopul de a limita optimizarea specifică -ului. Replicarea de către grupuri externe ar ajuta la testarea rezultatelor raportate și a calității etichetării.
Evaluările viitoare ar trebui să compare modelele cu o singură trecere cu sisteme care inspectează depozitele, execută codul în siguranță, motivează configurația implementării și necesită dovezi înainte de a lansa o alertă. Aceste teste ar indica mai bine cât de mult îmbunătățesc instrumentele practice de securitate asupra rezultatelor doar modelului.
Sursa lasă necunoscute importante: nu identifică cele 12 configurații de model testate, nu raportează rezultatele per model în textul furnizat, prețurile documentelor sau condițiile de acces pentru scorul verificat sau nu arată cum se transferă performanța către bazele de cod proprietare și operațiunile de securitate live.