Wat is er gebeurd
Help Net Security meldt dat AWS zijn Deception publiekelijk heeft vrijgegeven, die test of AI-modellen echte softwarekwetsbaarheden kunnen onderscheiden van veilige code die misleidende kwetsbaarheidspatronen bevat. De benchmark omvat 14.822 voorbeelden uit 16 programmeertalen en meer dan 70 CWE-categorieën; Er worden 9.695 gescoord en 5.127 worden gemengd als niet-gescoorde monsters.
Help Net Security meldt dat AWS twaalf algemene modellen van vijf providers heeft geëvalueerd met behulp van een die is ontworpen rond valse positieven. De veilige voorbeelden van de benchmark bevatten echte kwetsbaarheidspatronen naast beschermingsmaatregelen die uitbuiting voorkomen. Sommige uitdagingen variëren de implementatieomstandigheden, zoals het Kubernetes-netwerkbeleid, dus een model moet rekening houden met zowel de code als de omgeving.
Volgens het rapport genereerde en verfijnde AWS voorbeelden tegen grensmodellen, waarbij steekproeven werden uitgesloten die te gemakkelijk te classificeren waren. AWS zegt dat dit proces tientallen miljarden tokens heeft verbruikt. Het bedrijf geeft de monsters publiekelijk vrij, maar onthoudt hun labels; gebruikers dienen voorspellingen in bij AWS voor geverifieerde scores. De bron vermeldt niet of er voor toegang tot scores een vergoeding of andere deelnamevereisten gelden.
Help Net Security meldt dat onafhankelijke reviewers labels controleren zonder elkaars beslissingen of de oorspronkelijke redenering te zien. Betwiste monsters worden verder beoordeeld en onopgeloste zaken worden verplaatst naar de reeks zonder score. AWS zegt dat minder dan 3% van de gescoorde monsters na beoordeling betwist blijft, met als doel dat minder dan 1% de menselijke beoordeling overleeft, en rapporteert geen etiketteringsfouten in een beoordeling van 100 willekeurig geselecteerde gescoorde monsters. Deze beweringen zijn hier niet onafhankelijk bevestigd.
Brongegevens: helpnetsecurity.com ↗
Waarom het ertoe doet
De resultaten suggereren dat sterke prestaties bij het vinden van verdachte code zich niet noodzakelijkerwijs vertalen in een betrouwbare beoordeling van kwetsbaarheden. Hoge fout-positieve cijfers kunnen beveiligingsteams belasten en het vertrouwen in waarschuwingen verzwakken, terwijl strengere bewijsvereisten ervoor kunnen zorgen dat modellen echte kwetsbaarheden over het hoofd zien. De bevindingen zijn relevant voor organisaties die AI-ondersteunde codebeoordeling of beveiligingsoperaties overwegen, maar ze meten geen volledige commerciële beveiligingsproducten.
De richt zich op een praktische zwakte in AI-ondersteunde beveiliging: een model kan een gevaarlijk ogend patroon herkennen zonder de controles te begrijpen die uitbuiting voorkomen. Help Net Security meldt dat directe aanwijzingen een fout-positief percentage van 41% tot 99% opleverden, terwijl de nauwkeurigheid varieerde van 52% tot 71%.
Door modellen te vragen om aan te tonen dat een kwetsbaarheid daadwerkelijk kan worden misbruikt, is het aantal valse positieven volgens het rapport met 17 tot 74 procentpunten gedaald, maar zijn de fout-negatieve percentages gestegen tot tussen de 7% en 44%. De door AWS aangegeven minimale productiebalk lag voor beide maatregelen onder de 10%, en geen van de geteste configuraties voldeed aan beide drempels.
Deze resultaten mogen niet worden gelezen als een ranglijst van complete beveiligingsproducten. AWS testte single-turn-prompts op modellen voor algemene doeleinden, niet op speciaal gebouwde systemen die tools, herhaalde validatie of agentische workflows gebruiken. De bron ondersteunt daarom voorzichtigheid met betrekking tot kwetsbaarheidsoordelen op modelniveau, en niet de conclusie dat AI-beveiligingsproducten als geheel falen.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
Kijk uit naar onafhankelijke evaluaties met behulp van de vrijgegeven voorbeelden, resultaten van beveiligingssystemen die tools gebruiken of meerstapsbeveiliging, en bewijsmateriaal over de prestaties in echte productieomgevingen. De bron documenteert niet de prijzen, de toegang op serviceniveau en de vraag of het scoreproces van AWS zonder beperkingen beschikbaar is. Er wordt ook niet aangetoond dat de geteste modellen op vergelijkbare wijze presteren op niet-openbaar gemaakte bedrijfscode.
Onafhankelijke onderzoekers kunnen de openbare steekproeven en het evaluatieproces gebruiken zonder de door AWS gerapporteerde kosten voor het genereren van gegevens opnieuw te creëren, maar achtergehouden labels en door AWS geverifieerde scores zijn bedoeld om benchmarkspecifieke optimalisatie te beperken. Replicatie door externe groepen zou helpen bij het testen van de gerapporteerde resultaten en de kwaliteit van de etikettering.
Toekomstige evaluaties moeten single-pass-modellen vergelijken met systemen die opslagplaatsen inspecteren, code veilig uitvoeren, over de configuratie van de implementatie redeneren en bewijs vereisen voordat een waarschuwing wordt afgegeven. Deze tests zouden beter kunnen aangeven hoeveel praktische beveiligingstools de resultaten op basis van alleen modellen verbeteren.
De bron laat belangrijke onbekenden achter: het identificeert niet de twaalf geteste modelconfiguraties, rapporteert niet de resultaten per model in de meegeleverde tekst, documenteert geen prijzen of toegangsvoorwaarden voor geverifieerde scores, en laat niet zien hoe de prestaties worden overgedragen naar propriëtaire codebases en live beveiligingsoperaties.