Terug naar Nieuws
BeveiligingAI Understanding-briefing

De AWS-benchmark vindt dat AI-kwetsbaarheidsdetectoren veilige code markeren

Help Net Security meldt dat AWS twaalf AI-modellen heeft getest op een benchmark die is ontworpen om misbruikbare kwetsbaarheden te onderscheiden van veilige code die er alleen maar gevaarlijk uitziet. Geen enkele voldeed aan de door AWS aangegeven productiedrempel voor zowel fout-positieve als fout-negatieve cijfers.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
BronreferentieBron opgenomen
Uitgever
helpnetsecurity.com
Bronlink
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Brontype
Gekoppelde bron: de status van de primaire bron is niet vastgesteld.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Precisie
Het percentage voorspelde positieve uitkomsten dat daadwerkelijk correct is.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Help Net Security meldt dat AWS zijn Deception publiekelijk heeft vrijgegeven, die test of AI-modellen echte softwarekwetsbaarheden kunnen onderscheiden van veilige code die misleidende kwetsbaarheidspatronen bevat. De benchmark omvat 14.822 voorbeelden uit 16 programmeertalen en meer dan 70 CWE-categorieën; Er worden 9.695 gescoord en 5.127 worden gemengd als niet-gescoorde monsters.

Help Net Security meldt dat AWS twaalf algemene modellen van vijf providers heeft geëvalueerd met behulp van een die is ontworpen rond valse positieven. De veilige voorbeelden van de benchmark bevatten echte kwetsbaarheidspatronen naast beschermingsmaatregelen die uitbuiting voorkomen. Sommige uitdagingen variëren de implementatieomstandigheden, zoals het Kubernetes-netwerkbeleid, dus een model moet rekening houden met zowel de code als de omgeving.

Volgens het rapport genereerde en verfijnde AWS voorbeelden tegen grensmodellen, waarbij steekproeven werden uitgesloten die te gemakkelijk te classificeren waren. AWS zegt dat dit proces tientallen miljarden tokens heeft verbruikt. Het bedrijf geeft de monsters publiekelijk vrij, maar onthoudt hun labels; gebruikers dienen voorspellingen in bij AWS voor geverifieerde scores. De bron vermeldt niet of er voor toegang tot scores een vergoeding of andere deelnamevereisten gelden.

Help Net Security meldt dat onafhankelijke reviewers labels controleren zonder elkaars beslissingen of de oorspronkelijke redenering te zien. Betwiste monsters worden verder beoordeeld en onopgeloste zaken worden verplaatst naar de reeks zonder score. AWS zegt dat minder dan 3% van de gescoorde monsters na beoordeling betwist blijft, met als doel dat minder dan 1% de menselijke beoordeling overleeft, en rapporteert geen etiketteringsfouten in een beoordeling van 100 willekeurig geselecteerde gescoorde monsters. Deze beweringen zijn hier niet onafhankelijk bevestigd.

Brongegevens: helpnetsecurity.com ↗

Waarom het ertoe doet

De resultaten suggereren dat sterke prestaties bij het vinden van verdachte code zich niet noodzakelijkerwijs vertalen in een betrouwbare beoordeling van kwetsbaarheden. Hoge fout-positieve cijfers kunnen beveiligingsteams belasten en het vertrouwen in waarschuwingen verzwakken, terwijl strengere bewijsvereisten ervoor kunnen zorgen dat modellen echte kwetsbaarheden over het hoofd zien. De bevindingen zijn relevant voor organisaties die AI-ondersteunde codebeoordeling of beveiligingsoperaties overwegen, maar ze meten geen volledige commerciële beveiligingsproducten.

De richt zich op een praktische zwakte in AI-ondersteunde beveiliging: een model kan een gevaarlijk ogend patroon herkennen zonder de controles te begrijpen die uitbuiting voorkomen. Help Net Security meldt dat directe aanwijzingen een fout-positief percentage van 41% tot 99% opleverden, terwijl de nauwkeurigheid varieerde van 52% tot 71%.

Door modellen te vragen om aan te tonen dat een kwetsbaarheid daadwerkelijk kan worden misbruikt, is het aantal valse positieven volgens het rapport met 17 tot 74 procentpunten gedaald, maar zijn de fout-negatieve percentages gestegen tot tussen de 7% en 44%. De door AWS aangegeven minimale productiebalk lag voor beide maatregelen onder de 10%, en geen van de geteste configuraties voldeed aan beide drempels.

Deze resultaten mogen niet worden gelezen als een ranglijst van complete beveiligingsproducten. AWS testte single-turn-prompts op modellen voor algemene doeleinden, niet op speciaal gebouwde systemen die tools, herhaalde validatie of agentische workflows gebruiken. De bron ondersteunt daarom voorzichtigheid met betrekking tot kwetsbaarheidsoordelen op modelniveau, en niet de conclusie dat AI-beveiligingsproducten als geheel falen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

Kijk uit naar onafhankelijke evaluaties met behulp van de vrijgegeven voorbeelden, resultaten van beveiligingssystemen die tools gebruiken of meerstapsbeveiliging, en bewijsmateriaal over de prestaties in echte productieomgevingen. De bron documenteert niet de prijzen, de toegang op serviceniveau en de vraag of het scoreproces van AWS zonder beperkingen beschikbaar is. Er wordt ook niet aangetoond dat de geteste modellen op vergelijkbare wijze presteren op niet-openbaar gemaakte bedrijfscode.

Onafhankelijke onderzoekers kunnen de openbare steekproeven en het evaluatieproces gebruiken zonder de door AWS gerapporteerde kosten voor het genereren van gegevens opnieuw te creëren, maar achtergehouden labels en door AWS geverifieerde scores zijn bedoeld om benchmarkspecifieke optimalisatie te beperken. Replicatie door externe groepen zou helpen bij het testen van de gerapporteerde resultaten en de kwaliteit van de etikettering.

Toekomstige evaluaties moeten single-pass-modellen vergelijken met systemen die opslagplaatsen inspecteren, code veilig uitvoeren, over de configuratie van de implementatie redeneren en bewijs vereisen voordat een waarschuwing wordt afgegeven. Deze tests zouden beter kunnen aangeven hoeveel praktische beveiligingstools de resultaten op basis van alleen modellen verbeteren.

De bron laat belangrijke onbekenden achter: het identificeert niet de twaalf geteste modelconfiguraties, rapporteert niet de resultaten per model in de meegeleverde tekst, documenteert geen prijzen of toegangsvoorwaarden voor geverifieerde scores, en laat niet zien hoe de prestaties worden overgedragen naar propriëtaire codebases en live beveiligingsoperaties.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-ethiekPrompt EngineeringTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-regelgevingstracker
Vond je dit nuttig?