Terug naar Nieuws
BeveiligingAI Understanding-briefing

Nieuwe benchmark onthult agentische AI-frameworks die kwetsbaar zijn voor multimodale snelle injectie

Onderzoekers introduceren MMPIBench, een reproduceerbare benchmark die aantoont dat hoewel agentische AI-frameworks vaak visuele promptinjecties in de planningsfase blokkeren, op audio gebaseerde aanvallen slagen in bijna de helft van de geteste scenario's waarin het kanaal wordt ondersteund.

4 min readRead the primary source
Source-provided image accompanying New benchmark reveals agentic AI frameworks vulnerable to multimodal prompt injection
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2609.09404
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Snelle injectie
Een aanvalspatroon waarbij kwaadaardige instructies worden ingevoegd in modelinvoer of opgehaalde inhoud.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Snel
De invoerinstructies en context die aan een generatief model worden verstrekt.
Test jezelfAI-agentenquiz

Wat is er gebeurd

Onderzoekers publiceerden MMPIBench, een die multimodale -aanvallen op agentische AI-frameworks evalueert. In het onderzoek werden zes raamwerken en vijf basismodellen getest via visuele en audiokanalen. Hieruit bleek dat hoewel visuele aanvallen grotendeels worden geblokkeerd tijdens de planning, audio-aanvallen een aanzienlijk hoger voltooiingspercentage hebben wanneer de infrastructuur ze ondersteunt.

Onderzoekers introduceerden MMPIBench, een reproduceerbare die is ontworpen om de impact van multimodale -aanvallen op agentische AI-frameworks te meten. Met deze raamwerken kunnen taalmodellen plannen, geheugen onderhouden en tools aanroepen die communiceren met echte bestanden, e-mails en services. De benchmark levert een vaste reeks aanvallen via zes visuele dragers, waaronder OCR-tekst, overlays, EXIF-metadata, QR-codes, nep-interfaces en hybriden, waarbij wordt bijgehouden hoe ver geïnjecteerde instructies reiken van perceptie via planning naar tool-uitvoering.

De studie voerde 720 runs uit die zes raamwerken, vijf basismodellen, zes dragers en vier aanvallerdoelen bestreken. Uit de resultaten bleek dat aanvallen in ongeveer 1% van de runs werden voltooid, maar in 12,8% werden geprobeerd. De kloof tussen pogingen tot en voltooide aanvallen werd vrijwel geheel gedicht tijdens de planningsstap, waarbij het model de geïnjecteerde instructie las en weigerde actie te ondernemen. Het specifieke basismodel dat werd gebruikt, was veel belangrijker dan het raamwerk voor de vraag of er naar een instructie werd gehandeld; Eén model heeft nooit een aanval geprobeerd en herkende de injectie in 59,7% van de runs, terwijl twee andere in 23,6% van de runs een aanval probeerden.

De onderzoekers breidden de uit naar audio, het enige andere ruwe perceptuele kanaal dat door de huidige grensmodellen wordt geaccepteerd. Slechts twee van de vijf modellen namen audio op, en slechts drie van de zes raamwerken leverden dit. Waar het signaal echter arriveerde, werd de aanval in 49% van de cellen voltooid, oplopend tot 75% voor één specifiek model. Dit geeft aan dat hoewel visuele kanalen zwaar worden verdedigd door planningslogica, audiokanalen smaller maar veel minder verdedigd zijn, wat leidt tot hogere succespercentages voor kwaadaardige instructies.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

Dit onderzoek levert concreet, reproduceerbaar bewijs dat agentische AI-systemen, die toegang hebben tot echte bestanden en diensten, kwetsbaar blijven voor indirecte injectie via niet-tekstuele kanalen. De bevindingen benadrukken een kritieke veiligheidslacune: hoewel visuele injecties vaak worden geneutraliseerd door modelredenering, worden audiokanalen minder verdedigd en kunnen ze leiden tot succesvolle oproepen van kwaadaardige tools. Dit onderstreept de behoefte aan robuuste input-sanering en multimodale veiligheidstraining bij de inzet van agenten.

Het onderzoek toont aan dat het rapporteren van alleen de voltooiingspercentages van aanvallen de feitelijke beveiligingsblootstelling van agentische AI-systemen onderschat. Het hoge percentage aanvalspogingen (12,8%) in vergelijking met voltooide aanvallen (1%) suggereert dat de huidige modellen vaak kwaadaardige bedoelingen herkennen, maar dat deze verdediging niet uniform is voor alle modellen of modaliteiten.

De bevinding dat op audio gebaseerde aanvallen in ondersteunde omgevingen een voltooiingspercentage van 49% hebben, is vooral zorgwekkend omdat audio een minder gebruikelijk invoerkanaal is voor veel agentische implementaties, wat betekent dat er mogelijk minder veiligheidscontrole op wordt uitgeoefend. Dit creëert een potentiële blinde vlek waarin aanvallers de visuele verdediging kunnen omzeilen door audio-invoer te gebruiken om agenten te manipuleren om schadelijke tooloproepen uit te voeren.

De variabiliteit tussen modellen, waarbij één model injecties herkent in bijna 60% van de runs en andere die aanvallen proberen uit te voeren in meer dan 20%, benadrukt dat modelselectie een cruciale factor is in agentische AI-beveiliging. Organisaties kunnen niet uitsluitend vertrouwen op waarborgen op raamwerkniveau en moeten rekening houden met de specifieke veiligheidskenmerken van de onderliggende funderingsmodellen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Wat je nu moet bekijken

Ontwikkelaars en ondernemingen die agentische AI ​​inzetten, moeten controleren op updates voor MMPIBench en gerelateerde beveiligingspatches. Als reactie op deze bevindingen kan de industrie een grotere aandacht zien voor het opschonen van audio-invoer en strengere toestemming voor het oproepen van tools.

Controleer op updates voor MMPIBench en daaropvolgend onderzoek dat aanvullende perceptuele kanalen of meer geavanceerde aanvalsvectoren kan testen. De reproduceerbaarheid van de maakt voortdurende gemeenschapsverificatie en uitbreiding mogelijk.

Kijk uit naar reacties uit de sector van grote AI-frameworkontwikkelaars en aanbieders van basismodellen, die mogelijk beveiligingspatches of bijgewerkte veiligheidstrainingen uitbrengen om de specifieke kwetsbaarheden aan te pakken die in de audio- en visuele kanalen zijn geïdentificeerd.

Observeer hoe bedrijven die agentische AI ​​inzetten hun beveiligingsprotocollen aanpassen, waarbij ze mogelijk strengere invoerfilters voor niet-tekstuele gegevens en gedetailleerdere toestemmingscontroles voor tooloproepen implementeren om de risico's die door het onderzoek naar voren komen te beperken.

Gerelateerde gidsen en quizzen

AI-agentenAI-ethiekAI-modellen uitgelegdTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-regelgevingstracker
Vond je dit nuttig?