Wat is er gebeurd
Onderzoekers publiceerden MMPIBench, een die multimodale -aanvallen op agentische AI-frameworks evalueert. In het onderzoek werden zes raamwerken en vijf basismodellen getest via visuele en audiokanalen. Hieruit bleek dat hoewel visuele aanvallen grotendeels worden geblokkeerd tijdens de planning, audio-aanvallen een aanzienlijk hoger voltooiingspercentage hebben wanneer de infrastructuur ze ondersteunt.
Onderzoekers introduceerden MMPIBench, een reproduceerbare die is ontworpen om de impact van multimodale -aanvallen op agentische AI-frameworks te meten. Met deze raamwerken kunnen taalmodellen plannen, geheugen onderhouden en tools aanroepen die communiceren met echte bestanden, e-mails en services. De benchmark levert een vaste reeks aanvallen via zes visuele dragers, waaronder OCR-tekst, overlays, EXIF-metadata, QR-codes, nep-interfaces en hybriden, waarbij wordt bijgehouden hoe ver geïnjecteerde instructies reiken van perceptie via planning naar tool-uitvoering.
De studie voerde 720 runs uit die zes raamwerken, vijf basismodellen, zes dragers en vier aanvallerdoelen bestreken. Uit de resultaten bleek dat aanvallen in ongeveer 1% van de runs werden voltooid, maar in 12,8% werden geprobeerd. De kloof tussen pogingen tot en voltooide aanvallen werd vrijwel geheel gedicht tijdens de planningsstap, waarbij het model de geïnjecteerde instructie las en weigerde actie te ondernemen. Het specifieke basismodel dat werd gebruikt, was veel belangrijker dan het raamwerk voor de vraag of er naar een instructie werd gehandeld; Eén model heeft nooit een aanval geprobeerd en herkende de injectie in 59,7% van de runs, terwijl twee andere in 23,6% van de runs een aanval probeerden.
De onderzoekers breidden de uit naar audio, het enige andere ruwe perceptuele kanaal dat door de huidige grensmodellen wordt geaccepteerd. Slechts twee van de vijf modellen namen audio op, en slechts drie van de zes raamwerken leverden dit. Waar het signaal echter arriveerde, werd de aanval in 49% van de cellen voltooid, oplopend tot 75% voor één specifiek model. Dit geeft aan dat hoewel visuele kanalen zwaar worden verdedigd door planningslogica, audiokanalen smaller maar veel minder verdedigd zijn, wat leidt tot hogere succespercentages voor kwaadaardige instructies.
Waarom het ertoe doet
Dit onderzoek levert concreet, reproduceerbaar bewijs dat agentische AI-systemen, die toegang hebben tot echte bestanden en diensten, kwetsbaar blijven voor indirecte injectie via niet-tekstuele kanalen. De bevindingen benadrukken een kritieke veiligheidslacune: hoewel visuele injecties vaak worden geneutraliseerd door modelredenering, worden audiokanalen minder verdedigd en kunnen ze leiden tot succesvolle oproepen van kwaadaardige tools. Dit onderstreept de behoefte aan robuuste input-sanering en multimodale veiligheidstraining bij de inzet van agenten.
Het onderzoek toont aan dat het rapporteren van alleen de voltooiingspercentages van aanvallen de feitelijke beveiligingsblootstelling van agentische AI-systemen onderschat. Het hoge percentage aanvalspogingen (12,8%) in vergelijking met voltooide aanvallen (1%) suggereert dat de huidige modellen vaak kwaadaardige bedoelingen herkennen, maar dat deze verdediging niet uniform is voor alle modellen of modaliteiten.
De bevinding dat op audio gebaseerde aanvallen in ondersteunde omgevingen een voltooiingspercentage van 49% hebben, is vooral zorgwekkend omdat audio een minder gebruikelijk invoerkanaal is voor veel agentische implementaties, wat betekent dat er mogelijk minder veiligheidscontrole op wordt uitgeoefend. Dit creëert een potentiële blinde vlek waarin aanvallers de visuele verdediging kunnen omzeilen door audio-invoer te gebruiken om agenten te manipuleren om schadelijke tooloproepen uit te voeren.
De variabiliteit tussen modellen, waarbij één model injecties herkent in bijna 60% van de runs en andere die aanvallen proberen uit te voeren in meer dan 20%, benadrukt dat modelselectie een cruciale factor is in agentische AI-beveiliging. Organisaties kunnen niet uitsluitend vertrouwen op waarborgen op raamwerkniveau en moeten rekening houden met de specifieke veiligheidskenmerken van de onderliggende funderingsmodellen.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Wat je nu moet bekijken
Ontwikkelaars en ondernemingen die agentische AI inzetten, moeten controleren op updates voor MMPIBench en gerelateerde beveiligingspatches. Als reactie op deze bevindingen kan de industrie een grotere aandacht zien voor het opschonen van audio-invoer en strengere toestemming voor het oproepen van tools.
Controleer op updates voor MMPIBench en daaropvolgend onderzoek dat aanvullende perceptuele kanalen of meer geavanceerde aanvalsvectoren kan testen. De reproduceerbaarheid van de maakt voortdurende gemeenschapsverificatie en uitbreiding mogelijk.
Kijk uit naar reacties uit de sector van grote AI-frameworkontwikkelaars en aanbieders van basismodellen, die mogelijk beveiligingspatches of bijgewerkte veiligheidstrainingen uitbrengen om de specifieke kwetsbaarheden aan te pakken die in de audio- en visuele kanalen zijn geïdentificeerd.
Observeer hoe bedrijven die agentische AI inzetten hun beveiligingsprotocollen aanpassen, waarbij ze mogelijk strengere invoerfilters voor niet-tekstuele gegevens en gedetailleerdere toestemmingscontroles voor tooloproepen implementeren om de risico's die door het onderzoek naar voren komen te beperken.