Înapoi la Știri
SecuritateAI Understanding briefing

Noul benchmark dezvăluie cadrele AI agentice vulnerabile la injectarea rapidă multimodală

Cercetătorii introduc MMPIBench, un etalon reproductibil care arată că, în timp ce cadrele AI agentice blochează adesea injecțiile vizuale prompte în etapa de planificare, atacurile bazate pe audio reușesc în aproape jumătate din scenariile testate în care canalul este suportat.

4 min readRead the primary source
Source-provided image accompanying New benchmark reveals agentic AI frameworks vulnerable to multimodal prompt injection
Document sursă primarăSursa înregistrată
Editor
arxiv.org
Link sursă
arxiv.orghttps://arxiv.org/abs/2609.09404
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Injecție promptă
Un model de atac în care instrucțiuni rău intenționate sunt inserate în intrările modelului sau conținutul preluat.
Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Prompt
Instrucțiunile de intrare și contextul furnizate unui model generativ.
Testează-teTest pentru agenții AI

Ce sa întâmplat

Cercetătorii au publicat MMPIBench, un care evaluează atacurile multimodale cu injecție ă asupra cadrelor AI agentice. Studiul a testat șase cadre și cinci modele de bază pe canalele vizuale și audio, constatând că, în timp ce atacurile vizuale sunt în mare parte blocate în timpul planificării, atacurile audio au o rată de finalizare semnificativ mai mare atunci când infrastructura le suportă.

Cercetătorii au introdus MMPIBench, un reproductibil conceput pentru a măsura impactul atacurilor multimodale cu injecție ă asupra cadrelor de AI agentice. Aceste cadre permit modelelor de limbaj să planifice, să mențină memoria și să apeleze instrumente care interacționează cu fișierele, e-mailurile și serviciile din lumea reală. Benchmark-ul oferă un set fix de atacuri prin șase purtători vizuali, inclusiv text OCR, suprapuneri, metadate EXIF, coduri QR, interfețe false și hibrizi, urmărind cât de departe parcurg instrucțiunile injectate de la percepție la planificare până la execuția instrumentului.

Studiul a efectuat 720 de rulări acoperind șase cadre, cinci modele de bază, șase purtători și patru obiective pentru atacatori. Rezultatele au arătat că atacurile s-au finalizat în aproximativ 1% din rulări, dar au fost încercate în 12,8%. Diferența dintre atacurile încercate și cele finalizate a fost închis aproape în întregime la etapa de planificare, în care modelul a citit instrucțiunile injectate și a refuzat să acționeze. Modelul de bază specific folosit a contat mult mai mult decât cadrul pentru a stabili dacă o instrucțiune a fost aplicată; un model nu a încercat niciodată un atac și a recunoscut injecția în 59,7% din rulări, în timp ce alți doi au încercat atacuri în 23,6% din rulări.

Cercetătorii au extins standardul la audio, singurul alt canal perceptiv brut acceptat de modelele de frontieră actuale. Doar două dintre cele cinci modele au ingerat audio și doar trei dintre cele șase cadre l-au furnizat. Cu toate acestea, acolo unde a sosit semnalul, atacul s-a finalizat în 49% din celule, crescând la 75% pentru un model specific. Acest lucru indică faptul că, în timp ce canalele vizuale sunt puternic apărate de logica de planificare, canalele audio sunt mai înguste, dar mult mai puțin apărate, ceea ce duce la rate de succes mai mari pentru instrucțiunile rău intenționate.

Detalii sursa: arxiv.org ↗

De ce contează

Această cercetare oferă dovezi concrete, reproductibile, că sistemele AI agentice, care pot accesa fișiere și servicii reale, rămân vulnerabile la injectarea ă indirectă prin canale non-textuale. Descoperirile evidențiază o deficiență critică de securitate: în timp ce injecțiile vizuale sunt adesea neutralizate de raționamentul modelului, canalele audio sunt mai puțin apărate și pot duce la apeluri de instrumente rău intenționate de succes. Acest lucru subliniază necesitatea unei igienizări robuste și a unei instruiri multimodale în materie de siguranță în implementările agentice.

Studiul demonstrează că raportarea numai a ratelor de finalizare a atacurilor subestimează expunerea reală la securitate a sistemelor AI agentice. Rata ridicată a tentativelor de atac (12,8%) în comparație cu cele finalizate (1%) sugerează că modelele actuale recunosc adesea intențiile rău intenționate, dar că această apărare nu este uniformă pentru toate modelele sau modalitățile.

Constatarea că atacurile bazate pe audio au o rată de finalizare de 49% în mediile acceptate este deosebit de îngrijorătoare, deoarece audio este un canal de intrare mai puțin obișnuit pentru multe implementări agentice, ceea ce înseamnă că poate primi mai puțin control de securitate. Acest lucru creează un potențial punct mort în care atacatorii ar putea ocoli apărarea vizuală folosind intrări audio pentru a manipula agenții pentru a executa apeluri dăunătoare la instrumente.

Variabilitatea dintre modele, un model recunoscând injecțiile în aproape 60% din rulări și alții încercând atacuri în peste 20%, evidențiază faptul că selecția modelului este un factor critic în securitatea AI agentică. Organizațiile nu se pot baza doar pe garanții la nivel de cadru și trebuie să ia în considerare caracteristicile specifice de siguranță ale modelelor de bază de bază.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Ce să urmărești în continuare

Dezvoltatorii și întreprinderile care implementează AI agentic ar trebui să monitorizeze actualizările pentru MMPIBench și corecțiile de securitate aferente. Industria poate observa un accent sporit pe igienizarea intrărilor audio și permisiunea mai strictă pentru apelurile de instrumente ca răspuns la aceste constatări.

Monitorizați actualizările MMPIBench și cercetările ulterioare care pot testa canale perceptive suplimentare sau vectori de atac mai sofisticați. Reproductibilitatea -ului permite verificarea și extinderea continuă a comunității.

Urmăriți răspunsurile din industrie de la cei mai importanți dezvoltatori de cadre AI și furnizori de modele de bază, care pot lansa corecții de securitate sau instruire actualizată în materie de siguranță pentru a aborda vulnerabilitățile specifice identificate în canalele audio și vizuale.

Observați modul în care întreprinderile care implementează AI agentic își ajustează protocoalele de securitate, potențial implementând o filtrare mai strictă de intrare pentru datele non-textuale și controale mai granulare ale permisiunilor pentru apelurile de instrumente pentru a atenua riscurile evidențiate de studiu.

Ghiduri și chestionare conexe

Agenți AIEtica IAModelele AI explicateTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a reglementărilor AI
Ai găsit asta util?