Ce sa întâmplat
Cercetătorii au publicat MMPIBench, un care evaluează atacurile multimodale cu injecție ă asupra cadrelor AI agentice. Studiul a testat șase cadre și cinci modele de bază pe canalele vizuale și audio, constatând că, în timp ce atacurile vizuale sunt în mare parte blocate în timpul planificării, atacurile audio au o rată de finalizare semnificativ mai mare atunci când infrastructura le suportă.
Cercetătorii au introdus MMPIBench, un reproductibil conceput pentru a măsura impactul atacurilor multimodale cu injecție ă asupra cadrelor de AI agentice. Aceste cadre permit modelelor de limbaj să planifice, să mențină memoria și să apeleze instrumente care interacționează cu fișierele, e-mailurile și serviciile din lumea reală. Benchmark-ul oferă un set fix de atacuri prin șase purtători vizuali, inclusiv text OCR, suprapuneri, metadate EXIF, coduri QR, interfețe false și hibrizi, urmărind cât de departe parcurg instrucțiunile injectate de la percepție la planificare până la execuția instrumentului.
Studiul a efectuat 720 de rulări acoperind șase cadre, cinci modele de bază, șase purtători și patru obiective pentru atacatori. Rezultatele au arătat că atacurile s-au finalizat în aproximativ 1% din rulări, dar au fost încercate în 12,8%. Diferența dintre atacurile încercate și cele finalizate a fost închis aproape în întregime la etapa de planificare, în care modelul a citit instrucțiunile injectate și a refuzat să acționeze. Modelul de bază specific folosit a contat mult mai mult decât cadrul pentru a stabili dacă o instrucțiune a fost aplicată; un model nu a încercat niciodată un atac și a recunoscut injecția în 59,7% din rulări, în timp ce alți doi au încercat atacuri în 23,6% din rulări.
Cercetătorii au extins standardul la audio, singurul alt canal perceptiv brut acceptat de modelele de frontieră actuale. Doar două dintre cele cinci modele au ingerat audio și doar trei dintre cele șase cadre l-au furnizat. Cu toate acestea, acolo unde a sosit semnalul, atacul s-a finalizat în 49% din celule, crescând la 75% pentru un model specific. Acest lucru indică faptul că, în timp ce canalele vizuale sunt puternic apărate de logica de planificare, canalele audio sunt mai înguste, dar mult mai puțin apărate, ceea ce duce la rate de succes mai mari pentru instrucțiunile rău intenționate.
De ce contează
Această cercetare oferă dovezi concrete, reproductibile, că sistemele AI agentice, care pot accesa fișiere și servicii reale, rămân vulnerabile la injectarea ă indirectă prin canale non-textuale. Descoperirile evidențiază o deficiență critică de securitate: în timp ce injecțiile vizuale sunt adesea neutralizate de raționamentul modelului, canalele audio sunt mai puțin apărate și pot duce la apeluri de instrumente rău intenționate de succes. Acest lucru subliniază necesitatea unei igienizări robuste și a unei instruiri multimodale în materie de siguranță în implementările agentice.
Studiul demonstrează că raportarea numai a ratelor de finalizare a atacurilor subestimează expunerea reală la securitate a sistemelor AI agentice. Rata ridicată a tentativelor de atac (12,8%) în comparație cu cele finalizate (1%) sugerează că modelele actuale recunosc adesea intențiile rău intenționate, dar că această apărare nu este uniformă pentru toate modelele sau modalitățile.
Constatarea că atacurile bazate pe audio au o rată de finalizare de 49% în mediile acceptate este deosebit de îngrijorătoare, deoarece audio este un canal de intrare mai puțin obișnuit pentru multe implementări agentice, ceea ce înseamnă că poate primi mai puțin control de securitate. Acest lucru creează un potențial punct mort în care atacatorii ar putea ocoli apărarea vizuală folosind intrări audio pentru a manipula agenții pentru a executa apeluri dăunătoare la instrumente.
Variabilitatea dintre modele, un model recunoscând injecțiile în aproape 60% din rulări și alții încercând atacuri în peste 20%, evidențiază faptul că selecția modelului este un factor critic în securitatea AI agentică. Organizațiile nu se pot baza doar pe garanții la nivel de cadru și trebuie să ia în considerare caracteristicile specifice de siguranță ale modelelor de bază de bază.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Ce să urmărești în continuare
Dezvoltatorii și întreprinderile care implementează AI agentic ar trebui să monitorizeze actualizările pentru MMPIBench și corecțiile de securitate aferente. Industria poate observa un accent sporit pe igienizarea intrărilor audio și permisiunea mai strictă pentru apelurile de instrumente ca răspuns la aceste constatări.
Monitorizați actualizările MMPIBench și cercetările ulterioare care pot testa canale perceptive suplimentare sau vectori de atac mai sofisticați. Reproductibilitatea -ului permite verificarea și extinderea continuă a comunității.
Urmăriți răspunsurile din industrie de la cei mai importanți dezvoltatori de cadre AI și furnizori de modele de bază, care pot lansa corecții de securitate sau instruire actualizată în materie de siguranță pentru a aborda vulnerabilitățile specifice identificate în canalele audio și vizuale.
Observați modul în care întreprinderile care implementează AI agentic își ajustează protocoalele de securitate, potențial implementând o filtrare mai strictă de intrare pentru datele non-textuale și controale mai granulare ale permisiunilor pentru apelurile de instrumente pentru a atenua riscurile evidențiate de studiu.