Torna alle notizie
SicurezzaAI Understanding briefing

Un nuovo benchmark rivela strutture di IA agentiche vulnerabili alla pronta iniezione multimodale

I ricercatori introducono MMPIBench, un benchmark riproducibile che mostra che mentre i framework di intelligenza artificiale degli agenti spesso bloccano le iniezioni di prompt visivi in fase di pianificazione, gli attacchi basati su audio riescono in quasi la metà degli scenari testati in cui il canale è supportato.

4 min readRead the primary source
Source-provided image accompanying New benchmark reveals agentic AI frameworks vulnerable to multimodal prompt injection
Documento di origine primariaFonte registrata
Editore
arxiv.org
Collegamento alla fonte
arxiv.orghttps://arxiv.org/abs/2609.09404
Tipo di fonte
Documento principale: un annuncio ufficiale, un documento, un documento o una pagina proprietaria che leggiamo direttamente.
ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

Iniezione rapida
Un modello di attacco in cui istruzioni dannose vengono inserite negli input del modello o nel contenuto recuperato.
Punto di riferimento
Un test o un set di dati standardizzato utilizzato per misurare e confrontare le prestazioni del modello.
Richiedi
Le istruzioni di input e il contesto forniti a un modello generativo.
Mettiti alla provaQuiz sugli agenti IA

Cosa è successo

I ricercatori hanno pubblicato MMPIBench, un che valuta gli attacchi multimodali di pronta iniezione su strutture di IA agentiche. Lo studio ha testato sei framework e cinque modelli fondamentali su canali visivi e audio, scoprendo che mentre gli attacchi visivi vengono in gran parte bloccati durante la pianificazione, gli attacchi audio hanno un tasso di completamento significativamente più elevato quando l’infrastruttura li supporta.

I ricercatori hanno introdotto MMPIBench, un riproducibile progettato per misurare l'impatto degli attacchi multimodali di iniezione rapida sui framework di intelligenza artificiale degli agenti. Questi framework consentono ai modelli linguistici di pianificare, mantenere la memoria e richiamare strumenti che interagiscono con file, e-mail e servizi del mondo reale. Il benchmark fornisce una serie fissa di attacchi attraverso sei supporti visivi, tra cui testo OCR, sovrapposizioni, metadati EXIF, codici QR, interfacce false e ibridi, monitorando la distanza con cui le istruzioni immesse viaggiano dalla percezione attraverso la pianificazione fino all'esecuzione dello strumento.

Lo studio ha condotto 720 analisi riguardanti sei framework, cinque modelli di base, sei vettori e quattro obiettivi degli aggressori. I risultati hanno mostrato che gli attacchi sono stati completati in circa l'1% delle esecuzioni, ma sono stati tentati nel 12,8%. Il divario tra gli attacchi tentati e quelli completati è stato colmato quasi interamente nella fase di pianificazione, in cui il modello ha letto le istruzioni impartite e ha rifiutato di agire. Lo specifico modello di fondazione utilizzato contava molto più del contesto in cui si stabiliva se un'istruzione veniva eseguita; un modello non ha mai tentato un attacco e ha riconosciuto l'iniezione nel 59,7% delle corse, mentre altri due hanno tentato un attacco nel 23,6% delle corse.

I ricercatori hanno esteso il all’audio, l’unico altro canale percettivo grezzo accettato dagli attuali modelli di frontiera. Solo due dei cinque modelli hanno acquisito l'audio e solo tre dei sei framework lo hanno fornito. Tuttavia, laddove è arrivato il segnale, l’attacco è stato completato nel 49% delle cellule, percentuale che sale al 75% per un modello specifico. Ciò indica che mentre i canali visivi sono fortemente difesi dalla logica di pianificazione, i canali audio sono più ristretti ma molto meno difesi, portando a tassi di successo più elevati per le istruzioni dannose.

Dettagli della fonte: arxiv.org ↗

Perché è importante

Questa ricerca fornisce prove concrete e riproducibili del fatto che i sistemi di intelligenza artificiale agenti, che possono accedere a file e servizi reali, rimangono vulnerabili all’iniezione tempestiva indiretta attraverso canali non testuali. I risultati evidenziano una lacuna critica nella sicurezza: mentre le iniezioni visive sono spesso neutralizzate dal ragionamento del modello, i canali audio sono meno difesi e possono portare a chiamate di strumenti dannosi con successo. Ciò sottolinea la necessità di una solida sanificazione degli input e di una formazione sulla sicurezza multimodale negli schieramenti degli agenti.

Lo studio dimostra che riportare solo i tassi di completamento degli attacchi sottostima l’effettiva esposizione alla sicurezza dei sistemi di IA agentici. L’elevato tasso di attacchi tentati (12,8%) rispetto a quelli completati (1%) suggerisce che i modelli attuali spesso riconoscono intenti dannosi ma che questa difesa non è uniforme in tutti i modelli o modalità.

La scoperta che gli attacchi basati sull’audio hanno un tasso di completamento del 49% negli ambienti supportati è particolarmente preoccupante perché l’audio è un canale di input meno comune per molte implementazioni di agenti, il che significa che potrebbe ricevere meno controlli di sicurezza. Ciò crea un potenziale punto cieco in cui gli aggressori potrebbero aggirare le difese visive utilizzando input audio per manipolare gli agenti affinché eseguano chiamate a strumenti dannosi.

La variabilità tra i modelli, con un modello che riconosce le iniezioni in quasi il 60% delle esecuzioni e altri che tentano attacchi in oltre il 20%, evidenzia che la selezione del modello è un fattore critico nella sicurezza dell’IA degli agenti. Le organizzazioni non possono fare affidamento esclusivamente sulle salvaguardie a livello quadro e devono considerare le caratteristiche di sicurezza specifiche dei modelli di base sottostanti.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verifica concettuale interattiva+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Cosa guardare dopo

Gli sviluppatori e le aziende che implementano l'intelligenza artificiale tramite agenti dovrebbero monitorare gli aggiornamenti di MMPIBench e le relative patch di sicurezza. In risposta a questi risultati, il settore potrebbe vedere una maggiore attenzione alla sanificazione dell’input audio e autorizzazioni più rigorose per le chiamate agli strumenti.

Monitora gli aggiornamenti a MMPIBench e le successive ricerche che potrebbero testare canali percettivi aggiuntivi o vettori di attacco più sofisticati. La riproducibilità del consente la verifica e l'espansione continua della comunità.

Attendi le risposte del settore da parte dei principali sviluppatori di framework di intelligenza artificiale e fornitori di modelli di base, che potrebbero rilasciare patch di sicurezza o corsi di formazione aggiornati sulla sicurezza per affrontare le vulnerabilità specifiche identificate nei canali audio e video.

Osserva come le aziende che implementano l’IA agenteca adattano i loro protocolli di sicurezza, implementando potenzialmente un filtro di input più rigoroso per i dati non testuali e controlli di autorizzazione più granulari per le chiamate agli strumenti per mitigare i rischi evidenziati dallo studio.

Guide e quiz correlati

Agenti dell'intelligenza artificialeEtica dell'IASpiegazione dei modelli di intelligenza artificialeMetti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker della regolamentazione dell'IA
Lo hai trovato utile?