Voltar às notícias
SegurançaInstruções AI Understanding

Novo benchmark revela estruturas de IA de agente vulneráveis à injeção imediata multimodal

Os pesquisadores apresentam o MMPIBench, um benchmark reproduzível que mostra que, embora as estruturas de IA de agentes geralmente bloqueiem injeções de prompts visuais no estágio de planejamento, os ataques baseados em áudio são bem-sucedidos em quase metade dos cenários testados onde o canal é suportado.

4 min readRead the primary source
Source-provided image accompanying New benchmark reveals agentic AI frameworks vulnerable to multimodal prompt injection
Documento de origem primáriaFonte registrada
Editora
arxiv.org
Link da fonte
arxiv.orghttps://arxiv.org/abs/2609.09404
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Injeção imediata
Um padrão de ataque em que instruções maliciosas são inseridas nas entradas do modelo ou no conteúdo recuperado.
Referência
Um teste padronizado ou conjunto de dados usado para medir e comparar o desempenho do modelo.
Alerta
As instruções de entrada e o contexto fornecidos a um modelo generativo.
Teste você mesmoQuestionário sobre agentes de IA

O que aconteceu

Os pesquisadores publicaram o MMPIBench, um que avalia ataques multimodais de injeção imediata em estruturas de IA de agentes. O estudo testou seis estruturas e cinco modelos básicos em canais visuais e de áudio, descobrindo que, embora os ataques visuais sejam amplamente bloqueados durante o planejamento, os ataques de áudio têm uma taxa de conclusão significativamente maior quando a infraestrutura os suporta.

Os pesquisadores introduziram o MMPIBench, um reproduzível projetado para medir o impacto de ataques multimodais de injeção imediata em estruturas de IA de agentes. Essas estruturas permitem que modelos de linguagem planejem, mantenham memória e chamem ferramentas que interagem com arquivos, e-mails e serviços do mundo real. O benchmark oferece um conjunto fixo de ataques por meio de seis suportes visuais, incluindo texto OCR, sobreposições, metadados EXIF, códigos QR, interfaces falsas e híbridos, rastreando até que ponto as instruções injetadas viajam desde a percepção, passando pelo planejamento, até a execução da ferramenta.

O estudo conduziu 720 execuções abrangendo seis estruturas, cinco modelos básicos, seis operadoras e quatro objetivos de ataque. Os resultados mostraram que os ataques foram concluídos em aproximadamente 1% das execuções, mas foram tentados em 12,8%. A lacuna entre os ataques tentados e os ataques concluídos foi eliminada quase inteiramente na etapa de planejamento, onde o modelo leu a instrução injetada e se recusou a agir. O modelo básico específico utilizado importava muito mais do que a estrutura para determinar se uma instrução foi executada; um modelo nunca tentou um ataque e reconheceu a injeção em 59,7% das execuções, enquanto outros dois tentaram ataques em 23,6% das execuções.

Os pesquisadores estenderam o ao áudio, o único outro canal perceptual bruto aceito pelos atuais modelos de fronteira. Apenas dois dos cinco modelos consumiram áudio e apenas três dos seis frameworks o entregaram. Porém, onde o sinal chegou, o ataque foi concluído em 49% das células, subindo para 75% para um modelo específico. Isto indica que enquanto os canais visuais são fortemente defendidos pela lógica de planeamento, os canais de áudio são mais estreitos, mas muito menos defendidos, levando a taxas de sucesso mais elevadas para instruções maliciosas.

Detalhes da fonte: arxiv.org ↗

Por que isso importa

Esta pesquisa fornece evidências concretas e reprodutíveis de que os sistemas de IA de agente, que podem acessar arquivos e serviços reais, permanecem vulneráveis ​​à injeção indireta imediata por meio de canais não textuais. As descobertas destacam uma lacuna crítica de segurança: embora as injeções visuais sejam frequentemente neutralizadas pelo raciocínio do modelo, os canais de áudio são menos defendidos e podem levar a chamadas de ferramentas maliciosas bem-sucedidas. Isto sublinha a necessidade de uma higienização robusta de insumos e de treinamento de segurança multimodal em implantações de agentes.

O estudo demonstra que relatar apenas as taxas de conclusão de ataques subestima a exposição real à segurança dos sistemas de IA dos agentes. A elevada taxa de tentativas de ataques (12,8%) em comparação com os ataques concluídos (1%) sugere que os modelos atuais reconhecem frequentemente intenções maliciosas, mas que esta defesa não é uniforme em todos os modelos ou modalidades.

A descoberta de que os ataques baseados em áudio têm uma taxa de conclusão de 49% em ambientes suportados é particularmente preocupante porque o áudio é um canal de entrada menos comum para muitas implantações de agentes, o que significa que pode receber menos escrutínio de segurança. Isso cria um potencial ponto cego onde os invasores podem contornar as defesas visuais usando entradas de áudio para manipular os agentes para que executem chamadas de ferramentas prejudiciais.

A variabilidade entre modelos, com um modelo reconhecendo injeções em quase 60% das execuções e outros tentando ataques em mais de 20%, destaca que a seleção do modelo é um fator crítico na segurança da IA ​​de agente. As organizações não podem confiar apenas em salvaguardas ao nível da estrutura e devem considerar as características de segurança específicas dos modelos de fundação subjacentes.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

O que assistir a seguir

Os desenvolvedores e empresas que implantam IA de agente devem monitorar atualizações do MMPIBench e patches de segurança relacionados. A indústria poderá ver um foco maior na higienização de entrada de áudio e permissões mais rigorosas para chamadas de ferramentas em resposta a essas descobertas.

Monitore atualizações do MMPIBench e pesquisas subsequentes que possam testar canais perceptivos adicionais ou vetores de ataque mais sofisticados. A reprodutibilidade do permite a verificação e expansão contínua da comunidade.

Fique atento às respostas do setor dos principais desenvolvedores de estruturas de IA e fornecedores de modelos básicos, que podem lançar patches de segurança ou treinamento de segurança atualizado para resolver as vulnerabilidades específicas identificadas nos canais de áudio e visuais.

Observe como as empresas que implantam IA de agente ajustam seus protocolos de segurança, implementando potencialmente uma filtragem de entrada mais rigorosa para dados não textuais e controles de permissão mais granulares para chamadas de ferramentas para mitigar os riscos destacados pelo estudo.

Guias e questionários relacionados

Agentes de IAÉtica da IAModelos de IA explicadosTeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de regulamentação de IA
Achou isso útil?