发生了什么
研究人员发布了 MMPIBench,这是一个评估对代理 AI 框架的多模式提示注入攻击的基准。该研究跨视觉和音频通道测试了六个框架和五个基础模型,发现虽然视觉攻击在规划过程中很大程度上被阻止,但当基础设施支持时,音频攻击的完成率明显更高。
研究人员推出了 MMPIBench,这是一个可重复的基准测试,旨在衡量多模式提示注入攻击对代理 AI 框架的影响。这些框架允许语言模型规划、维护内存以及调用与现实世界的文件、电子邮件和服务交互的工具。该基准测试通过六个视觉载体(包括 OCR 文本、覆盖、EXIF 元数据、QR 码、虚假界面和混合载体)提供一组固定的攻击,跟踪注入指令从感知到规划到工具执行的传播距离。
该研究进行了 720 次运行,涵盖 6 个框架、5 个基础模型、6 个载体和 4 个攻击目标。结果显示,攻击在大约 1% 的运行中完成,但在 12.8% 的运行中尝试攻击。尝试攻击和已完成攻击之间的差距几乎完全在规划步骤中被缩小,其中模型读取注入的指令并拒绝采取行动。所使用的具体基础模型远比指令是否被执行的框架更重要。一个模型从未尝试过攻击,并在 59.7% 的运行中识别出注入,而另外两个模型则在 23.6% 的运行中尝试攻击。
研究人员将基准扩展到音频,这是当前前沿模型接受的唯一其他原始感知通道。五个模型中只有两个接收音频,六个框架中只有三个提供音频。然而,在信号到达的地方,49% 的细胞完成了攻击,对于一种特定模型,这一比例上升到 75%。这表明,虽然视觉通道受到规划逻辑的严密防御,但音频通道更窄,但防御程度要低得多,从而导致恶意指令的成功率更高。
为什么这很重要
这项研究提供了具体的、可重复的证据,表明可以访问真实文件和服务的代理人工智能系统仍然容易受到通过非文本渠道的间接提示注入的影响。研究结果凸显了一个关键的安全漏洞:虽然视觉注入通常可以通过模型推理来抵消,但音频通道的防御较少,可能会导致成功的恶意工具调用。这强调了在代理部署中需要强大的输入清理和多模式安全培训。
该研究表明,仅报告攻击完成率低估了代理人工智能系统的实际安全风险。与已完成的攻击 (1%) 相比,尝试攻击的比率较高 (12.8%),这表明当前模型通常可以识别恶意意图,但这种防御在所有模型或方式中并不统一。
基于音频的攻击在受支持的环境中完成率为 49% 的发现尤其令人担忧,因为对于许多代理部署而言,音频是不太常见的输入通道,这意味着它可能受到较少的安全审查。这会产生一个潜在的盲点,攻击者可以通过使用音频输入来操纵代理执行有害的工具调用,从而绕过视觉防御。
模型之间的差异性(一种模型在近 60% 的运行中识别注入,而其他模型在超过 20% 的运行中尝试攻击)凸显出模型选择是代理 AI 安全性的关键因素。组织不能仅仅依赖框架级防护措施,必须考虑底层基础模型的具体安全特征。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下来看什么
部署代理 AI 的开发人员和企业应监控 MMPIBench 和相关安全补丁的更新。为了响应这些发现,业界可能会更加关注音频输入清理以及对工具调用的更严格许可。
监视 MMPIBench 的更新以及可能测试其他感知通道或更复杂的攻击向量的后续研究。基准的可重复性允许持续的社区验证和扩展。
关注主要人工智能框架开发商和基础模型提供商的行业反应,他们可能会发布安全补丁或更新的安全培训,以解决音频和视频渠道中发现的特定漏洞。
观察部署代理人工智能的企业如何调整其安全协议,可能对非文本数据实施更严格的输入过滤,并对工具调用实施更细粒度的权限控制,以减轻研究中强调的风险。