数据中毒和后门攻击
数据中毒通过篡改训练数据来破坏模型,而后门攻击隐藏了一个秘密触发器,使模型在命令下行为不当。
概述
They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.
深入探讨
中毒攻击分为两个主要目标。可用性攻击旨在通过注入错误标记或损坏的示例来降低整体准确性。有针对性的后门攻击更加隐蔽:该模型在正常输入上表现完美,但每当出现隐藏触发器(例如小像素补丁、特定短语或不可见水印)时,就会产生攻击者选择的输出。 BadNets 的工作展示了一个停车标志分类器,它将标有贴纸的标志读取为“速度限制”。现代系统之所以暴露,是因为它们是在网络规模的数据上进行训练的。研究人员证明,购买一小部分数据集 URL 背后的过期域名可能会花费数百美元来毒害流行的图像数据集。语言模型也可以通过有毒的微调数据或指令示例来设置后门。
技术洞察
干净标签后门尤其危险:中毒的样本保留正确的标签,并且在人类审阅者看来正常,但它们嵌入了模型学习与目标类别关联的触发功能。在推理时,呈现触发器会翻转预测,同时干净的准确性保持较高水平,因此标准验证永远不会捕获它。防御措施包括激活聚类、光谱特征、触发重建和数据来源检查。
战略影响
风险与安全
灾难性和日常的人工智能危害都取决于谁了解风险以及谁能够采取行动。
更清晰的判决
公众和专业素养决定强有力的安全政策在政治上是否可行。
打破炒作
清晰的解释可以减少炒作、实验室公关和模糊道德剧场的影响。
数据中毒和后门攻击的未来
由于供应链依赖于抓取的数据、预先训练的权重和第三方微调,中毒正在从理论转变为真正的供应链威胁。期望数据集签名和出处标准、经过认证的稳健性训练(限制固定数量中毒点的损害)以及部署前对模型的连续后门扫描。监管机构和 MITRE ATLAS 等安全框架开始将中毒视为一流的机器学习风险。
现实世界的实施
当存在小贴纸触发器时,自动驾驶汽车将停车标志误认为限速标志的视觉模型
通过劫持托管部分图像 URL 的过期域,以低廉的成本毒害公共图像数据集
对代码完成模型进行后门处理,隐藏提示短语使其插入不安全的代码
破坏垃圾邮件过滤器的众包培训反馈,使特定的恶意电子邮件漏网
风险与防护栏
将存在风险视为科幻小说,同时能力复合。
混淆了表面产品安全与高度自治下的对准。
只给非英语和非专业观众留下低质量的资源。
实施路线图
单独的产品危害、误用和失控/失调风险。
询问哪些证据会改变您对时间表和严重性的看法。
比起营销主张,更喜欢主要来源和具体评估。
确定一条行动路径:职业、政策、资金或技能——而不仅仅是意识。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Poisoning and Backdoor Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Data Poisoning and Backdoor Attacks?
数据中毒通过篡改训练数据来破坏模型,而后门攻击隐藏了一个秘密触发器,使模型在命令下行为不当。它们很重要,因为模型越来越多地从攻击者可以悄悄污染的抓取的众包数据中学习。
后门攻击与一般可用性中毒攻击有何区别?
后门模型通常对干净的输入起作用,并且仅当隐藏的触发器出现时才产生攻击者的目标输出。
为什么清洁标签后门攻击难以检测?
由于中毒示例具有正确的标签并且看起来很普通,因此人工审查和标准验证准确性不会标记它们。
BadNets 研究著名地证明了什么?
BadNets 展示了一个带有后门的交通标志分类器,它会误读标有小贴纸的停车标志。
研究人员如何证明网络规模的数据集可以廉价地中毒?
由于数据集通过 URL 引用图像,因此购买失效的域名可以让攻击者以较低的成本控制这些图像。
其中哪一项是公认的后门攻击防御措施?
除其他检测方法外,防御还分析内部激活,以将中毒样本与干净样本区分开。