社团指南

数据中毒和后门攻击

数据中毒通过篡改训练数据来破坏模型，而后门攻击隐藏了一个秘密触发器，使模型在命令下行为不当。

概述

数据中毒通过篡改训练数据来破坏模型，而后门攻击隐藏了一个秘密触发器，使模型在命令下行为不当。它们很重要，因为模型越来越多地从攻击者可以悄悄污染的抓取的众包数据中学习。

数据中毒和后门攻击处于能力、权力和公共选择的交叉点——安全、治理和合法性决定先进的人工智能是否会大规模地带来帮助或损害。

深入探讨

中毒攻击分为两个主要目标。可用性攻击旨在通过注入错误标记或损坏的示例来降低整体准确性。有针对性的后门攻击更加隐蔽：该模型在正常输入上表现完美，但每当出现隐藏触发器（例如小像素补丁、特定短语或不可见水印）时，就会产生攻击者选择的输出。 BadNets 的工作展示了一个停车标志分类器，它将标有贴纸的标志读取为“速度限制”。现代系统之所以暴露，是因为它们是在网络规模的数据上进行训练的。研究人员证明，购买一小部分数据集 URL 背后的过期域名可能会花费数百美元来毒害流行的图像数据集。语言模型也可以通过有毒的微调数据或指令示例来设置后门。

技术洞察

干净标签后门尤其危险：中毒的样本保留正确的标签，并且在人类审阅者看来正常，但它们嵌入了模型学习与目标类别关联的触发功能。在推理时，呈现触发器会翻转预测，同时干净的准确性保持较高水平，因此标准验证永远不会捕获它。防御措施包括激活聚类、光谱特征、触发重建和数据来源检查。

掌控数据中毒和后门攻击

为了加深理解，请将数据中毒和后门攻击视为一种操作模型，而不是单个功能。定义期望的结果，澄清假设，并将系统可以可靠地完成的任务与仍需要专家判断的任务分开。

在实践中，使用数据中毒和后门攻击的强大团队将能力增长与治理、安全和明确的问责结构结合起来。他们记录明确的成功标准，根据实际数据和工作流程进行测试，并根据观察到的失败模式而不是一次性基准测试胜利进行迭代。这就是理论理解转变为跨产品、政策和运营的持久能力的地方。

灾难性和日常的人工智能危害都取决于谁了解风险以及谁能够采取行动。与此同时，在能力复合的同时，将存在风险视为科幻小说。最具弹性的方法是将实验速度与治理规则结合起来：运行试点、捕获证据、发布决策日志，并随着模型行为、用户期望和监管要求的发展不断更新保障措施。

战略影响

灾难性和日常的人工智能危害都取决于谁了解风险以及谁能够采取行动。

灾难性和日常的人工智能危害都取决于谁了解风险以及谁能够采取行动。在高质量部署中，这会转化为可衡量的操作规则、所有权边界和定期审查仪式，以便团队可以增强信心，而不是扩大模糊性。

公众和专业素养决定强有力的安全政策在政治上是否可行。

公众和专业素养决定强有力的安全政策在政治上是否可行。在高质量部署中，这会转化为可衡量的操作规则、所有权边界和定期审查仪式，以便团队可以增强信心，而不是扩大模糊性。

清晰的解释可以减少炒作、实验室公关和模糊道德剧场的影响。

清晰的解释可以减少炒作、实验室公关和模糊道德剧场的影响。在高质量部署中，这会转化为可衡量的操作规则、所有权边界和定期审查仪式，以便团队可以增强信心，而不是扩大模糊性。

数据中毒和后门攻击的未来

由于供应链依赖于抓取的数据、预先训练的权重和第三方微调，中毒正在从理论转变为真正的供应链威胁。期望数据集签名和出处标准、经过认证的稳健性训练（限制固定数量中毒点的损害）以及部署前对模型的连续后门扫描。监管机构和 MITRE ATLAS 等安全框架开始将中毒视为一流的机器学习风险。

现实世界的实施

当存在小贴纸触发器时，自动驾驶汽车将停车标志误认为限速标志的视觉模型

通过劫持托管部分图像 URL 的过期域，以低廉的成本毒害公共图像数据集

对代码完成模型进行后门处理，隐藏提示短语使其插入不安全的代码

破坏垃圾邮件过滤器的众包培训反馈，使特定的恶意电子邮件漏网

实施模式

实践中的数据中毒和后门攻击

当存在小贴纸触发器时，自动驾驶汽车将停车标志误认为限速标志的视觉模型。

当团队预先定义质量阈值、为边缘情况保留人工升级路径并跟踪一段时间内的生产力提升和错误成本时，通常会获得更好的结果。

实践中的数据中毒和后门攻击

通过劫持托管部分图像 URL 的过期域，以低廉的成本毒害公共图像数据集。

当团队预先定义质量阈值、为边缘情况保留人工升级路径并跟踪一段时间内的生产力提升和错误成本时，通常会获得更好的结果。

实践中的数据中毒和后门攻击

对代码完成模型进行后门处理，隐藏提示短语使其插入不安全的代码。

当团队预先定义质量阈值、为边缘情况保留人工升级路径并跟踪一段时间内的生产力提升和错误成本时，通常会获得更好的结果。

实践中的数据中毒和后门攻击

破坏垃圾邮件过滤器的众包培训反馈，使特定的恶意电子邮件漏网。

当团队预先定义质量阈值、为边缘情况保留人工升级路径并跟踪一段时间内的生产力提升和错误成本时，通常会获得更好的结果。

风险与防护栏

将存在风险视为科幻小说，同时能力复合。

混淆了表面产品安全与高度自治下的对准。

只给非英语和非专业观众留下低质量的资源。

实施路线图

单独的产品危害、误用和失控/失调风险。

将此视为证据门：如果不满足标准，则暂停推出，缩小差距，然后再扩大使用。

询问哪些证据会改变您对时间表和严重性的看法。

将此视为证据门：如果不满足标准，则暂停推出，缩小差距，然后再扩大使用。

比起营销主张，更喜欢主要来源和具体评估。

将此视为证据门：如果不满足标准，则暂停推出，缩小差距，然后再扩大使用。

确定一条行动路径：职业、政策、资金或技能——而不仅仅是意识。

将此视为证据门：如果不满足标准，则暂停推出，缩小差距，然后再扩大使用。

Check your understanding

Test yourself: take the Data Poisoning and Backdoor Attacks quiz

Start quiz →

数据中毒和后门攻击

概述

深入探讨

技术洞察

掌控数据中毒和后门攻击

战略影响

数据中毒和后门攻击的未来

现实世界的实施

实施模式

实践中的数据中毒和后门攻击

实践中的数据中毒和后门攻击

实践中的数据中毒和后门攻击

实践中的数据中毒和后门攻击

风险与防护栏

实施路线图

不断探索

人工智能安全

人工智能对齐

通用人工智能

人工智能治理

Related guides