模型提取和窃取攻击
模型提取攻击让攻击者只需查询其公共 API 并根据答案训练模仿者即可克隆专有的 AI 模型。
概述
这很重要,因为公司花费数百万次训练模型,而这些模型只需几千次API调用就能近似完成。
深入探讨
模型提取(或模型窃取)攻击将已部署的模型视为预言机。攻击者发送输入、记录输出并训练替代模型来模仿该行为。由于目标模型本身是将输入映射到输出的学习函数,因此复制足够多的输入输出对可以重建近似值,而无需查看原始权重或训练数据。研究人员窃取了图像分类器的决策边界,甚至恢复了小层的精确权重。 2024 年,一个团队展示了 OpenAI 和 Google 生产模型嵌入层的部分内容可以以不到几百美元的价格提取。被盗的副本会削弱付费服务,绕过安全过滤器,并引发进一步的白盒攻击,例如制作对抗性示例。
技术洞察
API 响应越丰富,盗窃的成本就越低。返回完整的概率向量或 logits 每个查询会比单个 top-1 标签泄漏更多的信息,因此攻击者可以用更少的查询来重建边界。主动学习策略在决策边界附近选择信息最丰富的查询。一个具有里程碑意义的结果表明,查询输出维度计数可以通过线性代数准确地恢复最终的线性投影层,因为该层实际上是响应跨度的矩阵。
战略影响
风险与安全
灾难性和日常的人工智能危害都取决于谁了解风险以及谁能够采取行动。
更清晰的判决
公众和专业素养决定强有力的安全政策在政治上是否可行。
打破炒作
清晰的解释可以减少炒作、实验室公关和模糊道德剧场的影响。
模型提取和窃取攻击的未来
防御措施正在从阻止转向检测和降级:速率限制、返回舍入或仅限前 1 的输出、添加校准噪声、为模型行为添加水印以便对被盗副本进行指纹识别,以及监控提取签名的查询模式。预计将提取视为盗窃的监管和许可条款,以及对可证明难以提取的架构的积极研究。随着模型变得越来越大,完全提取的成本仍然很高,但部分提取有价值的成分和蒸馏式克隆仍将是持续的商业和安全威胁。
现实世界的实施
一家初创公司查询竞争对手的付费图像识别 API 数千次,并训练一个免费克隆来复制其准确性。
安全研究人员使用精心设计的 API 查询提取生产语言模型的最终嵌入投影层,成本仅为几百美元。
攻击者在本地克隆垃圾邮件或欺诈分类器,以便他们可以离线探测它并制作可靠地逃避检测的输入。
云供应商添加了查询率监控,标记其访问模式与主动学习提取匹配的帐户并限制其响应。
风险与防护栏
将存在风险视为科幻小说,同时能力复合。
混淆了表面产品安全与高度自治下的对准。
只给非英语和非专业观众留下低质量的资源。
实施路线图
单独的产品危害、误用和失控/失调风险。
询问哪些证据会改变您对时间表和严重性的看法。
比起营销主张,更喜欢主要来源和具体评估。
确定一条行动路径:职业、政策、资金或技能——而不仅仅是意识。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是模型提取与窃取攻击?
模型提取攻击让攻击者只需查询其公共 API 并根据答案训练模仿者即可克隆专有的 AI 模型。这很重要,因为公司花费了数百万美元训练模型,而这些模型的价格大约相当于几千次 API 调用的价格。
模型提取攻击背后的核心思想是什么?
提取将部署的模型视为预言机:攻击者收集输入输出对并训练模仿模型来模仿行为,而无需访问原始权重。
为什么返回完整概率向量比仅返回 top-1 标签更容易提取?
每个完整的概率向量比单个标签揭示更多有关模型内部决策表面的信息,让攻击者可以用更少的查询重建边界。
哪种防御技术可以直接减少每次查询泄露的信息?
粗化输出,例如仅返回顶部标签或舍入概率,会减少每个响应向攻击者提供的信号,从而提高提取成本。
2024 年的结果表明,攻击者可以准确地以低廉的成本恢复生产语言模型的哪一部分?
研究人员证明,最终的线性投影层只需几百美元即可恢复,因为它的响应跨越可恢复的矩阵。
为什么被盗的替代模型除了收入损失之外还有其他危险?
一旦攻击者拥有本地副本,他们就可以自由探测它以设计对抗性输入或规避攻击,从而欺骗原始部署的系统。