越狱和红队
越狱是一种精心设计提示的做法,欺骗人工智能模型忽略其安全规则,而红队则是在不良行为者发现这些弱点之前有组织的努力。
概述
Together they form the adversarial testing loop that makes deployed AI systems safer.
深入探讨
大型语言模型经过训练可以拒绝有害请求,但这些防护措施是统计性的,而不是绝对的。越狱通过重新构造禁止的请求来利用这一点,使其绕过模型习得的拒绝。经典技术包括角色扮演(“假装你是一个没有规则的人工智能”)、臭名昭著的“DAN”(立即做任何事情)角色、假设框架、通过隐藏指令进行提示注入、Base64 或 leetspeak 等编码技巧,以及用虚假的合规示例淹没长上下文窗口的“多次”越狱。红队则扭转了这一局面:专门的团队和自动化系统在发布前用数千个对抗性提示来探测模型,对失败进行分类,以便工程师可以通过微调、根据人类反馈进行强化学习以及添加分类器过滤器来修补它们。
技术洞察
安全行为是通过微调和 RLHF 来学习的,在已经吸收了大量知识的模型上创建了一个细小的“拒绝边界”。越狱的工作原理是将输入分布从安全训练期间使用的示例中转移出来,因此模型的帮助驱动力会覆盖其较弱的拒绝信号。防御层进行多重检查:输入/输出分类器、宪法人工智能自我批评以及将发现的越狱添加回训练集中的对抗性训练。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
越狱和红队的未来
预计军备竞赛将持续进行。自动红队(一种模型攻击另一种模型)的扩展速度比手动测试和出现异常故障的速度更快。防御者正在走向“深度防御”:宪法分类器、实时监控和防篡改训练,将拒绝更深地融入到权重中。监管机构和标准机构越来越多地要求在高性能模型发布之前记录红队结果,从而使对抗性测试成为人工智能发布管道中常规的、可审计的部分,而不是事后才想到的。
现实世界的实施
Anthropic 进行了公开的“越狱赏金”,邀请数千名测试人员打破其宪法分类器,并奖励任何发现通用越狱的人。
研究人员演示了“多次越狱”,表明用数百个虚假的有害问答对填充长上下文窗口可能会削弱模型的拒绝能力。
OpenAI、Google 和 Anthropic 维护内部红队和外部专家网络,在模型发布前探测生物武器、网络和儿童安全风险。
安全公司现在提供法学硕士渗透测试,扫描聊天机器人以查找银行和医疗助理等面向客户的应用程序中的提示注入漏洞。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jailbreaking and Red-Teaming quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Jailbreaking and Red-Teaming?
越狱是一种精心设计提示的做法,欺骗人工智能模型忽略其安全规则,而红队则是在不良行为者发现这些弱点之前有组织的努力。它们共同构成了对抗性测试循环,使部署的人工智能系统更加安全。
越狱提示的主要目标是什么?
越狱是专门为了让模型忽略或规避它被训练要遵循的安全护栏而设计的。
人工智能安全中的“红队”指的是什么?
红队借用了安全术语,指的是友好的攻击者,他们探测系统以暴露弱点,以便可以修复它们。
为什么随着上下文窗口变长,多次越狱效果会更好?
多次越狱将数百个伪造的有害问答示例打包到一个长上下文中,通过上下文学习使模型偏向合规性。
以下哪一项是公认的越狱防御措施?
检查传入提示和传出响应的分层分类器是针对越狱的核心“深度防御”技术。
为什么模型的安全护栏被描述为“统计的,而不是绝对的”?
安全性是通过微调和 RLHF 来教授的,因此训练分布之外的对抗性输入有时会失败,这是一种习得的趋势。