返回新闻
安全AI Understanding 简报

OpenAI 向批准的防御者开放 GPT-5.6-Cyber

OpenAI 的新受控访问网络模型满足了更高级的漏洞利用研究请求,并帮助找到了已修补的 Chrome 缺陷,但大多数证据来自内部评估。

5 min readRead the primary source
主要来源文件来源记录
出版商
OpenAI's GPT-5.6-Cyber and Daybreak announcement
来源链接
openai.comhttps://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows/
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

评估集
用于测量训练后模型质量的保留数据集。
安全案例
有证据支持的结构化论证,表明人工智能系统对于定义的使用环境是安全的。
基准测试
用于测量和比较模型性能的标准化测试或数据集。
测试一下自己人工智能安全测验

发生了什么

OpenAI 于 8 月 10 日扩展了其 Daybreak 计划,为防御工作和高级安全研究提供了单独的访问层,包括专门的 GPT-5.6-Cyber​​ 模型。

Daybreak Blue 为经过批准的防御者 GPT-5.6 Sol 提供了删除系统级网络过滤器的功能,用于安全代码审查、恶意软件分析、事件响应、漏洞发现和补丁验证等工作。 Daybreak Red 添加了 GPT-5.6-Cyber​​,用于授权漏洞验证、渗透测试和通用模型可能仍会拒绝的其他双重用途研究。

OpenAI 表示,GPT-5.6-Cyber​​ 在其内部高级网络安全完成率评估中完成了 95% 的请求,而标准 GPT-5.6 Sol 为 1.5%,Sol 通过 Daybreak Blue 为 2%,GPT-5.5-Cyber​​ 为 57.3%。该公司表示,测试涵盖了漏洞利用链开发、身份验证绕过和权限升级等场景;目前尚未发布评估集。

该公司还报告称,使用该模型可以帮助发现两个以前未知的可能链接在一起的 V8 漏洞。 Google 分配了第一个 CVE-2026-15903 并在 Chrome 150 中对其进行了修补。Google 的发布公告独立确认了该高严重性缺陷允许在 V8 中进行越界读写,尽管它没有评估帮助发现该缺陷的 AI 系统。

OpenAI 将 GPT-5.6-Cyber​​ 描述为基于 GPT-5.6 Sol 构建的模型,并针对选定的高风险、双重用途任务而不是无限制的进攻性用途进行训练。 Daybreak Red 仅适用于经批准从事授权工作的个人和组织,具有身份验证、帐户安全、监控、批准使用限制和法律证明。该公告还表示,从 2026 年 9 月 1 日开始,个人 Daybreak 账户将需要硬件安全密钥。

来源详情: OpenAI's GPT-5.6-Cyber and Daybreak announcement ↗

为什么这很重要

该版本将前沿模型更危险的网络功能从小型研究环境转移到受管理的访问程序中,测试防御者是否可以在相同的技术传播给攻击者之前接收它们。

减少拒绝是该产品的核心:拒绝实际利用工作的模型对于一般用途来说可能更安全,但对于必须重现漏洞才能确定优先级并修复漏洞的团队来说不太有用。 Daybreak 将更广泛的防御任务与更高风险的漏洞利用开发分开,而不是将一项策略暴露给每个用户。

V8 的披露是人工智能辅助漏洞研究可以触及已部署软件的具体证据。它也比自主防御的主张范围更窄:OpenAI 表示,其研究人员验证了研究结果,并与 Google 协调披露,而公开的 Chrome 咨询记录了已修补的缺陷,而不是模型在整个研究过程中的作用。

OpenAI 还通过安全咨询和技术提供商扩展 Daybreak。获得批准的合作伙伴可以访问底层模型,并将其应用到客户参与中,并进行包括身份验证、定义范围、日志记录、监控和人工审核在内的控制。

合作伙伴的设计改变了谁必须提供最后一英里的判断。 OpenAI 表示对底层模型的访问不会直接转移给客户;合作伙伴定义参与、审查结果并在采取行动之前应用其自己的安全专业知识。因此,在实践中,有用的部署取决于合作伙伴将可重现的缺陷与推测模型建议分开的能力,将测试保持在商定的范围内,并通过真正的软件维护流程移动已确认的修复。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Security Quiz

What is an adversarial example in machine learning security?

接下来看什么

留意承诺的系统卡、独立的基准测试复制、其他报告的漏洞的完整披露,以及访问控制可抵御滥用的证据。

公告中的大部分性能数据来自 OpenAI 内部实施的高级网络安全完成率、ExploitGym、ExploitBench 和漏洞报告评估。该公司表示,GPT-5.6-Cyber​​ 并未赢得所有比较:GPT-5.6 Sol 在一次评估中生成了更好的报告,并更有效地解决了标准 300 转 ExploitBench 设置。

对于其准备框架下的网络安全能力,OpenAI 对 GPT-5.6-Cyber​​ 的评级为“高”,但低于“严重”。据说稍后会推出更完整的系统卡。在方法和结果足够详细地发布以进行重现之前,该公告支持归因于公司的主张,而不是对现实世界攻击能力的独立衡量标准。

安全情况取决于操作和培训。从 9 月 1 日开始,个人 Daybreak 帐户必须采用硬件安全密钥,OpenAI 建议隔离环境、范围权限、受监控的代理操作和人工监督。有用的后续报告应显示访问撤销、检测到的滥用、披露时间表、补丁结果以及随着计划扩展而出现的误报。

总体完成率比较也有一个重要的衡量警告。 OpenAI 表示每个模型都在最高的公开推理级别上运行,并指出 GPT-5.6-Cyber​​ 倾向于使用比 GPT-5.6 Sol 更大的推理预算和更多的代币。因此,较高的完成率可能反映了专门的培训和不同的计算量。独立测试应报告匹配的预算、任务构建、拒绝标准以及不安全或不可用答案的比率,而不仅仅是是否产生响应。

一个成熟的程序帐户需要跟踪整个漏洞生命周期。这意味着报告模型生成的线索在人类繁殖中存活的频率、有多少结果是重复的或低严重性的、供应商收到可操作报告的速度以及是否在公开披露之前部署了补丁。它还应该解释当合作伙伴的客户要求模型跨越测试边界时,当代理遇到生产凭据时,或者当提议的漏洞太危险而无法直接验证时,会发生什么情况。这些控制措施决定了较低的拒绝率是否会创造可衡量的防御价值,而不仅仅是扩大两用代码的供应。

公众还应该能够区分模型的能力和客户的授权。 OpenAI 的访问规则围绕模型放置了法律证明、身份检查、监控和范围工作,但这些控制措施声称要随着时间的推移进行测试。事件报告应说明请求是否被阻止、升级以供审查或在记录的参与下被允许,而不会暴露使未修补的系统更容易受到攻击的漏洞利用详细信息。

相关指南和测验

人工智能安全网络安全运营中的人工智能人工智能安全测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注AI监管追踪器
觉得这有用吗?