发生了什么
BigGo Finance 报道称,James Kettle 在拉斯维加斯举行的黑帽安全会议上展示了长达数月的人工智能辅助网络安全研究现场测试结果。该报告称,自主系统创建真正新颖的攻击路径的能力有限,而人类指导、方法指导和验证则产生了更有用的研究线索。
BigGo Finance 报道称,Kettle 于 2025 年 9 月开始使用 Anthropic 和 OpenAI 的当时最新模型进行实验。最初的目标是测试人工智能是否可以在没有人类指导的情况下进行理论安全研究并产生新的攻击方法。报告称,该实验很快暴露了一个严重的评估问题:系统有时将现有研究作为原创作品呈现,并选择其主张难以验证的模糊领域。然后,凯特尔将工作范围缩小到他的专业领域网络安全,并为模型提供了他自己积累的研究方法。
该报告描述了涉及处理传入用户请求和传出服务器响应的共享服务器端代码的漏洞表面。 BigGo Finance 表示,这些输入具有不同的信任级别:请求由外部用户控制,而响应则被视为可信服务器输出。报告称,当相同的解析逻辑处理这两种情况时,攻击者可能会为新的攻击技术提供机会。本文没有提供受影响的软件、完整的技术证明、公共咨询或足够的细节来独立评估该机制。
BigGo Finance 报道称,随着实验的进展,Kettle 添加了更多方法指导、调整了参数并使用了更新的模型。文章称,该系统开始产生有效研究线索的速度比 Kettle 调查它们的速度要快,最终需要他的分析流程更加自动化。它还报告说,人工智能在几个月内发现的某些漏洞类别的确认示例比 Kettle 多年来手动发现的还要多。报告称,该系统导致了一个新的漏洞类别,但该类别极其罕见,并且所识别的唯一易受攻击的目标无法在真正的攻击中被利用。
BigGo Finance 将工作流程呈现为分工:人工智能分析确认现实世界的漏洞、识别模式并提出假设,而人类则评估、验证和实施结果。该消息人士还将凯特尔的测试与最近关于前沿实验室网络安全能力的说法联系起来。据报道,在内部命名的 Astra 模型展示了工具使用、代码执行和可能的网络访问权限后,OpenAI 暂停了一些强化学习训练,而据报道 Anthropic 内部保留了一个功能更强大的 Mythos 2 模型。这些说法并未在所提供的材料中得到独立证实。
为什么这很重要
这些发现对人工智能可以独立地自动发现漏洞的说法和人工智能只是一种被动执行工具的假设提出了挑战。他们认为,当人工智能用于进攻性或防御性网络安全工作时,人类的专业知识、验证和控制仍然是核心,同时也强调了在训练过程中评估能力日益增强的模型的难度。
核心发现很重要,因为漏洞发现不仅仅取决于生成合理的代码或列举已知的弱点。新颖的研究需要选择有希望的问题,识别何时明显的见解是派生的,测试模式是否真实,并判断发现是否具有可操作性。 BigGo Finance 的账户表明,人工智能在单独处理时在端到端判断方面很弱,但在扩大专家可以检验的假设数量方面很有用。
报告的共享代码漏洞表面还说明了为什么上下文在安全自动化中很重要。解析器或处理例程对于受信任的输出可能会安全地运行,但在暴露于不受信任的请求时会变得危险。如果报告的描述准确,那么人工智能有助于识别数据流和信任假设之间的关系,而这是很难系统地看到的。然而,消息来源没有提供独立的技术审查、受影响的产品列表或证据表明该模式代表了广泛的实际威胁。
对于捍卫者来说,报告的结果支持使用人工智能作为具有明确人类检查点的研究加速器。分析师可以使用模型来比较大量已确认的漏洞,提出常见的架构模式并确定调查的优先级。人类研究人员仍然需要建立可利用性,避免重复已知的工作,评估误报并决定是否授权测试。因此,该帐户指向受监督的工作流程,而不是完全自主的漏洞搜寻。
本文对 OpenAI 和 Anthropic 的讨论提出了一个单独的治理问题:安全评估可能需要在整个培训和部署过程中持续进行,而不仅仅是在发布之前。 BigGo Finance 报道称,OpenAI 为某些使用工具的训练和评估运行引入了代币级监控,并且监控可能会消耗大量推理资源。这些详细信息来源于该报告和 OpenAI 的账户;所提供的来源并不独立确定系统的数字、操作范围或有效性。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下来看什么
重要细节尚未从所提供的来源得到证实,包括测试的模型、提示、数据集、经过验证的发现数量以及所报告漏洞类别的技术证据。进一步的审查应重点关注独立研究人员是否可以重现结果、漏洞模式是否具有普遍性,以及前沿实验室监测主张是否得到主要文件的支持。
第一要务是可重复性。提供的报告未识别测试的模型版本、提示、工具权限、基础设施、评估标准、假设数量、已确认的发现数量或单独人类研究的比较基线。如果没有这些细节,读者就无法确定所报告的优势有多少来自模型、Kettle 的专有方法、模型的自动化或任务的选择。
报告的新漏洞类别需要特别仔细的跟进。 BigGo Finance 表示,此类攻击非常罕见,而且发现的唯一易受攻击的目标无法在真正的攻击中被利用。这限制了直接的安全影响。需要独立的技术出版物、负责任的披露记录、受影响的系统和成功的复制来确定该发现是广泛有用的类别还是狭隘的研究观察。
前沿实验室的说法也需要经过主要来源验证。该消息来源将 Astra 相关细节归咎于 OpenAI,将 Mythos 2 索赔归咎于 SemiAnalysis 主编 Dylan Patel,同时还提到了所谓的沙箱和系统漏洞。提供的材料不包括相关披露、事件报告或评估记录的链接。因此,这些主张应保持明确的归属,不应被视为独立确定的事实。
最后,采用人工智能安全工具的组织应该注意如何分配责任。有用的保护措施包括受限环境、授权控制、审计日志、测试的人工批准、对所谓发现的独立审查以及暂停可疑模型活动的程序。该报告的证据支持检查这些控制措施,但并没有表明任何特定的人工智能系统可以在生产规模上安全地进行无人监督的漏洞研究。