发生了什么
《福布斯》报道称,自主人工智能系统正在被用来在有限或无需人工干预的情况下执行扩展的企业任务。本文重点介绍了用于遗留代码现代化的 Blitzy、用于持续渗透测试的 XBOW 以及 Google 和 OpenAI 的相关系统。
《福布斯》报道称,自主人工智能被定位为超越副驾驶和短暂代理的一步。在文章的框架中,副驾驶在一个人工作时提供协助,传统代理只需几分钟即可处理任务并返回结果以供审查,而更自主的系统会收到一个目标并工作数天或数周,然后返回已完成的工作。 《福布斯》将这种区别部分归因于 Sanjot Malhi,他是 Northzone 全球增长基金的负责人,并表示他花了近两年的时间围绕该技术撰写了一篇投资论文。报告称,Northzone 自 1 月份以来一直支持 Blitzy 和 XBOW,其中 Blitzy 已筹集 2 亿美元,据报道估值为 14 亿美元,XBOW 已筹集 1.2 亿美元。这些财务数据和系统的特征由《福布斯》报道,此处未得到独立证实。
《福布斯》报道称,Blitzy 将这种方法应用于企业软件现代化。该公司被描述为吸收数亿行遗留代码和客户的合规策略,然后使用既定目标构建新系统。 《福布斯》将道富银行旗下的 Charles River Development 列为使用该平台对旧代码进行现代化改造的客户,并表示 Builders FirstSource 在使用该平台的前三个月内将其软件开发速度提高了两倍。文章还称,OpenAI 在有关 GPT-5.6 编码能力的材料中引用了 Blitzy。福布斯将这些客户成果作为实际使用的证据,但提供的报告没有提供独立审计、详细基线、样本量、错误率或对这些项目中剩余多少人工审查的解释。
《福布斯》报道称,XBOW 将自主人工智能应用于进攻性网络安全。其平台被描述为持续对公司的系统进行渗透测试,而不是仅依赖于稀缺的人类专家的定期审查。文章称,XBOW 于 2025 年夏季登上了 HackerOne 美国排行榜的榜首,《福布斯》称这是第一次非人类黑客领先。 《福布斯》还引用了 Moderna 副首席信息安全官 Farzan Karimi 的话,据报道,他表示 XBOW 发现了他错过的防火墙旁路。该报告进一步称,XBOW 在 Glasswing 项目期间获得了对 Anthropic 的 Mythos 模型的早期访问权,并且 Anthropic 引用了该公司的测试。这些说法归因于《福布斯》以及通过《福布斯》指定的组织或高管;没有提供独立的测试数据。
福布斯将这些公司归入更广泛的自主安全和编码系统组。文章称,Horizon3 以超过 20 亿美元的估值筹集了 2.5 亿美元的 E 轮融资,DeepMind 和 Project Zero 开发的 Big Sleep 自主发现了广泛使用的开源软件中的 20 个漏洞。它还表示,OpenAI 在基准测试中检测到 92% 的已知缺陷后,将安全研究系统 Aardvark 合并到 Codex 中。该报告将这些发展描述为人工智能系统正在朝着持续实现企业目标的方向发展的迹象。然而,福布斯并没有提供底层基准协议、漏洞披露、误报率、补救结果或证据,证明系统在每种情况下都在没有有意义的人为干预的情况下运行。
为什么这很重要
如果经过独立验证,这些系统可以将人工智能从短期的、受监督的任务转向长期运行的工作,从而改变公司处理软件开发和网络安全的方式。该报告还强调了有关监督、可审计性、准确性、成本和问责制等尚未解决的问题。
福布斯的核心主张很重要,因为软件开发和网络安全都是未完成的工作可能造成直接运营后果的领域。一个可以处理大型遗留代码库、解释合规性约束并生成可用的现代化项目的系统可以减少传统上依赖系统集成商和长期合同的工作所需的时间。报告的 Builders FirstSource 结果如果经过独立验证,将表明开发吞吐量发生了重大变化。实际问题不是人工智能是否可以生成代码,而是它是否能够在长期任务中始终如一地交付安全、可维护和合规的系统。
安全示例指出了类似的重大转变。持续的自动化测试可以扩大检查的软件数量并减少对定期评估的依赖。发现人工审核人员遗漏的漏洞可能很有价值,特别是如果发现的结果是可重复的并导致有效的修复。与此同时,如果自主渗透测试的权限、目标或操作控制不善,就会产生风险。福布斯的账户没有确定这些系统如何隔离、客户如何批准测试边界、如何验证结果,或者组织如何防止自动化工具破坏生产系统。
该报告还说明了投资热情与公开表现之间的差异。 《福布斯》将 Northzone 的 Malhi 描述为将 Blitzy 和 XBOW 视为“企业大脑”的早期版本,它保留组织的背景,同时模型提供功能。这是一个投资论文,而不是一个独立建立的技术类别。文章提到毕马威和 Gartner 对公司减少或停用某些人工智能代理部署的期望,但这些只是预测,而不是有关当前结果的证据。最有意义的公共影响将取决于自主系统是否能够向不同的客户展示可靠的结果、透明的记录和明确的责任,而不是选定的成功故事。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下来看什么
关键测试是对已完成工作、安全结果、错误率、成本和人工监督的独立评估。观察公司是否能够记录系统的行为,并在自主工具出错时可靠地分配责任。
首先,注意性能声明背后的独立证据。对于 Blitzy 来说,这将包括评估项目的详细信息、“三倍”开发速度的定义、缺陷和安全率、人工审查的数量以及最终的系统在部署后是否仍然可维护。客户证言可以证明系统已被使用,但它本身并不能证明总体可靠性。 《福布斯》报道了客户的说法,但所提供的材料并未独立验证这些说法。
对于 XBOW 和相关安全系统,有用的后续措施包括已披露的漏洞、可重复性、误报率和漏报率、授权测试的范围以及发现和修复之间的时间。 OpenAI 的 Aardvark 报告的 92% 基准测试结果还需要有关基准测试设计、“已知缺陷”的含义以及系统如何与人类或自动基准进行比较的背景信息。如果没有这些详细信息,排行榜排名和基准百分比不应被视为现实世界安全性能的一般衡量标准。
最后,采用这些工具的组织将需要与其自主权相匹配的治理。福布斯本身也报告了对治理差距的担忧,并建议在公司将目标委托给自治系统之前进行审计跟踪和明确的问责制。观察部署是否保留对高影响力操作的人工批准、记录模型和工具活动、限制对敏感系统的访问,并在工作失败时提供负责任的操作员。这篇文章对自主人工智能和通用人工智能的长期预测仍然不确定;近期证据应来自记录的部署、可重复的评估和可公开解释的结果。