发生了什么
OpenAI 发布了其研究组织如何使用编码代理的内部快照。该公司表示,它已经实现了“自动化研究实习生”的既定目标:一个能够在人类指导下执行明确定义的研究任务的系统,包括熟练研究人员可能需要几天时间才能完成的任务。 OpenAI 表示,其目标是在 2028 年 3 月之前成为一名自动化 AI 研究人员。根据该公司的测量,代理的使用在 2026 年期间急剧增加。到 8 月中旬,研究人员每天使用编码代理的中位数按 API 价格计算的推理费用每天超过 600 美元,而 90% 的用户每天超过 7,000 美元。 OpenAI 表示,在整个研究组织中,代理运行时间达到了每个人类工作日的 3.1 标准八小时代理工作日。 OpenAI 还报告称,每个活跃实验者进行的实验更多,越来越多地使用代理来执行更高级别和更长期的任务,并且从 1 月到 7 月,已知结果的任务的成功率普遍提高。然而,超过一半的成功任务估计需要四到八个小时的人工工作,在过去六个月内至少涉及一次人工干预。报告中将这些描述为OpenAI自己的初步测量和内部印象。它并没有证明代理导致了所有观察到的研究成果的增加:该公司表示,可用计算也显着增长,并且计算、任务选择、评估、安全检查和集成到核心训练运行等瓶颈可能会限制整体进展。
OpenAI 表示,其研究人员现在全天使用编码代理,通常是在并发会话中,而且使用量的增长速度比其他 OpenAI 团队更快。该公司报告称,研究人员的中位数从 2026 年初的适度使用转变为 8 月中旬的日常使用。根据 API 价格推断,中位研究人员每天的内部支出估计超过 600 美元,90% 用户每天的内部支出估计超过 7,000 美元。这些不是为自动化研究人员向公众提供的价格。
该公司使用标准的八小时工作日来衡量座席总运行时间与人力的比较。报告称,在 2026 年 6 月之前,代理总运行时间低于人类总劳动时间,但到 8 月中旬,该研究组织将每个人类工作日使用了 3.1 个代理工作日。该测量包括研究人员直接启动的代理和下游子代理。
OpenAI 表示,代理活动扩展到了人工智能研发分类的六个阶段:决策、设计、构建、运行、分析和沟通。研究和基础设施代码仍然是主导类别,而技术帮助和监控运行显着增长。高层规划仍然只占代理输出代币的一小部分。 OpenAI 表示,代理对于内部研究基础设施的故障排除特别有用,同时某些人工运行的技术支持会议的出席率较低。
该报告称,从一月到七月,在几个估计的人类时间段内,编码代理任务的成功率普遍有所增加,但随着任务变得更加复杂,代理仍然需要大量指导。超过一半的成功的四到八小时任务涉及过去六个月的一项或多项干预措施。 OpenAI还表示,在最近的一次基础设施事件后,它暂停了一些最新部署模型的强化学习训练,在更严格的限制下恢复了一些工作负载,并在关键网络能力的初步证据后对Astra级实验施加了额外的限制。据报道,Astra 级 GPU 分配在接下来的一周内下降了 59.2%,而其他型号类别则增长了 17.2%,抵消了约 85% 的降幅。
为什么这很重要
该报告对前沿人工智能实验室如何将人工智能系统融入到开发更强大人工智能的工作中提供了异常具体的观点。如果这种趋势普遍化,编码代理可以将研究人员的时间从日常实施和基础设施故障排除转移到仍然难以自动化的任务上,从而可能缩短部分模型开发周期。但证据是公司生成的、初步的,侧重于选定的运营指标,而不是独立验证的科学质量或模型能力的收益。
该报告很重要,因为人工智能系统正在用于生产未来人工智能系统的过程,而不仅仅是协助日常办公室工作。 OpenAI 的数据表明,代理能力正在成为内部研究操作的一个有意义的部分,并发执行和更高的任务复杂性改变了研究人员分配时间的方式。
实际意义是复杂的。代理可以减少编码、基础设施调试和实验设置造成的延迟,从而使研究人员能够进行更多试验。同时,更快的执行可以使评估、监控和安全审查变得更加重要,因为错误可能会更快地产生和传播。 OpenAI 本身表示,具体指标的进展不一定与整体研究进展的步伐相同。
该报告还将人类控制作为一个核心条件。 OpenAI 表示,人们仍然会设定优先级,判断要追求哪些想法和结果,并决定是否扩展、暂停或部署系统。它承认协调和安全进步可能无法跟上能力进步的步伐,并且能力更强的系统可能会变得更难以监控。
来源中未提供独立研究、公共基准或外部审计。因此,所报告的支出、运行时间、任务成功和干预数据应被视为 OpenAI 对自己组织的声明,而不是作为人工智能研究已加速特定测量量的既定证据。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下来看什么
关键问题是更高的药物使用率是否会转化为研究质量、安全性和模型开发速度方面持久的、可独立测量的改进。关注任务成功、外部验证、有关错误和隐藏人力的证据的更清晰定义,以及剩余的瓶颈是否转向计算、评估、协调或决策。 OpenAI 尚未记录对这些内部工作流程或任何相关价格的公共访问,并且该报告未显示通用自动化研究人员可用。
OpenAI表示其测量方法仍在不断发展。未来的披露应阐明如何对任务进行采样、如何验证成功、如何处理不确定的结果,以及如何将代理生成的代码或实验与人类完成的工作区分开来。
最重要的缺失证据是代理辅助工作是否能产生更好的研究成果,而不仅仅是更多的代码、实验或代币。有用的后续证据包括可重复的例子、错误率、返工、失败的实验、安全发现以及每个阶段所需的人工审查量。
该报告并未指出自动化研究实习生是一款可公开访问的产品。它还没有提供消费者或企业价格、部署要求、资格标准或发布日期。因此,访问和定价是未知的。
OpenAI 表示将继续报告自动化人工智能研究的进展,同时保护安全和专有信息。其未来的披露将显示所报告的加速有多少可以独立评估,以及研究限制如何影响可用计算的分布。