发生了什么
36氪报道称,OpenAI 在 8 月 20 日发布了一篇开发者帖子,将 Codex 描述为一个基于开放代理工具构建的平台。根据该报告,开发人员可以使用 codex exec、SDK 或应用程序服务器将 Codex 功能嵌入到企业控制台、客户服务系统、安全工具和内部应用程序中。该报告将其描述为 Codex 从主要的编程助手转变为可重用的执行基础设施。
36氪报道称,OpenAI 8 月 20 日的开发者帖子将 Codex 作为一个平台,并描述了 Codex App、CLI 和 IDE 扩展下的开源 Codex Harness。该报告称,该工具管理会话状态、上下文、工具调用、沙箱和人工批准。它还表示,开发人员可以通过 codex exec、支持线程、轮次、事件流和批准协议的 SDK 或应用程序服务器将这些功能连接到现有产品。来源中没有提供主要的 OpenAI 文档,因此这些详细信息归属于 36Kr,此处未得到独立确认。
报告称,这些功能是分阶段推出的。它描述了 Codex SDK 的可用性以及 2025 年 10 月 Codex 的全面发布,稍后使用 codex exec 执行脚本和持续集成任务,以及应用程序服务器对长时间运行的会话的支持。它还表示,OpenAI 在 2026 年 1 月发布了对 Codex 代理循环的解释,涵盖了模型如何接收指令、调用工具、读取结果并继续下一步。 36氪的核心解读是,OpenAI现已将这些功能归入Codex Harness名称下,并鼓励开发者围绕它们构建产品。
据36氪了解,OpenAI 在自己的博文中引用了多个应用。报告称,思科在 App Builder 中使用 Codex SDK 进行思科云控制,而 GitHub 和 JetBrains 将 Codex 集成到现有的开发环境中。它还表示,Thrive Holdings 和 Crete 使用 Codex 进行税务准备,一名试点处理了 7,000 份纳税申报表,同时减少了约三分之一的准备时间。这些示例和测量结果由 36Kr 作为 OpenAI 的声明提供;来源不提供相关组织的独立测试、方法或文档。
该报告将 Codex Harness 与 DeepSeek Harness 进行了比较,报告称 DeepSeek 于 8 月 14 日以 DSH 缩写开源。 36氪表示,DSH 将模型、工具、技能、会话、沙箱、存储、代理循环、调度和用户界面视为通过名为 Cordis 的系统进行管理的插件。它将 Codex 描述为一个更加集成的运行时,其非核心组件必须适应其引擎,同时将 DSH 描述为更加模块化。本文还将 Kimi Code 和 ZCode 作为相关但结构不同的代理系统进行讨论,而不是将它们视为同一产品。
为什么这很重要
报告的变化可能会让 OpenAI 在软件层中发挥更大的作用,决定人工智能代理如何使用工具、保留上下文、请求批准和完成多步骤工作。该层可以独立于底层模型影响可靠性、成本、可观察性和用户控制。该报告还将 OpenAI 的举动与更多开放代理运行时竞争,包括 DeepSeek Harness 和其他开源项目。
报告的移动很重要,因为代理运行时控制模型输出和已完成任务之间的操作步骤。据36氪介绍,Codex Harness 可以维护上下文、调用工具、在沙箱中执行工作并通过人工批准来路由操作。对于将代理嵌入内部软件的组织来说,这些功能可以确定代理是否可观察、可中断以及与现有权限兼容。该报告并未证明 Codex Harness 符合任何特定的企业安全或合规标准。
36氪报道称,OpenAI 进行了 ARC-AGI-3 对比,其中 GPT-5.6 Sol 单独得分为 13.3%,结合 Codex Harness 的连续推理和上下文压缩能力得分为 38.3%。文章还称,产出的代币数量下降至原始数量的六分之一左右。这些数字如果被复制,将表明编排和上下文处理可以极大地改变同一模型的性能和成本。然而,来源没有提供测试方案、基线细节、独立复制或有关统计显着性的信息,因此这些数字应被视为报告的公司结果,而不是确定的证据。
文章认为,模型公司有动力拥有或分配其模型的运行时。 36氪表示,运行时可以暴露任务失败的地方、工具调用停滞的地方、重试的频率以及哪些上下文策略消耗更少的令牌。这可以帮助模型开发人员改进其模型和执行系统。消息人士还指出,任何使用任务记录进行培训的行为都将取决于适用的隐私政策;它没有规定 Codex 或 DeepSeek 收集、保留或使用什么内容。
更加开放的运行时还可以改变模型供应商和应用程序开发人员之间的平衡。 36氪表示,DSH 基于插件的架构旨在让开发人员替换模型、工具、存储、沙箱和循环组件,而无需维护整个项目的长期分叉。这种灵活性可能会吸引想要改变提供商或执行策略的团队。同时,文章报道称,DSH 仍处于早期预览阶段,社区反馈引发了对速度、代币消耗、文档、兼容性和插件质量参差不齐的担忧。这些观察结果是反馈报告,而不是系统评估。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下来看什么
最重要的悬而未决的问题是,Codex Harness 是否真正可以在 OpenAI 的模型生态系统之外使用、开发人员可以替换哪些组件、如何处理来自嵌入式工作流程的数据,以及所报告的性能增益在独立测试下是否成立。所提供的报告未确定广泛的可用性、定价、合同条款、隐私惯例或生产可靠性。
首先,请注意 Codex Harness 可以与 OpenAI 首选堆栈之外的模型和工具一起运行的证据。 36氪将 Codex 描述为开放且可嵌入,但提供的报告未指定许可证、确切的可更换组件、支持的型号适配器、部署选项或关键部分是否保持关闭。这些细节将决定开发人员是否获得可移植运行时或紧密耦合的 OpenAI 集成。
其次,独立测试应检查报告的 ARC-AGI-3 改进和代币减少。有用的验证包括确切的模型版本、提示、线束设置、上下文限制、工具配置、故障处理和成本假设。如果没有这些细节,比较就无法显示增益是来自普遍有用的运行时设计还是来自特定的专有设置。
第三,考虑嵌入代理的组织将需要有关数据治理和控制的更清晰的信息。该报告描述了通过共享运行时移动的企业代码、客户数据、内部工具、批准和任务记录。它没有说明这些记录在哪里处理、保留多长时间、管理员是否可以审核或删除它们,或者它们是否可以用于模型改进。这些未知因素对于涉及机密或受监管工作的部署来说非常重要。
最后,跟踪不断增长的代理运行时集合是否成为持久的基础设施市场,或者仍然是一组特定于模型的开发人员工具。 36氪报道称,DeepSeek Harness 吸引了早期开发者的大量关注,Kimi Code 和 ZCode 已经提供了相关的执行能力。生产中的采用将取决于稳定性、回滚机制、权限边界、文档、成本可预测性和独立的安全审查。提供的报告确定了兴趣和产品定位,但没有广泛的企业采用或可靠的优势。