返回新闻
创新AI Understanding 简报

Google 发布开源 EnvHarness 用于自适应 AI 代理训练

Google Cloud AI Research 发布了 EnvHarness,这是一个 Apache 2.0 许可框架,可动态修改静态训练环境以针对特定的 AI 代理弱点,从而提高五个基准测试的性能。

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
归因报告来源记录
出版商
venturebeat.com
来源链接
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
来源类型
新闻媒体的报道——不是第一方文件。

我们无法独立确认的内容: 此声明归因于指定的商店。我们没有根据第一方文件对其进行验证。 (venturebeat.com)

背景60 秒内了解这一点

从这里开始

关键术语

人工智能代理
一种可以观察、推理并采取行动来实现目标的软件系统,通常使用工具和内存。
强化学习
通过奖励信号进行训练,代理学习能够最大化长期回报的行动。
地面真相
用于训练或评估模型输出的可信参考标签。
测试一下自己AI 代理测验

发生了什么

Google云AI研究院与学术合作伙伴发布了Apache 2.0许可下的开源框架EnvHarness。该工具在人工智能代理与其训练环境之间插入了一个可编程层,使环境能够动态适应代理的特定故障。通过使用名为 EnvRigger 的组件来诊断弱点并修改任务条件而不改变底层验证器,该框架使代理能够练习有针对性的技能。在包括 SWE-bench Verified 和 WebArena 在内的五个基准测试中,与静态环境相比,使用 EnvHarness 训练的代理表现出高达 9 个点的性能提升,并减少了完成任务所需的步骤数。

Google云人工智能研究院的研究人员开发了EnvHarness来解决静态训练环境的问题。即使代理不断改进,传统环境仍然固定,因此很难找到具有挑战性的边缘情况。 EnvHarness 引入了一个可编程层,可以更改启动状态、过滤操作和修改任务持续时间,而无需更改核心环境或其验证器。

该框架包括 EnvRigger,它可以自动化适应过程。它遵循观察、诊断、写入和验证循环。 EnvRigger 分析代理轨迹以识别重复出现的故障模式,然后组成特定的 EnvHarness 组件来暴露或纠正这些故障。它会验证这些更改,以确保任务在应用之前仍然可解决且有用。

测试在五个基准上进行:ALFWorld、WebArena、SWE-bench Verified、OfficeQA 和 SpreadsheetBench。使用 EnvHarness 训练的智能体的表现优于在所有五个静态环境中训练的智能体。在 SWE-bench Verified 上,平均轨迹长度从 55.01 步减少到 49.61 步。该框架在准确性和效率方面也优于 SWE-smith 和 GenEnv 等其他环境生成系统。

代码、实验配置和强化学习实现可在 Apache 2.0 许可证下的 GitHub 上获取。该框架需要一个 Bridge 来与现有环境集成,并初步支持基于 Docker 的 SWE-bench、OfficeQA 和 SpreadsheetBench。它专为数字沙箱而设计,在这些沙箱中,部署成本低廉且状态可以恢复,例如编码和 Web 自动化环境。

来源详情: venturebeat.com ↗

为什么这很重要

该版本解决了人工智能代理开发中的一个重大瓶颈:构建静态训练环境的高成本和收益递减。随着代理的改进,固定环境变得过于简单,迫使开发人员创建新的、昂贵的模拟器。 EnvHarness 通过扩大现有可信环境的效用,提供了一种实用的替代方案。对于企业团队来说,这意味着他们可以从当前的基础设施中获取更多的培训价值,而无需从头开始重建模拟器。该框架保留了真实验证者的完整性,同时动态引入挑战,迫使代理克服特定的行为捷径,例如跳过测试或丢失信息。这种方法减少了开发开销,并提供了一条可扩展的路径,用于提高代理在复杂的现实任务中的可靠性。

建立新的培训环境既昂贵又耗时。 EnvHarness 允许团队围绕代理当前的弱点动态重塑现有的高质量环境,从而重用这些环境。这减少了从头开始不断构建新模拟器的需要。

该框架保留了可信验证者的完整性。通过修改代理运行的条件而不是任务本身,EnvHarness 确保成功仍然由原始的、可靠的基本事实决定。这对于维持训练信号的有效性至关重要。

对于企业人工智能团队来说,这种方法提供了一种实用的方法来提高代理性能,而无需对基础设施进行重大更改。它可以作为轻量级插件集成到现有的 CI/CD 管道中,从而允许在受控、安全的环境中持续改进代理。

EnvHarness 的动态特性有助于解决代理走捷径的问题。通过自动创建强制代理练习特定技能的约束(例如在提交代码之前运行测试),该框架鼓励更健壮和可靠的行为。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
交互式概念检查+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

接下来看什么

开发人员应监视 GitHub 存储库以获取支持其他环境类型的新 Bridge 实现。使用容器化 CI/CD 管道的企业应评估 EnvHarness 如何与现有 Docker 或 Kubernetes 设置集成。此外,社区可能会探索将 EnvHarness 与代理端优化框架相结合,以创建反馈循环,使环境挑战和代理能力共同发展。长期影响将取决于随着代理复杂性的增加,EnvRigger 诊断循环的计算成本是否仍然可控。

针对不同环境类型的新桥的可用性将决定该框架的广泛适用性。目前,支持仅限于特定基准,但扩展到其他领域将是其采用的关键。

EnvRigger 循环的计算成本是一种权衡。随着模型的改进,设计和验证修改的成本预计会下降,但团队需要对此进行监控,以确保其对于大规模部署仍然可行。

与代理端优化框架的集成可以创建强大的反馈循环。虽然本文没有一起进行测试,但将 EnvHarness 与修改代理内部线束的系统相结合可能会导致代理功能更全面的改进。

该框架对不同类型环境的适用性将是重点。它最适合具有廉价推出和可恢复状态的数字沙箱。其应用于具有不可逆副作用或昂贵重置的环境将需要仔细考虑和额外的安全措施。

相关指南和测验

人工智能代理人工智能培训什么是人工智能?测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?