Вернуться к новостям
ИнновацииAI Understanding брифинг

Google выпускает EnvHarness с открытым исходным кодом для адаптивного обучения агентов ИИ

Google Cloud AI Research выпустила EnvHarness, лицензированную среду Apache 2.0, которая динамически изменяет статические среды обучения для устранения конкретных слабых мест агентов ИИ, улучшая производительность по пяти тестам.

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
Атрибутированная отчетностьИсточник записан
Издатель
venturebeat.com
Ссылка на источник
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
Тип источника
Репортаж новостного агентства — не первичный документ.

Что мы не смогли подтвердить независимо: Претензия принадлежит указанному торговому центру. Мы не сверяли его с собственным документом. (venturebeat.com)

КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

ИИ-агент
Программная система, которая может наблюдать, рассуждать и предпринимать действия для достижения цели, часто используя инструменты и память.
Обучение с подкреплением
Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.
Основная истина
Доверенные ссылочные метки, используемые для обучения или оценки результатов модели.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

Google Cloud AI Research и академические партнеры выпустили EnvHarness, платформу с открытым исходным кодом под лицензией Apache 2.0. Инструмент вставляет программируемый уровень между ИИ-агентом и его средой обучения, позволяя среде динамически адаптироваться к конкретным сбоям агента. Используя компонент EnvRigger для диагностики слабых мест и изменения условий задачи без изменения базового верификатора, платформа позволяет агентам практиковать целевые навыки. При тестировании по пяти тестам, включая SWE-bench Verified и WebArena, агенты, обученные с помощью EnvHarness, показали прирост производительности до 9 баллов и сократили количество шагов, необходимых для выполнения задач, по сравнению со статическими средами.

Исследователи из Google Cloud AI Research разработали EnvHarness для решения проблемы статических тренировочных сред. Традиционная среда остается неизменной даже по мере совершенствования агентов, что затрудняет поиск сложных крайних случаев. EnvHarness представляет программируемый уровень, который может изменять начальные состояния, фильтровать действия и изменять длительность задач без изменения основной среды или ее средства проверки.

В состав фреймворка входит EnvRigger, который автоматизирует процесс адаптации. Он следует за циклом наблюдения, диагностики, записи и проверки. EnvRigger анализирует траектории движения агентов, чтобы выявить повторяющиеся шаблоны сбоев, а затем составляет конкретные компоненты EnvHarness для выявления или исправления этих сбоев. Он проверяет эти изменения, чтобы гарантировать, что задачи остаются решаемыми и полезными, прежде чем их применять.

Тестирование проводилось по пяти тестам: ALFWorld, WebArena, SWE-bench Verified, OfficeQA и SpreadsheetBench. Агенты, обученные с использованием EnvHarness, превзошли тех, кто обучался в статических средах, во всех пяти случаях. На SWE-bench Verified средняя длина траектории уменьшилась с 55,01 до 49,61 шага. Эта платформа также превзошла другие системы создания среды, такие как SWE-smith и GenEnv, как по точности, так и по эффективности.

Код, конфигурации экспериментов и реализация обучения с подкреплением доступны на GitHub под лицензией Apache 2.0. Платформе требуется Bridge для интеграции с существующими средами с начальной поддержкой SWE-bench на базе Docker, OfficeQA и SpreadsheetBench. Он предназначен для цифровых песочниц, где развертывание обходится дешево, а состояние можно восстановить, например для сред кодирования и веб-автоматизации.

Подробности об источнике: venturebeat.com ↗

Почему это важно

В этом выпуске устранена серьезная проблема в разработке агентов ИИ: высокая стоимость и уменьшающаяся отдача от создания статических сред обучения. По мере совершенствования агентов фиксированные среды становятся слишком простыми, что вынуждает разработчиков создавать новые, дорогие симуляторы. EnvHarness предлагает практическую альтернативу, расширяя возможности существующих надежных сред. Для корпоративных команд это означает, что они могут извлечь больше пользы из существующей инфраструктуры без необходимости перестраивать симуляторы с нуля. Платформа сохраняет целостность средств проверки истинности, одновременно динамически создавая проблемы, которые вынуждают агентов преодолевать определенные поведенческие упрощения, такие как пропуск тестов или недостающая информация. Такой подход снижает накладные расходы на разработку и обеспечивает масштабируемый путь повышения надежности агентов при выполнении сложных реальных задач.

Создание новой среды обучения является дорогостоящим и трудоемким процессом. EnvHarness позволяет командам повторно использовать существующие высококачественные среды, динамически изменяя их с учетом текущих слабостей агента. Это уменьшает необходимость постоянного создания новых симуляторов с нуля.

Платформа сохраняет целостность доверенных проверяющих. Изменяя условия, в которых работает агент, а не саму задачу, EnvHarness гарантирует, что успех по-прежнему определяется исходной, надежной основной истиной. Это имеет решающее значение для поддержания достоверности обучающих сигналов.

Для корпоративных команд ИИ этот подход предлагает практический способ повысить производительность агентов без значительных изменений инфраструктуры. Его можно интегрировать в существующие конвейеры CI/CD в качестве легкого плагина, позволяющего постоянно совершенствовать агенты в контролируемых и безопасных средах.

Динамическая природа EnvHarness помогает решить проблему, с которой агенты используют ярлыки. Автоматически создавая ограничения, которые заставляют агентов практиковать определенные навыки, например, выполнять тесты перед отправкой кода, платформа способствует более устойчивому и надежному поведению.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Разработчикам следует отслеживать репозиторий GitHub на наличие новых реализаций Bridge, поддерживающих дополнительные типы сред. Предприятиям, использующим контейнерные конвейеры CI/CD, следует оценить, как EnvHarness интегрируется с существующими установками Docker или Kubernetes. Кроме того, сообщество, вероятно, рассмотрит возможность объединения EnvHarness с платформами оптимизации на стороне агента для создания циклов обратной связи, в которых проблемы окружающей среды и возможности агентов развиваются вместе. Долгосрочное воздействие будет зависеть от того, останутся ли вычислительные затраты на диагностический цикл EnvRigger управляемыми по мере увеличения сложности агента.

Доступность новых мостов для разных типов сред будет определять широкую применимость платформы. В настоящее время поддержка ограничена конкретными тестами, но расширение на другие области будет иметь ключевое значение для ее принятия.

Вычислительные затраты цикла EnvRigger — это компромисс. Ожидается, что по мере совершенствования моделей стоимость разработки и проверки модификаций снизится, но командам необходимо будет следить за этим, чтобы гарантировать, что это остается жизнеспособным для крупномасштабного развертывания.

Интеграция с платформами оптимизации на стороне агента может создать мощные петли обратной связи. Хотя в этой статье это не тестировалось вместе, объединение EnvHarness с системами, которые изменяют внутреннюю обвязку агента, может привести к более комплексным улучшениям возможностей агента.

В центре внимания будет пригодность платформы для различных типов сред. Он лучше всего подходит для цифровых песочниц с дешевыми развертываниями и восстанавливаемыми состояниями. Его применение в средах с необратимыми побочными эффектами или дорогостоящими сбросами потребует тщательного рассмотрения и дополнительных мер безопасности.

Сопутствующие руководства и викторины

ИИ-агентыОбучение искусственному интеллектуЧто такое ИИ?Проверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?