Вернуться к новостям
ИнновацииAI Understanding брифинг

MarkTechPost сообщает, что EnvHarness превращает фиксированные среды ИИ-агентов в миры адаптивного обучения

MarkTechPost сообщает, что исследователи из Google Cloud AI Research, Вашингтонского университета в Сент-Луисе и Университета Северной Каролины в Чапел-Хилл выпустили EnvHarness, слой с открытым исходным кодом, который изменяет существующие среды агентов с учетом недостатков, обнаруженных при развертывании политик. Однако опубликованные результаты показывают рост по пяти критериям…

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports EnvHarness turns fixed AI-agent environments into adaptive training worlds
Ссылка на источникИсточник записан
Издатель
marktechpost.com
Ссылка на источник
marktechpost.comhttps://www.marktechpost.com/2026/08/30/google-ai-introduces-envharness-a-programmable-layer-that-turns-static-agent-environments-into-adaptive-training-worlds/amp/
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Обучение с подкреплением
Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.
Обобщение
Насколько хорошо модель работает с новыми, невидимыми данными за пределами обучающего набора.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

Исследователи, связанные с Google Cloud AI Research, Вашингтонским университетом в Сент-Луисе и Университетом Северной Каролины в Чапел-Хилл, выпустили EnvHarness, программируемый уровень, который объединяет фиксированные среды ИИ-агентов без изменения их базовых симуляторов, задач или созданных человеком верификаторов. MarkTechPost сообщает, что система использует компоненты под названием «Стадия», «Контракт» и «Цепочка» для изменения стартовых состояний, разрешенных действий, наблюдений и состава эпизодов.

MarkTechPost сообщает, что EnvHarness был выпущен исследователями из Google Cloud AI Research, Вашингтонского университета в Сент-Луисе и Университета Северной Каролины в Чапел-Хилл. Основная идея статьи заключается в том, чтобы обернуть существующую среду программируемыми компонентами, а не создавать совершенно новую среду. Обертки выполняют стандартные операции среды, такие как сброс() и шаг(), оставляя нетронутыми серверную часть симулятора, тестовые задачи и верификатор, созданный человеком. Это предназначено для того, чтобы одна реализация могла работать в нескольких доменах, избегая при этом зависимости от вновь созданного, потенциально ненадежного кода проверки. Источник ссылается на документ arXiv, репозиторий GitHub и страницу проекта, но сообщаемые результаты не были независимо подтверждены для этой оценки.

MarkTechPost описывает три компонента. Stage воспроизводит фиксированную последовательность действий после сброса(), позволяя эпизоду начаться из другого состояния; В статье в качестве примера приводится сокрытие целевой кружки в закрытом ящике, что может заставить агента искать, а не немедленно добраться до него. Контракт устанавливает перехватчики, которые могут блокировать действия, перезаписывать переходы или обрезать наблюдения. Chain помещает вторую среду в тот же эпизод с общим бюджетом шагов, причем для успеха требуется, чтобы оба верификатора компонентов были успешными. Источник сообщает, что эти компоненты могут быть составлены и что новый тест может быть подключен через интерфейс, включающий сброс, шаг, наблюдение, оценку, get_env_state, save_state и from_state.

Система также включает EnvRigger, цикл дизайнера на основе LLM. По данным MarkTechPost, EnvRigger наблюдает за пятью базовыми развертываниями, диагностирует системные недостатки политики, записывает компоненты-оболочки в виде кода Python и тестирует их на пяти новых развертываниях. Среды-кандидаты, которые либо неразрешимы, либо тривиально разрешимы, отклоняются, при этом для каждой задачи требуется до пяти раундов пересмотра. В статье говорится, что сгенерированные перехватчики компилируются в изолированном подпроцессе, превращая плохую мутацию в записанный след, а не в неудачный запуск. MarkTechPost сообщает о результатах по ALFWorld, WebArena, SWE-bench Verified, OfficeQA и SpreadsheetBench, в том числе об улучшении на 9,0 пунктов при разделении вне дистрибутива ALFWorld и на 9,8% меньшем количестве шагов выполнения при SWE-bench Verified.

Подробности об источнике: marktechpost.com ↗

Почему это важно

Этот подход решает практическую проблему обучения агентов: статические среды могут перестать предоставлять полезные сигналы обучения, как только агент с ними ознакомится. Адаптируя существующие среды к недостаткам, наблюдаемым в собственных развертываниях агента, EnvHarness может сделать обучение и оценку более целенаправленными, сохраняя при этом существующую логику проверки. Сообщенные достижения являются многообещающими, но остаются утверждениями из вторичного отчета об исследовательской работе.

Среды обучения агентов часто фиксированы: одни и те же задачи ведут себя одинаково независимо от того, неопытен ли агент или уже справился с ними. MarkTechPost сообщает, что обычным ответом является создание большего количества сред, но утверждает, что это создает конвейеры генерации для конкретной области и требует фильтрации большого количества верификаторов, написанных LLM. EnvHarness устраняет узкое место, изменяя состояния, действия и наблюдения, сохраняя при этом исходный верификатор. Если подход работает так, как заявлено, он предлагает способ сделать существующие тесты более чувствительными к реальным слабостям агента, не перестраивая каждый тест с нуля.

Сообщенные результаты тестов показывают, что ценность заключается в целенаправленном изменении, а не просто в добавлении навыка в неизмененную среду. MarkTechPost сообщает, что производительность ALFWorld выросла с 62,4 до 68,3, с приростом на 9,0 пунктов по показателю вне дистрибуции. На SWE-bench Verified зарегистрированный показатель разрешенных проблем увеличился с 49,88 до 52,58, а средний показатель шагов снизился с 55,01 до 49,61. В статье также говорится, что навыки, полученные из неизмененных сред, выполняются ниже базового уровня отсутствия навыков в SpreadsheetBench и WebArena, а изменение формы сделало процесс интеллектуального анализа полезным. Эти цифры представляют собой полученные результаты, а не независимые проверенные измерения.

Практическая значимость условна. MarkTechPost сообщает, что EnvHarness выпущен под лицензией Apache-2.0 в Python и включает драйверы воспроизведения для шести сред, что может сделать его доступным для команд, которые уже используют циклы оценки агентов. Этот метод может быть полезен для обучения и оценки с подкреплением, поскольку источник сообщает об улучшениях как при вводе навыков, так и при обучении GRPO. При этом в статье говорится, что у системы есть жесткое условие: среда должна быть перезагружаемой. Это исключает важные классы развертывания реальных агентов, включая реальные учетные записи и физических роботов, и ограничивает то, насколько напрямую результаты тестов отражаются на поведении производства.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Ключевые вопросы заключаются в том, смогут ли независимые исследователи воспроизвести заявленные улучшения в тестах, сколько жетонов дизайнера и вычислительных затрат требуется для адаптивного цикла, и переносится ли метод за пределы сбрасываемых моделируемых сред. MarkTechPost сообщает, что EnvHarness не поддерживает живые учетные записи пользователей или физических роботов, поскольку для этого требуются перезагружаемые среды.

Независимая репликация является наиболее важным следующим шагом. MarkTechPost сообщает, что EnvHarness превзошел исходные среды по нескольким тестам и превзошел специализированный генератор на SWE-bench Verified на 2,46 балла, используя при этом на 5,11 шагов меньше. Эти сравнения зависят от деталей реализации, выборки задач, подсказок, версий модели и процедур оценки, которые не полностью указаны в исходном тексте. Воспроизведение должно установить, сохраняется ли выигрыш при эквивалентных вычислительных бюджетах и ​​независимо выбранных задачах, а не только в экспериментальной установке, о которой сообщается.

Цикл адаптивного проектирования также может ввести новую структуру затрат. MarkTechPost сообщает, что EnvRigger пишет и пересматривает оболочки Python после проверки развертываний и определяет дизайнерские токены как стоимость системы. Источник сообщает, что производительность в 300 средах достигла 54,79 по сравнению с 52,13 для исходных сред и 50,37 для сгенерированных, поскольку разработчик совместно развивал каждую партию с текущей политикой. Также сообщается, что доля задач в пределах целевого диапазона успешности выросла с 6% до 80%. Дальнейшие отчеты должны прояснить затраты на токены, время выполнения и инженерные затраты, стоящие за этими результатами, а также оправдывают ли выгоды эти затраты.

Границы метода заслуживают пристального внимания. MarkTechPost сообщает о небольшом регрессе в распределении внедистрибьюторских продаж ALFWorld при одном сравнении GRPO: производительность выросла с 89,6 до 88,8, несмотря на рост внутридистрибутивных продаж с 81,4 до 87,9. Этот результат предполагает, что адаптация может улучшить производительность целевых распределений, не гарантируя более широкого обобщения. Из источника остается неизвестным, могут ли оболочки сохранять валидность тестов при состязательном использовании, охватывают ли исходные верификаторы все вновь измененные состояния и как система ведет себя в средах с необратимыми действиями, внешними пользователями или физическими последствиями. Независимого подтверждения готовности к развертыванию здесь нет.

Сопутствующие руководства и викторины

ИИ-агентыОбучение искусственному интеллектуОбъяснение моделей искусственного интеллектаБудущее ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?