Вернуться к новостям
ИнновацииAI Understanding брифинг

Препринт показывает, что производительность агентного ИИ зависит как от успеха задачи, так и от использования ресурсов

Новый препринт arXiv, сравнивающий OpenClaw и NanoBot, не выявил статистически установленного победителя при полном выполнении задачи, но сообщает о больших различиях во времени и пиковой памяти. Авторы утверждают, что оценки агентов должны связывать результаты с ресурсами и отчетами об исполнении, которые их произвели.

5 min readRead the primary source
Source-provided image accompanying Preprint finds agentic AI performance depends on both task success and resource use
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.27886
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Использование инструмента
Способность модели вызывать внешние инструменты, такие как поиск, калькуляторы или API.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

В препринте arXiv, представленном 28 августа, OpenClaw и NanoBot сравниваются как полноценные агентные системы искусственного интеллекта, включая их языковую модель, инструменты, память, управление состоянием и многоэтапное выполнение. По основному тесту OpenClaw выполнил 31% задач, а NanoBot — 25%, но заявленный интервал начальной загрузки задач в 95% составлял от -3 до 15 процентных пунктов, поэтому исследование не выявило преимущества полного завершения ни для одной системы.

В препринте OpenClaw и NanoBot оцениваются как полноценные агентные системы, а не сравниваются языковые модели по отдельности. Авторы описывают агентные системы как комбинации языковой модели с инструментами, памятью, управлением состоянием и многоэтапным выполнением. Эта структура имеет значение, поскольку каждый уровень может влиять как на то, что выполняет агент, так и на операционные ресурсы, необходимые для выполнения задачи.

В основном тесте OpenClaw достиг полного выполнения 31% задач по сравнению с 25% для NanoBot. Разница в шесть процентных пунктов сопровождалась 95%-ным интервалом начальной загрузки задачи в диапазоне от минус 3 до 15 процентных пунктов. Основываясь на этом интервале, авторы говорят, что ни для одной из систем не было статистически установлено преимущество полного завершения работ.

В документе также сообщается о более подробном инструментированном подмножестве парных подсказок. На этом уровне обе системы достигли полного завершения по 26% запросов. Тем не менее, NanoBot достиг как минимум частичного выполнения 43% запросов по сравнению с 26% для OpenClaw, что указывает на то, что оценка только за полное выполнение скрывает разницу в промежуточных результатах в этой подгруппе.

Измерения ресурсов в опубликованных сравнениях отдали предпочтение NanoBot. OpenClaw потребовал больше времени для 83% запросов и зафиксировал более высокое значение пиковой памяти для каждого запроса. В статье приведены средние геометрические коэффициенты 2,98 для времени стены и 19,44 для пиковой памяти. Среди десяти подсказок с подробным уровнем, где хотя бы одна система достигла частичного или полного завершения, NanoBot слабо доминировал в восьми. Однако во всех 23 подсказках десять из 18 случаев доминирования были более дешевыми совместными сбоями, а это означает, что более низкое использование ресурсов не всегда сопровождало полезный прогресс задачи.

Подробности об источнике: arxiv.org ↗

Почему это важно

В статье показано, почему агент, выполняющий немного больше задач, не может быть более практичной системой, если он потребляет значительно больше времени или памяти. Его результаты также показывают, что выводы по контрольным показателям могут измениться, когда исследователи изучают детали выполнения и различают полный успех, частичный прогресс и совместную неудачу.

Центральным вкладом является принцип оценки: возможности и затраты должны измеряться вместе и привязываться к конкретному выполнению, которое привело к каждому результату. Для людей, выбирающих или развертывающих агентные системы, сам по себе процент завершения может скрыть, является ли система достаточно быстрой, достаточно эффективной в использовании памяти или постоянно способной выполнять полезный частичный прогресс.

Сообщенные результаты делают этот компромисс конкретным. Показатель завершения основного теста OpenClaw в 31% был лишь незначительно выше, чем у NanoBot в 25%, а интервал неопределенности не позволил определить надежного победителя. Тем не менее, результаты инструментирования показывают гораздо большие эксплуатационные различия: OpenClaw требует больше времени для большинства запросов и использует больше пиковой памяти для каждого запроса в этом сравнении.

Особенно важно различать частичное завершение и разрушение сустава. Меньшее использование ресурсов NanoBot помогло ему доминировать в нескольких сравнениях, но авторы говорят, что десять из 18 случаев доминирования по всем 23 запросам были более дешевыми совместными неудачами. Систему не следует считать лучшей только потому, что она терпит неудачу при меньших затратах; Эффективность использования ресурсов следует интерпретировать наряду с качеством и полезностью результата.

В документе также освещаются вопросы воспроизводимости и подотчетности. Если результаты тестов не связаны с записями выполнения на уровне попыток и происхождением оценок, исследователи и пользователи могут быть не в состоянии определить, отражает ли результат полный успех, частичный прогресс, общую неудачу или артефакт измерения. Источник представляет это как повод сделать записи оценок более подробными, а не как доказательство того, что какая-либо система в целом превосходит другие системы.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Основные последующие вопросы заключаются в том, применимы ли результаты к более крупным и разнообразным наборам задач, различным конфигурациям оборудования и программного обеспечения, а также другим платформам агентов. Источник не предоставляет эти подробности в своем резюме, поэтому указанные соотношения ресурсов следует рассматривать как специфичные для исследования, а не универсальные рейтинги.

Непосредственный вопрос заключается в том, сохраняется ли сообщаемый разрыв во времени стены и пиковой памяти за пределами подсказок исследования и конфигурации теста. В аннотации не указан точный состав задачи, версии аппаратного обеспечения, программного обеспечения, количество повторных испытаний и методика измерений. Эти упущения ограничивают широту применения числовых коэффициентов.

Читателям также следует следить за оценками, в которых сообщается более чем об одном совокупном балле. Полезные последующие исследования позволят разделить полное завершение, частичное завершение и разрушение сустава; показать, как часто каждая система выигрывает по качеству задач; и публиковать записи выполнения, необходимые для связи каждого результата с потреблением ресурсов. Собственные разногласия в препринте между первичными и инструментальными доказательствами делают это практическим исследовательским приоритетом.

Вывод авторов носит скорее методологический, чем рекомендательный характер. Источник не утверждает, что NanoBot является лучшим агентом общего назначения или что более высокое использование ресурсов OpenClaw неоправданно для каждой рабочей нагрузки. Прежде чем рассматривать результаты как широкий рыночный или инженерный рейтинг, потребуются дальнейшие сравнения с другими агентными системами, более крупные выборки и независимые повторения.

Значимым неизвестным является то, как профили ресурсов системы взаимодействуют со сложностью задач и использованием инструментов. В аннотации приводятся агрегированные соотношения и сравнения на уровне подсказок, но не указывается, какие виды задач вызвали наибольшие различия. Эта информация поможет определить, отражают ли результаты общее свойство систем или закономерность, специфичную для оцениваемой рабочей нагрузки. До тех пор наиболее убедительным выводом является то, что оценка агентов должна сообщать о проверенных результатах вместе с наблюдаемым использованием ресурсов и оценкой происхождения.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаОбучение искусственному интеллектуПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?