Что случилось
В препринте arXiv, представленном 28 августа, OpenClaw и NanoBot сравниваются как полноценные агентные системы искусственного интеллекта, включая их языковую модель, инструменты, память, управление состоянием и многоэтапное выполнение. По основному тесту OpenClaw выполнил 31% задач, а NanoBot — 25%, но заявленный интервал начальной загрузки задач в 95% составлял от -3 до 15 процентных пунктов, поэтому исследование не выявило преимущества полного завершения ни для одной системы.
В препринте OpenClaw и NanoBot оцениваются как полноценные агентные системы, а не сравниваются языковые модели по отдельности. Авторы описывают агентные системы как комбинации языковой модели с инструментами, памятью, управлением состоянием и многоэтапным выполнением. Эта структура имеет значение, поскольку каждый уровень может влиять как на то, что выполняет агент, так и на операционные ресурсы, необходимые для выполнения задачи.
В основном тесте OpenClaw достиг полного выполнения 31% задач по сравнению с 25% для NanoBot. Разница в шесть процентных пунктов сопровождалась 95%-ным интервалом начальной загрузки задачи в диапазоне от минус 3 до 15 процентных пунктов. Основываясь на этом интервале, авторы говорят, что ни для одной из систем не было статистически установлено преимущество полного завершения работ.
В документе также сообщается о более подробном инструментированном подмножестве парных подсказок. На этом уровне обе системы достигли полного завершения по 26% запросов. Тем не менее, NanoBot достиг как минимум частичного выполнения 43% запросов по сравнению с 26% для OpenClaw, что указывает на то, что оценка только за полное выполнение скрывает разницу в промежуточных результатах в этой подгруппе.
Измерения ресурсов в опубликованных сравнениях отдали предпочтение NanoBot. OpenClaw потребовал больше времени для 83% запросов и зафиксировал более высокое значение пиковой памяти для каждого запроса. В статье приведены средние геометрические коэффициенты 2,98 для времени стены и 19,44 для пиковой памяти. Среди десяти подсказок с подробным уровнем, где хотя бы одна система достигла частичного или полного завершения, NanoBot слабо доминировал в восьми. Однако во всех 23 подсказках десять из 18 случаев доминирования были более дешевыми совместными сбоями, а это означает, что более низкое использование ресурсов не всегда сопровождало полезный прогресс задачи.
Подробности об источнике: arxiv.org ↗
Почему это важно
В статье показано, почему агент, выполняющий немного больше задач, не может быть более практичной системой, если он потребляет значительно больше времени или памяти. Его результаты также показывают, что выводы по контрольным показателям могут измениться, когда исследователи изучают детали выполнения и различают полный успех, частичный прогресс и совместную неудачу.
Центральным вкладом является принцип оценки: возможности и затраты должны измеряться вместе и привязываться к конкретному выполнению, которое привело к каждому результату. Для людей, выбирающих или развертывающих агентные системы, сам по себе процент завершения может скрыть, является ли система достаточно быстрой, достаточно эффективной в использовании памяти или постоянно способной выполнять полезный частичный прогресс.
Сообщенные результаты делают этот компромисс конкретным. Показатель завершения основного теста OpenClaw в 31% был лишь незначительно выше, чем у NanoBot в 25%, а интервал неопределенности не позволил определить надежного победителя. Тем не менее, результаты инструментирования показывают гораздо большие эксплуатационные различия: OpenClaw требует больше времени для большинства запросов и использует больше пиковой памяти для каждого запроса в этом сравнении.
Особенно важно различать частичное завершение и разрушение сустава. Меньшее использование ресурсов NanoBot помогло ему доминировать в нескольких сравнениях, но авторы говорят, что десять из 18 случаев доминирования по всем 23 запросам были более дешевыми совместными неудачами. Систему не следует считать лучшей только потому, что она терпит неудачу при меньших затратах; Эффективность использования ресурсов следует интерпретировать наряду с качеством и полезностью результата.
В документе также освещаются вопросы воспроизводимости и подотчетности. Если результаты тестов не связаны с записями выполнения на уровне попыток и происхождением оценок, исследователи и пользователи могут быть не в состоянии определить, отражает ли результат полный успех, частичный прогресс, общую неудачу или артефакт измерения. Источник представляет это как повод сделать записи оценок более подробными, а не как доказательство того, что какая-либо система в целом превосходит другие системы.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Что посмотреть дальше
Основные последующие вопросы заключаются в том, применимы ли результаты к более крупным и разнообразным наборам задач, различным конфигурациям оборудования и программного обеспечения, а также другим платформам агентов. Источник не предоставляет эти подробности в своем резюме, поэтому указанные соотношения ресурсов следует рассматривать как специфичные для исследования, а не универсальные рейтинги.
Непосредственный вопрос заключается в том, сохраняется ли сообщаемый разрыв во времени стены и пиковой памяти за пределами подсказок исследования и конфигурации теста. В аннотации не указан точный состав задачи, версии аппаратного обеспечения, программного обеспечения, количество повторных испытаний и методика измерений. Эти упущения ограничивают широту применения числовых коэффициентов.
Читателям также следует следить за оценками, в которых сообщается более чем об одном совокупном балле. Полезные последующие исследования позволят разделить полное завершение, частичное завершение и разрушение сустава; показать, как часто каждая система выигрывает по качеству задач; и публиковать записи выполнения, необходимые для связи каждого результата с потреблением ресурсов. Собственные разногласия в препринте между первичными и инструментальными доказательствами делают это практическим исследовательским приоритетом.
Вывод авторов носит скорее методологический, чем рекомендательный характер. Источник не утверждает, что NanoBot является лучшим агентом общего назначения или что более высокое использование ресурсов OpenClaw неоправданно для каждой рабочей нагрузки. Прежде чем рассматривать результаты как широкий рыночный или инженерный рейтинг, потребуются дальнейшие сравнения с другими агентными системами, более крупные выборки и независимые повторения.
Значимым неизвестным является то, как профили ресурсов системы взаимодействуют со сложностью задач и использованием инструментов. В аннотации приводятся агрегированные соотношения и сравнения на уровне подсказок, но не указывается, какие виды задач вызвали наибольшие различия. Эта информация поможет определить, отражают ли результаты общее свойство систем или закономерность, специфичную для оцениваемой рабочей нагрузки. До тех пор наиболее убедительным выводом является то, что оценка агентов должна сообщать о проверенных результатах вместе с наблюдаемым использованием ресурсов и оценкой происхождения.