Назад до новин
ІнноваціяAI Understanding брифінг

Препринт виявляє, що продуктивність агентського штучного інтелекту залежить як від успіху завдання, так і від використання ресурсів

Новий препринт arXiv, що порівнює OpenClaw і NanoBot, не знаходить статистично встановленого переможця щодо повного виконання завдання, але повідомляє про великі відмінності в часі та піковій пам’яті. Автори стверджують, що оцінки агентів повинні пов’язувати результати з ресурсами та записами про виконання, які їх створили.

5 min readRead the primary source
Source-provided image accompanying Preprint finds agentic AI performance depends on both task success and resource use
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.27886
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Пам'ять (Пам'ять агента)
Збережений контекст агент штучного інтелекту використовує на етапах або сеансах для покращення безперервності.
Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Використання інструменту
Здатність моделі викликати зовнішні інструменти, такі як пошук, калькулятори або API.
Перевір себеВікторина агентів ШІ

Що сталося

Препринт arXiv, поданий 28 серпня, порівнює OpenClaw і NanoBot як повні агентні системи штучного інтелекту, включаючи їх мовну модель, інструменти, пам’ять, управління станом і багатоетапне виконання. За основним тестом OpenClaw виконав 31% завдань, а NanoBot – 25%, але зазначений інтервал між завантаженням 95% завдань коливався від -3 до 15 процентних пунктів, тому дослідження не встановило переваги повного завершення для жодної системи.

Препринт оцінює OpenClaw і NanoBot як повні агентні системи, а не порівнює мовні моделі окремо. Автори описують агентні системи як комбінації мовної моделі з інструментами, пам’яттю, управлінням станом і багатокроковим виконанням. Це формування має значення, оскільки кожен рівень може впливати як на те, що виконує агент, так і на операційні ресурси, необхідні для виконання завдання.

У первинному тесті OpenClaw повністю виконав 31% завдань у порівнянні з 25% для NanoBot. Різниця в шість процентних пунктів супроводжувалася 95% інтервалом між завданнями і завантаженням в діапазоні від мінус 3 до 15 процентних пунктів. Виходячи з цього інтервалу, автори кажуть, що не було статистично встановленої переваги повного завершення для жодної системи.

У документі також повідомляється про більш детальну інструментальну підмножину парних підказок. На цьому рівні обидві системи досягли повного завершення на 26% підказок. Незважаючи на це, NanoBot досяг принаймні часткового завершення на 43% підказок у порівнянні з 26% для OpenClaw, що вказує на те, що оцінка лише повного завершення приховує різницю в проміжних результатах у цій підмножині.

Вимірювання ресурсів віддало перевагу NanoBot у повідомлених порівняннях. OpenClaw займав більше часу для 83% підказок і записував вищі значення пікової пам’яті для кожного запиту. Стаття надає середнє геометричне співвідношення 2,98 для часу стінки та 19,44 для пікової пам’яті. Серед десяти підказок детального рівня, де принаймні одна система досягла часткового або повного завершення, NanoBot слабо домінував у восьми. Однак у всіх 23 підказках десять із 18 випадків домінування були дешевшими невдачами, що означає, що менше використання ресурсів не завжди супроводжувало корисний прогрес виконання завдання.

Деталі джерела: arxiv.org ↗

Чому це важливо

У статті показано, чому агент, який виконує трохи більше завдань, може бути не більш практичною системою, якщо він споживає значно більше часу або пам’яті. Його результати також свідчать про те, що висновки тесту можуть змінитися, коли дослідники перевіряють деталі виконання та розрізняють повний успіх, частковий прогрес і спільну невдачу.

Основним внеском є ​​принцип оцінки: можливості та вартість повинні вимірюватися разом і прив’язуватися до конкретного виконання, яке дало кожен результат. Для людей, які обирають або розгортають агентські системи, сам по собі відсоток завершення може приховати, чи є система достатньо швидкою, достатньо ефективною з використанням пам’яті чи постійно здатною робити корисний частковий прогрес.

Повідомлені результати роблять цей компроміс конкретним. Відсоток завершення основного тесту OpenClaw у 31% був лише трохи вищим, ніж 25% у NanoBot, і інтервал невизначеності не встановив надійного переможця. Тим не менш, інструментальні результати показують набагато більші робочі відмінності, при цьому OpenClaw займає більше часу для більшості підказок і використовує більше пікової пам’яті для кожного підказки в цьому порівнянні.

Розрізнення між частковим завершенням і руйнуванням суглоба є особливо важливим. Нижче використання ресурсів NanoBot допомогло йому домінувати в кількох порівняннях, але автори кажуть, що десять із 18 випадків домінування у всіх 23 підказках були дешевшими збоями в роботі. Систему не слід оцінювати як кращу лише тому, що вона виходить з ладу при менших витратах; ефективність використання ресурсів слід тлумачити разом із якістю та корисністю результату.

Документ також висвітлює проблему відтворюваності та звітності. Якщо результати порівняльного тесту не пов’язані із записами про виконання на рівні спроби та походженням балів, дослідники та користувачі можуть бути не в змозі визначити, чи відображає результат повний успіх, частковий прогрес, спільну помилку чи артефакт вимірювання. Джерело представляє це як причину зробити записи оцінювання більш детальними, а не як доказ того, що будь-яка система загалом краща.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Інтерактивна перевірка концепції+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Що дивитися далі

Основні подальші запитання полягають у тому, чи результати справедливі для більших і різноманітніших наборів завдань, різних конфігурацій апаратного та програмного забезпечення та інших фреймворків агентів. Джерело не надає цих подробиць у своїй анотації, тому зазначені співвідношення ресурсів слід розглядати як конкретні дослідження, а не як універсальні рейтинги.

Негайне питання полягає в тому, чи зберігається зареєстрований розрив у часі стіни та піковій пам’яті поза підказками дослідження та тестовою конфігурацією. В анотації не вказується точний склад завдання, версії обладнання, програмного забезпечення, кількість повторних випробувань або процедура вимірювання. Ці пропуски обмежують широке застосування числових співвідношень.

Читачі також повинні стежити за оцінками, які повідомляють більше, ніж один загальний бал. Корисні подальші дослідження розділили б повне завершення, часткове завершення та спільну невдачу; показати, як часто кожна система виграє в якості завдання; і опублікувати записи про виконання, необхідні для зв’язку кожного результату зі споживанням ресурсів. Власна розбіжність препринту між первинним і інструментальним рівнем доказів робить це практичним пріоритетом дослідження.

Висновок авторів є методологічним, а не рекомендацією продукту. Джерело не встановлює, що NanoBot є кращим агентом загального призначення, а також те, що більше використання ресурсів OpenClaw є невиправданим для кожного робочого навантаження. Потрібні будуть подальші порівняння з іншими системами агентів, більші зразки та незалежні копії, перш ніж розглядати результати як широкий ринковий чи інженерний рейтинг.

Важливим невідомим є те, як профілі системних ресурсів взаємодіють зі складністю завдань і використанням інструментів. Анотація повідомляє сукупні співвідношення та порівняння швидкого рівня, але не визначає, які типи завдань спричинили найбільші відмінності. Ця інформація допоможе визначити, чи відображають результати загальну властивість систем чи шаблон, специфічний для оцінюваного робочого навантаження. До того часу найсильніший висновок полягає в тому, що оцінка агента повинна повідомляти перевірені результати разом із спостережуваним використанням ресурсів і походженням балів.

Пов’язані посібники та вікторини

Агенти ШІПояснення моделей AIНавчання ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?