Wat is er gebeurd
Een arXiv-voorafdruk, ingediend op 28 augustus, vergelijkt OpenClaw en NanoBot als complete agentische AI-systemen, inclusief hun taalmodel, tools, geheugen, statusbeheer en meerstapsuitvoering. Op basis van een primaire voltooide OpenClaw 31% van de taken en NanoBot 25%, maar het gerapporteerde taak-bootstrap-interval van 95% liep van -3 tot 15 procentpunten, dus uit het onderzoek bleek voor geen van beide systemen een volledig voltooiingsvoordeel.
De preprint evalueert OpenClaw en NanoBot als complete agentische systemen in plaats van taalmodellen afzonderlijk te vergelijken. De auteurs beschrijven agentische systemen als combinaties van een taalmodel met tools, geheugen, statusbeheer en meerstapsuitvoering. Die framing is van belang omdat elke laag zowel invloed kan hebben op wat een agent presteert als op de operationele middelen die nodig zijn om een taak uit te voeren.
In de primaire behaalde OpenClaw een volledige taakvoltooiing bij 31% van de taken, vergeleken met 25% voor NanoBot. Het verschil van zes procentpunten ging gepaard met een taak-bootstrap-interval van 95%, variërend van min 3 tot 15 procentpunten. Op basis van dat interval zeggen de auteurs dat er voor geen van beide systemen een statistisch vastgesteld voordeel bij volledige voltooiing was.
Het artikel rapporteert ook een meer gedetailleerde geïnstrumenteerde subset van gepaarde aanwijzingen. In die laag bereikten beide systemen volledige voltooiing bij 26% van de prompts. NanoBot bereikte niettemin op zijn minst een gedeeltelijke voltooiing op 43% van de prompts, vergeleken met 26% voor OpenClaw, wat aangeeft dat een score voor alleen volledige voltooiing een verschil in tussenresultaten in deze subset verhulde.
Bronmetingen gaven de voorkeur aan NanoBot in de gerapporteerde vergelijkingen. OpenClaw duurde langer bij 83% van de prompts en registreerde bij elke prompt een hogere piekgeheugenwaarde. Het artikel geeft geometrische gemiddelde verhoudingen van 2,98 voor wandtijd en 19,44 voor piekgeheugen. Van de tien gedetailleerde laagprompts waarbij ten minste één systeem gedeeltelijk of volledig werd voltooid, domineerde NanoBot zwak op acht. Bij alle 23 prompts waren echter tien van de 18 gevallen van dominantie goedkopere gezamenlijke mislukkingen, wat betekent dat een lager gebruik van hulpbronnen niet altijd gepaard ging met nuttige taakvoortgang.
Waarom het ertoe doet
Het artikel laat zien waarom een agent die iets meer taken uitvoert, misschien niet het meest praktische systeem is als het aanzienlijk meer tijd of geheugen in beslag neemt. De resultaten suggereren ook dat benchmarkconclusies kunnen veranderen wanneer onderzoekers de uitvoeringsdetails inspecteren en onderscheid maken tussen volledig succes, gedeeltelijke vooruitgang en gezamenlijk falen.
De centrale bijdrage is een evaluatieprincipe: capaciteit en kosten moeten samen worden gemeten en gekoppeld aan de specifieke uitvoering die elk resultaat heeft opgeleverd. Voor mensen die agentische systemen kiezen of inzetten, kan alleen al een voltooiingspercentage onduidelijk maken of een systeem snel genoeg is, geheugenefficiënt genoeg of consistent in staat is om nuttige gedeeltelijke vooruitgang te boeken.
De gerapporteerde resultaten maken die afweging concreet. Het voltooiingspercentage van de primaire van 31% van OpenClaw was slechts bescheiden hoger dan de 25% van NanoBot, en het onzekerheidsinterval leverde geen betrouwbare winnaar op. Toch laten de geïnstrumenteerde resultaten veel grotere operationele verschillen zien, waarbij OpenClaw er langer over doet bij de meeste prompts en meer piekgeheugen gebruikt bij elke prompt in die vergelijking.
Het onderscheid tussen gedeeltelijke voltooiing en gezamenlijke mislukking is vooral belangrijk. Het lagere hulpbronnengebruik van NanoBot hielp het verschillende vergelijkingen te domineren, maar de auteurs zeggen dat tien van de 18 gevallen van dominantie in alle 23 prompts goedkopere gezamenlijke mislukkingen waren. Een systeem mag niet als beter worden beoordeeld simpelweg omdat het tegen lagere kosten faalt; Efficiëntie van hulpbronnen moet worden geïnterpreteerd naast de kwaliteit en bruikbaarheid van de uitkomst.
Het artikel benadrukt ook een kwestie van reproduceerbaarheid en verantwoording. Als benchmarkscores niet zijn gekoppeld aan uitvoeringsrecords op pogingsniveau en de herkomst van de scores, kunnen onderzoekers en gebruikers mogelijk niet zeggen of een resultaat volledig succes, gedeeltelijke voortgang, een gedeelde mislukking of een meetartefact weerspiegelt. De bron presenteert dit als een reden om de evaluatiegegevens gedetailleerder te maken, en niet als bewijs dat een van beide systemen over het algemeen superieur is.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Wat je nu moet bekijken
De belangrijkste vervolgvragen zijn of de bevindingen gelden voor grotere en meer gevarieerde takensets, verschillende hardware- en softwareconfiguraties en andere agentframeworks. De bron geeft deze details niet in zijn samenvatting, dus de gerapporteerde hulpbronnenratio's moeten worden behandeld als studiespecifieke in plaats van universele ranglijsten.
De directe vraag is of de gerapporteerde kloof in walltime en piekgeheugen blijft bestaan buiten de aanwijzingen en testconfiguratie van het onderzoek. Het abstract vermeldt niet de exacte taaksamenstelling, hardware, softwareversies, aantal herhaalde pogingen of meetprocedure. Deze weglatingen beperken hoe breed de numerieke verhoudingen kunnen worden toegepast.
Lezers moeten ook letten op evaluaties die meer dan één enkele totaalscore rapporteren. Nuttige vervolgstudies zouden volledige voltooiing, gedeeltelijke voltooiing en gezamenlijke mislukking scheiden; laten zien hoe vaak elk systeem wint op het gebied van taakkwaliteit; en publiceer de uitvoeringsrecords die nodig zijn om elk resultaat te koppelen aan het verbruik van hulpbronnen. De onenigheid van de preprint zelf tussen de primaire en geïnstrumenteerde bewijslagen maakt dit tot een praktische onderzoeksprioriteit.
De conclusie van de auteurs is eerder methodologisch dan een productaanbeveling. De bron stelt niet vast dat NanoBot de betere agent voor algemene doeleinden is, noch dat het hogere bronnengebruik van OpenClaw niet gerechtvaardigd is voor elke werklast. Verdere vergelijkingen met andere agentsystemen, grotere steekproeven en onafhankelijke replicaties zouden nodig zijn voordat de bevindingen als een brede markt- of technische rangschikking worden behandeld.
Een betekenisvolle onbekende is hoe de systeembronprofielen interageren met de moeilijkheidsgraad van taken en het gebruik van tools. De samenvatting rapporteert geaggregeerde verhoudingen en vergelijkingen op promptniveau, maar identificeert niet welke soorten taken de grootste verschillen veroorzaakten. Die informatie zou helpen bepalen of de resultaten een algemene eigenschap van de systemen weerspiegelen of een patroon dat specifiek is voor de geëvalueerde werklast. Tot die tijd is de sterkst ondersteunde conclusie dat de evaluatie van agenten geverifieerde resultaten moet rapporteren, samen met het waargenomen gebruik van hulpbronnen en het scoren van de herkomst.