Zurück zu den Neuigkeiten
InnovationAI Understanding Briefing

Preprint stellt fest, dass die Leistung der Agenten-KI sowohl vom Erfolg der Aufgabe als auch vom Ressourcenverbrauch abhängt

Ein neuer arXiv-Preprint, der OpenClaw und NanoBot vergleicht, findet keinen statistisch gesicherten Gewinner bei vollständiger Aufgabenerledigung, berichtet aber von großen Unterschieden in der Zeit und beim Spitzenspeicher. Die Autoren argumentieren, dass Agentenbewertungen Ergebnisse mit den Ressourcen und Ausführungsaufzeichnungen verknüpfen sollten, die sie hervorgebracht haben.

5 min readRead the primary source
Source-provided image accompanying Preprint finds agentic AI performance depends on both task success and resource use
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
arxiv.org
Quelllink
arxiv.orghttps://arxiv.org/abs/2608.27886
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

Speicher (Agentenspeicher)
Gespeicherter Kontext, den ein KI-Agent schritt- oder sitzungsübergreifend verwendet, um die Kontinuität zu verbessern.
Benchmark
Ein standardisierter Test oder Datensatz zum Messen und Vergleichen der Modellleistung.
Werkzeuggebrauch
Die Fähigkeit eines Modells, externe Tools wie Suche, Rechner oder APIs aufzurufen.
Testen Sie sich selbstKI-Agenten-Quiz

Was ist passiert?

Ein am 28. August eingereichter Vorabdruck arXiv vergleicht OpenClaw und NanoBot als vollständige Agenten-KI-Systeme, einschließlich ihres Sprachmodells, ihrer Tools, ihres Speichers, ihrer Zustandsverwaltung und ihrer mehrstufigen Ausführung. Bei einem primären erledigte OpenClaw 31 % der Aufgaben und NanoBot 25 %, aber das gemeldete Task-Bootstrap-Intervall von 95 % lag zwischen -3 und 15 Prozentpunkten, sodass die Studie für keines der beiden Systeme einen Vorteil bei der vollständigen Fertigstellung ergab.

Der Vorabdruck bewertet OpenClaw und NanoBot als vollständige Agentensysteme, anstatt Sprachmodelle isoliert zu vergleichen. Die Autoren beschreiben Agentensysteme als Kombinationen eines Sprachmodells mit Werkzeugen, Speicher, Zustandsverwaltung und mehrstufiger Ausführung. Dieser Rahmen ist wichtig, da jede Ebene sowohl Auswirkungen auf die Leistung eines Agenten als auch auf die für die Ausführung einer Aufgabe erforderlichen Betriebsressourcen haben kann.

Im primären erreichte OpenClaw bei 31 % der Aufgaben die vollständige Erledigung der Aufgaben, verglichen mit 25 % beim NanoBot. Der Unterschied von sechs Prozentpunkten ging mit einem Task-Bootstrap-Intervall von 95 % einher, das zwischen minus 3 und 15 Prozentpunkten lag. Basierend auf diesem Intervall sagen die Autoren, dass es für keines der Systeme einen statistisch nachgewiesenen Vorteil bei der vollständigen Fertigstellung gab.

Das Papier berichtet auch über eine detailliertere instrumentierte Teilmenge gepaarter Eingabeaufforderungen. In dieser Ebene erreichten beide Systeme bei 26 % der Eingabeaufforderungen den vollständigen Abschluss. Dennoch erreichte NanoBot bei 43 % der Eingabeaufforderungen zumindest einen teilweisen Abschluss, verglichen mit 26 % bei OpenClaw, was darauf hindeutet, dass hinter einer Bewertung, die nur den vollständigen Abschluss ergab, ein Unterschied bei den Zwischenergebnissen in dieser Untergruppe verborgen blieb.

Ressourcenmessungen begünstigten NanoBot in den gemeldeten Vergleichen. OpenClaw brauchte bei 83 % der Eingabeaufforderungen länger und verzeichnete bei jeder Eingabeaufforderung einen höheren Spitzenspeicherwert. Die Arbeit gibt geometrische Mittelverhältnisse von 2,98 für die Wandzeit und 19,44 für das Spitzengedächtnis an. Unter den zehn detaillierten Eingabeaufforderungen, bei denen mindestens ein System teilweise oder vollständig abgeschlossen wurde, dominierte NanoBot bei acht schwach. Bei allen 23 Eingabeaufforderungen handelte es sich jedoch bei zehn der 18 Dominanzfälle um billigere Gelenkausfälle, was bedeutet, dass ein geringerer Ressourcenverbrauch nicht immer mit einem nützlichen Aufgabenfortschritt einherging.

Quellenangaben: arxiv.org ↗

Warum es wichtig ist

Das Papier zeigt, warum ein Agent, der etwas mehr Aufgaben erledigt, möglicherweise nicht das praktischere System ist, wenn er wesentlich mehr Zeit oder Speicher verbraucht. Die Ergebnisse deuten auch darauf hin, dass sich -Schlussfolgerungen ändern können, wenn Forscher Ausführungsdetails untersuchen und vollständigen Erfolg, teilweisen Fortschritt und gemeinsames Scheitern unterscheiden.

Der zentrale Beitrag ist ein Bewertungsprinzip: Leistungsfähigkeit und Kosten sollten gemeinsam gemessen und mit der spezifischen Ausführung verknüpft werden, die zu jedem Ergebnis geführt hat. Für Personen, die Agentensysteme auswählen oder bereitstellen, kann allein der Abschlussprozentsatz unklar sein, ob ein System schnell genug, speichereffizient genug oder dauerhaft in der Lage ist, nützliche Teilfortschritte zu erzielen.

Die gemeldeten Ergebnisse machen diesen Kompromiss konkret. OpenClaws 31-prozentige Abschlussquote beim Primär- war nur geringfügig höher als die 25-prozentige von NanoBot, und das Unsicherheitsintervall ergab keinen verlässlichen Gewinner. Die instrumentierten Ergebnisse zeigen jedoch viel größere Betriebsunterschiede, da OpenClaw bei den meisten Eingabeaufforderungen länger benötigt und in diesem Vergleich bei jeder Eingabeaufforderung mehr Spitzenspeicher verbraucht.

Besonders wichtig ist die Unterscheidung zwischen Teilvollständigkeit und Gelenkversagen. Der geringere Ressourcenverbrauch von NanoBot verhalf ihm dazu, mehrere Vergleiche zu dominieren, aber die Autoren sagen, dass zehn seiner 18 Dominanzfälle in allen 23 Eingabeaufforderungen billigere Gelenkausfälle waren. Ein System sollte nicht einfach deshalb als besser beurteilt werden, weil es bei geringeren Kosten ausfällt; Ressourceneffizienz muss neben der Qualität und dem Nutzen des Ergebnisses interpretiert werden.

Das Papier hebt auch ein Problem der Reproduzierbarkeit und Verantwortlichkeit hervor. Wenn -Scores nicht mit Ausführungsaufzeichnungen auf Versuchsebene und der Herkunft der Scores verknüpft sind, können Forscher und Benutzer möglicherweise nicht erkennen, ob ein Ergebnis den vollständigen Erfolg, einen teilweisen Fortschritt, einen gemeinsamen Misserfolg oder ein Messartefakt widerspiegelt. Die Quelle nennt dies einen Grund, die Bewertungsaufzeichnungen detaillierter zu gestalten, und nicht einen Beweis dafür, dass eines der beiden Systeme im Allgemeinen überlegen ist.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiver Konzeptcheck+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Was Sie als nächstes sehen sollten

Die wichtigsten Folgefragen sind, ob die Ergebnisse für größere und vielfältigere Aufgabensätze, verschiedene Hardware- und Softwarekonfigurationen und andere Agenten-Frameworks gelten. Die Quelle stellt diese Details in ihrer Zusammenfassung nicht bereit, daher sollten die gemeldeten Ressourcenverhältnisse als studienspezifische und nicht als universelle Rankings behandelt werden.

Die unmittelbare Frage ist, ob die gemeldete Lücke in der Wandzeit und im Spitzengedächtnis über die Eingabeaufforderungen und Testkonfigurationen der Studie hinaus bestehen bleibt. Die Zusammenfassung enthält keine Angaben zur genauen Zusammensetzung der Aufgabe, zur Hardware, zu den Softwareversionen, zur Anzahl der wiederholten Versuche oder zum Messverfahren. Diese Auslassungen schränken die Breite der Anwendung der Zahlenverhältnisse ein.

Leser sollten auch auf Bewertungen achten, die mehr als eine einzelne Gesamtpunktzahl angeben. Nützliche Folgestudien würden die vollständige Fertigstellung, die teilweise Fertigstellung und das gemeinsame Versagen unterscheiden; Zeigen Sie, wie oft jedes System hinsichtlich der Aufgabenqualität gewinnt. und veröffentlichen Sie die Ausführungsdatensätze, die erforderlich sind, um jedes Ergebnis mit dem Ressourcenverbrauch in Verbindung zu bringen. Aufgrund der Unstimmigkeiten des Preprints zwischen seiner primären und instrumentierten Evidenzebene ist dies eine praktische Forschungspriorität.

Die Schlussfolgerung der Autoren ist eher methodischer Natur als eine Produktempfehlung. Die Quelle belegt weder, dass NanoBot der bessere Allzweckagent ist, noch dass der höhere Ressourcenverbrauch von OpenClaw für jede Arbeitslast ungerechtfertigt ist. Weitere Vergleiche mit anderen Agentensystemen, größeren Stichproben und unabhängigen Replikationen wären erforderlich, bevor die Ergebnisse als umfassendes Markt- oder Technikranking behandelt werden könnten.

Eine bedeutungsvolle Unbekannte ist, wie die Ressourcenprofile der Systeme mit der Aufgabenschwierigkeit und der Werkzeugnutzung interagieren. Die Zusammenfassung berichtet über aggregierte Verhältnisse und Vergleiche auf Eingabeaufforderungsebene, gibt jedoch nicht an, welche Arten von Aufgaben die größten Unterschiede verursacht haben. Mithilfe dieser Informationen lässt sich feststellen, ob die Ergebnisse eine allgemeine Eigenschaft der Systeme oder ein für die bewertete Arbeitslast spezifisches Muster widerspiegeln. Bis dahin ist die am stärksten unterstützte Erkenntnis, dass die Agentenbewertung verifizierte Ergebnisse zusammen mit der beobachteten Ressourcennutzung und der Herkunft der Bewertung melden sollte.

Verwandte Leitfäden und Quizze

KI-AgentenKI-Modelle erklärtKI-TrainingTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker
Fanden Sie das nützlich?