Kembali ke Berita
InovasiAI Understanding taklimat

Pracetak mendapati prestasi AI agen bergantung pada kejayaan tugasan dan penggunaan sumber

Pracetak arXiv baharu yang membandingkan OpenClaw dan NanoBot tidak menemui pemenang yang ditetapkan secara statistik pada penyelesaian tugas penuh, tetapi melaporkan perbezaan besar dalam masa dan memori puncak. Penulis berpendapat bahawa penilaian ejen harus menghubungkan hasil kepada sumber dan rekod pelaksanaan yang menghasilkannya.

5 min readRead the primary source
Source-provided image accompanying Preprint finds agentic AI performance depends on both task success and resource use
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.27886
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Penggunaan Alat
Keupayaan model untuk memanggil alat luaran seperti carian, kalkulator atau API.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Pracetak arXiv yang diserahkan pada 28 Ogos membandingkan OpenClaw dan NanoBot sebagai sistem AI agenik yang lengkap, termasuk model bahasa, alatan, memori, pengurusan keadaan dan pelaksanaan berbilang langkah mereka. Pada penanda aras utama, OpenClaw menyelesaikan 31% tugasan dan NanoBot 25%, tetapi selang bootstrap tugasan 95% yang dilaporkan berjalan dari -3 hingga 15 mata peratusan, jadi kajian itu tidak mewujudkan kelebihan penyiapan penuh untuk mana-mana sistem.

Pracetak menilai OpenClaw dan NanoBot sebagai sistem agen yang lengkap dan bukannya membandingkan model bahasa secara berasingan. Penulis menerangkan sistem agenik sebagai gabungan model bahasa dengan alat, ingatan, pengurusan keadaan dan pelaksanaan pelbagai langkah. Pembingkaian itu penting kerana setiap lapisan boleh mempengaruhi kedua-dua perkara yang dicapai oleh ejen dan sumber operasi yang diperlukan untuk mencuba tugas.

Dalam penanda aras utama, OpenClaw mencapai penyelesaian tugas penuh pada 31% tugasan, berbanding 25% untuk NanoBot. Perbezaan enam peratusan mata disertakan dengan 95% selang bootstrap tugasan antara tolak 3 hingga 15 mata peratusan. Berdasarkan selang itu, penulis mengatakan tidak ada kelebihan penyiapan penuh yang ditetapkan secara statistik untuk kedua-dua sistem.

Makalah ini juga melaporkan subset berinstrumen yang lebih terperinci bagi gesaan berpasangan. Dalam lapisan itu, kedua-dua sistem mencapai penyiapan penuh pada 26% gesaan. Walau bagaimanapun, NanoBot mencapai sekurang-kurangnya penyiapan separa pada 43% gesaan, berbanding dengan 26% untuk OpenClaw, menunjukkan bahawa skor penyiapan penuh sahaja menyembunyikan perbezaan dalam hasil perantaraan dalam subset ini.

Pengukuran sumber mengutamakan NanoBot dalam perbandingan yang dilaporkan. OpenClaw mengambil masa lebih lama pada 83% gesaan dan merekodkan nilai memori puncak yang lebih tinggi pada setiap gesaan. Kertas ini memberikan nisbah min geometri 2.98 untuk masa dinding dan 19.44 untuk ingatan puncak. Antara sepuluh gesaan lapisan terperinci di mana sekurang-kurangnya satu sistem mencapai penyiapan separa atau sepenuhnya, NanoBot menguasai lapan dengan lemah. Di seluruh 23 gesaan, walau bagaimanapun, sepuluh daripada 18 kes penguasaannya adalah kegagalan bersama yang lebih murah, bermakna penggunaan sumber yang lebih rendah tidak selalu mengiringi kemajuan tugas yang berguna.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Makalah ini menunjukkan mengapa ejen yang menyelesaikan lebih sedikit tugasan mungkin bukan sistem yang lebih praktikal jika ia menggunakan lebih banyak masa atau ingatan. Keputusannya juga mencadangkan bahawa kesimpulan penanda aras boleh berubah apabila penyelidik memeriksa butiran pelaksanaan dan membezakan kejayaan penuh, kemajuan separa dan kegagalan bersama.

Sumbangan utama ialah prinsip penilaian: keupayaan dan kos harus diukur bersama-sama dan terikat dengan pelaksanaan khusus yang menghasilkan setiap keputusan. Bagi orang yang memilih atau menggunakan sistem agen, peratusan penyiapan sahaja boleh mengaburkan sama ada sistem itu cukup pantas, cukup cekap ingatan atau mampu secara konsisten membuat kemajuan separa yang berguna.

Keputusan yang dilaporkan menjadikan pertukaran itu konkrit. Kadar penyiapan penanda aras utama OpenClaw 31% hanya lebih tinggi daripada NanoBot 25%, dan selang ketidakpastian tidak menghasilkan pemenang yang boleh dipercayai. Namun keputusan berinstrumen menunjukkan perbezaan operasi yang lebih besar, dengan OpenClaw mengambil masa yang lebih lama pada kebanyakan gesaan dan menggunakan lebih banyak memori puncak pada setiap gesaan dalam perbandingan itu.

Perbezaan antara penyiapan separa dan kegagalan sendi adalah amat penting. Penggunaan sumber NanoBot yang lebih rendah membantunya menguasai beberapa perbandingan, tetapi pengarang mengatakan sepuluh daripada 18 kes penguasaannya merentas semua 23 gesaan adalah kegagalan sendi yang lebih murah. Sesuatu sistem tidak seharusnya dinilai sebagai lebih baik semata-mata kerana ia gagal pada kos yang lebih rendah; kecekapan sumber perlu ditafsirkan bersama kualiti dan kegunaan hasilnya.

Kertas kerja itu juga mengetengahkan isu kebolehulangan dan akauntabiliti. Jika markah penanda aras tidak dikaitkan dengan rekod pelaksanaan peringkat percubaan dan asal pemarkahan, penyelidik dan pengguna mungkin tidak dapat mengetahui sama ada keputusan mencerminkan kejayaan penuh, kemajuan separa, kegagalan bersama atau artifak pengukuran. Sumber membentangkan ini sebagai alasan untuk membuat rekod penilaian lebih terperinci, bukan sebagai bukti bahawa mana-mana sistem pada umumnya lebih unggul.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Soalan susulan utama ialah sama ada penemuan itu berlaku pada set tugasan yang lebih besar dan lebih pelbagai, konfigurasi perkakasan dan perisian yang berbeza serta rangka kerja ejen lain. Sumber tidak memberikan butiran tersebut dalam abstraknya, jadi nisbah sumber yang dilaporkan harus dianggap sebagai kedudukan khusus kajian dan bukannya kedudukan universal.

Persoalan segera ialah sama ada jurang yang dilaporkan dalam masa dinding dan memori puncak berterusan di luar gesaan kajian dan konfigurasi ujian. Abstrak tidak menyatakan komposisi tugas yang tepat, perkakasan, versi perisian, bilangan percubaan berulang atau prosedur pengukuran. Peninggalan tersebut mengehadkan sejauh mana nisbah berangka boleh digunakan.

Pembaca juga harus melihat penilaian yang melaporkan lebih daripada satu skor agregat. Kajian susulan yang berguna akan memisahkan penyiapan penuh, penyiapan separa dan kegagalan sendi; menunjukkan kekerapan setiap sistem menang pada kualiti tugas; dan menerbitkan rekod pelaksanaan yang diperlukan untuk menghubungkan setiap hasil kepada penggunaan sumber. Percanggahan pracetak itu sendiri antara lapisan bukti utama dan berinstrumen menjadikan ini keutamaan penyelidikan praktikal.

Kesimpulan penulis adalah metodologi dan bukannya cadangan produk. Sumber itu tidak menetapkan bahawa NanoBot adalah ejen tujuan umum yang lebih baik, mahupun penggunaan sumber OpenClaw yang lebih tinggi adalah tidak wajar untuk setiap beban kerja. Perbandingan lanjut dengan sistem ejen lain, sampel yang lebih besar dan replikasi bebas akan diperlukan sebelum menganggap penemuan itu sebagai kedudukan pasaran atau kejuruteraan yang luas.

Tidak diketahui yang bermakna ialah bagaimana profil sumber sistem berinteraksi dengan kesukaran tugas dan penggunaan alat. Abstrak melaporkan nisbah agregat dan perbandingan peringkat segera tetapi tidak mengenal pasti jenis tugas yang menyebabkan perbezaan terbesar. Maklumat itu akan membantu menentukan sama ada keputusan mencerminkan sifat umum sistem atau corak khusus untuk beban kerja yang dinilai. Sehingga itu, pengambilan yang paling kukuh disokong ialah penilaian ejen harus melaporkan hasil yang disahkan bersama-sama dengan penggunaan sumber yang diperhatikan dan asal pemarkahan.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?