Apa yang berlaku
Pracetak arXiv yang diserahkan pada 28 Ogos membandingkan OpenClaw dan NanoBot sebagai sistem AI agenik yang lengkap, termasuk model bahasa, alatan, memori, pengurusan keadaan dan pelaksanaan berbilang langkah mereka. Pada penanda aras utama, OpenClaw menyelesaikan 31% tugasan dan NanoBot 25%, tetapi selang bootstrap tugasan 95% yang dilaporkan berjalan dari -3 hingga 15 mata peratusan, jadi kajian itu tidak mewujudkan kelebihan penyiapan penuh untuk mana-mana sistem.
Pracetak menilai OpenClaw dan NanoBot sebagai sistem agen yang lengkap dan bukannya membandingkan model bahasa secara berasingan. Penulis menerangkan sistem agenik sebagai gabungan model bahasa dengan alat, ingatan, pengurusan keadaan dan pelaksanaan pelbagai langkah. Pembingkaian itu penting kerana setiap lapisan boleh mempengaruhi kedua-dua perkara yang dicapai oleh ejen dan sumber operasi yang diperlukan untuk mencuba tugas.
Dalam penanda aras utama, OpenClaw mencapai penyelesaian tugas penuh pada 31% tugasan, berbanding 25% untuk NanoBot. Perbezaan enam peratusan mata disertakan dengan 95% selang bootstrap tugasan antara tolak 3 hingga 15 mata peratusan. Berdasarkan selang itu, penulis mengatakan tidak ada kelebihan penyiapan penuh yang ditetapkan secara statistik untuk kedua-dua sistem.
Makalah ini juga melaporkan subset berinstrumen yang lebih terperinci bagi gesaan berpasangan. Dalam lapisan itu, kedua-dua sistem mencapai penyiapan penuh pada 26% gesaan. Walau bagaimanapun, NanoBot mencapai sekurang-kurangnya penyiapan separa pada 43% gesaan, berbanding dengan 26% untuk OpenClaw, menunjukkan bahawa skor penyiapan penuh sahaja menyembunyikan perbezaan dalam hasil perantaraan dalam subset ini.
Pengukuran sumber mengutamakan NanoBot dalam perbandingan yang dilaporkan. OpenClaw mengambil masa lebih lama pada 83% gesaan dan merekodkan nilai memori puncak yang lebih tinggi pada setiap gesaan. Kertas ini memberikan nisbah min geometri 2.98 untuk masa dinding dan 19.44 untuk ingatan puncak. Antara sepuluh gesaan lapisan terperinci di mana sekurang-kurangnya satu sistem mencapai penyiapan separa atau sepenuhnya, NanoBot menguasai lapan dengan lemah. Di seluruh 23 gesaan, walau bagaimanapun, sepuluh daripada 18 kes penguasaannya adalah kegagalan bersama yang lebih murah, bermakna penggunaan sumber yang lebih rendah tidak selalu mengiringi kemajuan tugas yang berguna.
Mengapa ia penting
Makalah ini menunjukkan mengapa ejen yang menyelesaikan lebih sedikit tugasan mungkin bukan sistem yang lebih praktikal jika ia menggunakan lebih banyak masa atau ingatan. Keputusannya juga mencadangkan bahawa kesimpulan penanda aras boleh berubah apabila penyelidik memeriksa butiran pelaksanaan dan membezakan kejayaan penuh, kemajuan separa dan kegagalan bersama.
Sumbangan utama ialah prinsip penilaian: keupayaan dan kos harus diukur bersama-sama dan terikat dengan pelaksanaan khusus yang menghasilkan setiap keputusan. Bagi orang yang memilih atau menggunakan sistem agen, peratusan penyiapan sahaja boleh mengaburkan sama ada sistem itu cukup pantas, cukup cekap ingatan atau mampu secara konsisten membuat kemajuan separa yang berguna.
Keputusan yang dilaporkan menjadikan pertukaran itu konkrit. Kadar penyiapan penanda aras utama OpenClaw 31% hanya lebih tinggi daripada NanoBot 25%, dan selang ketidakpastian tidak menghasilkan pemenang yang boleh dipercayai. Namun keputusan berinstrumen menunjukkan perbezaan operasi yang lebih besar, dengan OpenClaw mengambil masa yang lebih lama pada kebanyakan gesaan dan menggunakan lebih banyak memori puncak pada setiap gesaan dalam perbandingan itu.
Perbezaan antara penyiapan separa dan kegagalan sendi adalah amat penting. Penggunaan sumber NanoBot yang lebih rendah membantunya menguasai beberapa perbandingan, tetapi pengarang mengatakan sepuluh daripada 18 kes penguasaannya merentas semua 23 gesaan adalah kegagalan sendi yang lebih murah. Sesuatu sistem tidak seharusnya dinilai sebagai lebih baik semata-mata kerana ia gagal pada kos yang lebih rendah; kecekapan sumber perlu ditafsirkan bersama kualiti dan kegunaan hasilnya.
Kertas kerja itu juga mengetengahkan isu kebolehulangan dan akauntabiliti. Jika markah penanda aras tidak dikaitkan dengan rekod pelaksanaan peringkat percubaan dan asal pemarkahan, penyelidik dan pengguna mungkin tidak dapat mengetahui sama ada keputusan mencerminkan kejayaan penuh, kemajuan separa, kegagalan bersama atau artifak pengukuran. Sumber membentangkan ini sebagai alasan untuk membuat rekod penilaian lebih terperinci, bukan sebagai bukti bahawa mana-mana sistem pada umumnya lebih unggul.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Soalan susulan utama ialah sama ada penemuan itu berlaku pada set tugasan yang lebih besar dan lebih pelbagai, konfigurasi perkakasan dan perisian yang berbeza serta rangka kerja ejen lain. Sumber tidak memberikan butiran tersebut dalam abstraknya, jadi nisbah sumber yang dilaporkan harus dianggap sebagai kedudukan khusus kajian dan bukannya kedudukan universal.
Persoalan segera ialah sama ada jurang yang dilaporkan dalam masa dinding dan memori puncak berterusan di luar gesaan kajian dan konfigurasi ujian. Abstrak tidak menyatakan komposisi tugas yang tepat, perkakasan, versi perisian, bilangan percubaan berulang atau prosedur pengukuran. Peninggalan tersebut mengehadkan sejauh mana nisbah berangka boleh digunakan.
Pembaca juga harus melihat penilaian yang melaporkan lebih daripada satu skor agregat. Kajian susulan yang berguna akan memisahkan penyiapan penuh, penyiapan separa dan kegagalan sendi; menunjukkan kekerapan setiap sistem menang pada kualiti tugas; dan menerbitkan rekod pelaksanaan yang diperlukan untuk menghubungkan setiap hasil kepada penggunaan sumber. Percanggahan pracetak itu sendiri antara lapisan bukti utama dan berinstrumen menjadikan ini keutamaan penyelidikan praktikal.
Kesimpulan penulis adalah metodologi dan bukannya cadangan produk. Sumber itu tidak menetapkan bahawa NanoBot adalah ejen tujuan umum yang lebih baik, mahupun penggunaan sumber OpenClaw yang lebih tinggi adalah tidak wajar untuk setiap beban kerja. Perbandingan lanjut dengan sistem ejen lain, sampel yang lebih besar dan replikasi bebas akan diperlukan sebelum menganggap penemuan itu sebagai kedudukan pasaran atau kejuruteraan yang luas.
Tidak diketahui yang bermakna ialah bagaimana profil sumber sistem berinteraksi dengan kesukaran tugas dan penggunaan alat. Abstrak melaporkan nisbah agregat dan perbandingan peringkat segera tetapi tidak mengenal pasti jenis tugas yang menyebabkan perbezaan terbesar. Maklumat itu akan membantu menentukan sama ada keputusan mencerminkan sifat umum sistem atau corak khusus untuk beban kerja yang dinilai. Sehingga itu, pengambilan yang paling kukuh disokong ialah penilaian ejen harus melaporkan hasil yang disahkan bersama-sama dengan penggunaan sumber yang diperhatikan dan asal pemarkahan.