Apa yang terjadi
Forbes melaporkan bahwa pemanfaatan perangkat lunak AVO Nvidia memungkinkan Anthropic Opus 5 menyelesaikan setiap level dalam set tolok ukur publik ARC-AGI-3 tanpa melatih ulang atau menyempurnakan model. Artikel ini mengaitkan peningkatan tersebut dengan memori persisten, pengawasan, perencanaan berulang dan pemulihan kesalahan, serta alat yang dapat ditukar di sekitar model.
Forbes melaporkan pada 24 Agustus bahwa sistem AVO Nvidia membantu Anthropic Opus 5 Claude berpindah dari menyelesaikan sekitar 30% tugas yang ditetapkan publik ARC-AGI-3 menjadi menyelesaikan 100%. Artikel tersebut mengatakan bahwa model itu sendiri tidak dilatih ulang atau disempurnakan dan tidak ada bobot model yang diubah. Oleh karena itu, peningkatan yang dilaporkan berasal dari perangkat lunak yang beroperasi di sekitar model. Forbes menyajikan hasilnya sebagai kelanjutan dari benchmark AVO yang dilaporkan sebelumnya oleh Nvidia, namun menambahkan rincian tentang model yang mendasarinya dan jumlah tindakan yang dilaporkan.
Menurut Forbes, ARC-AGI-3 menempatkan agen dalam lingkungan seperti permainan tanpa instruksi, aturan, atau tujuan yang dinyatakan secara eksplisit. Agen harus menyimpulkan apa yang dibutuhkan setiap lingkungan melalui trial and error. Forbes mengatakan kumpulan publik berisi 25 lingkungan, dengan masing-masing enam hingga 10 level dan 183 level secara keseluruhan. Dilaporkan bahwa AVO menyelesaikan tingkat publik dalam 6.624 tindakan, sekitar 12% lebih sedikit dari sistem paling efisien sebelumnya. Angka-angka ini menggambarkan tolok ukur masyarakat; artikel tersebut mengatakan bahwa set kompetisi swasta masih merupakan ujian yang lebih sulit.
Forbes menggambarkan AVO sebagai sistem “operator variasi agen”, atau harness, dengan empat elemen utama: memori persisten, supervisor, loop kerja berulang, dan alat yang dapat ditukar. Ingatan meneruskan apa yang telah dicoba dan dipelajari oleh agen. Supervisor dapat melakukan intervensi ketika kemajuan terhenti. Loop berulang kali memeriksa situasi, merencanakan, bertindak, dan mengevaluasi hasilnya. Alat dapat diubah untuk tugas yang berbeda. Forbes mengatakan Nvidia pertama kali menggunakan sistem untuk mengoptimalkan kode GPU dan kemudian mengganti alat kodenya dengan kontrol permainan, membingkai hasil benchmark sebagai bukti bahwa arsitektur tidak terbatas pada satu tugas.
Artikel Forbes yang disediakan adalah laporan sekunder oleh kontributor yang halamannya menggambarkan karya tersebut sebagai analisis dan wawasan pakar independen. Oleh karena itu, skor benchmark, jumlah tindakan, desain sistem, dan penerapan Claude Opus 5 dikaitkan dengan Forbes dalam artikel ini dan tidak dikonfirmasi secara independen oleh materi sumber yang disediakan. Sumber tidak memberikan catatan evaluasi yang dapat direproduksi, makalah, implementasi lengkap, atau pengujian independen atas hasil yang diklaim.
Mengapa itu penting
Laporan tersebut menggambarkan bagaimana kinerja agen dapat bergantung pada sistem perangkat lunak di sekitar model, tidak hanya pada bobot model atau skor tolok ukur. Jika direproduksi, hasilnya dapat menjadikan memori, perencanaan, penggunaan alat, dan pemulihan sebagai prioritas rekayasa pusat bagi organisasi yang menerapkan AI pada tugas-tugas jangka panjang.
Laporan ini memfokuskan perhatian pada perbedaan yang penting bagi AI yang diterapkan: kualitas respons terisolasi suatu model tidak sama dengan kemampuan agen untuk menyelesaikan tugas yang panjang. Sebuah model mungkin menghasilkan langkah-langkah individual yang berguna namun gagal karena model tersebut melupakan upaya sebelumnya, mengulangi kesalahan, kehilangan jejak tujuan, atau tidak dapat pulih setelah tindakan yang gagal. Forbes berpendapat bahwa AVO menargetkan mode kegagalan tingkat sistem ini melalui memori, pengawasan, dan evaluasi berulang. Ini adalah klaim rekayasa praktis, bukan bukti bahwa pendekatan tersebut akan bekerja dengan baik di luar tolok ukur.
Jika perhitungan Forbes akurat, hasilnya menunjukkan bahwa orkestrasi perangkat lunak dapat membuka kemampuan yang sudah ada dalam suatu model tanpa biaya atau penundaan dalam pelatihan model frontier baru. Hal ini dapat mengalihkan persaingan ke arah tim yang membangun runtime agen, sistem memori, antarmuka alat, mekanisme pemantauan dan pemulihan. Hal ini juga berarti bahwa membandingkan model tanpa menentukan rangkaian kabel di sekitarnya mungkin memberikan gambaran yang tidak lengkap tentang apa yang sebenarnya dialami pengguna. Unit kinerja yang relevan mungkin merupakan kombinasi model-plus-sistem.
Dampaknya terhadap publik masih belum pasti. ARC-AGI-3 dirancang untuk menguji adaptasi terhadap lingkungan asing, yang relevan dengan agen tujuan umum, namun keberhasilan dalam lingkungan seperti permainan tidak menghasilkan kinerja yang dapat diandalkan di tempat kerja, layanan publik, atau operasi yang kritis terhadap keselamatan. Forbes menghubungkan tolok ukur ini dengan masalah adopsi perusahaan dan mengutip perkiraan MIT NANDA bahwa hanya sekitar 5% dari inisiatif AI perusahaan yang diteliti menghasilkan nilai bisnis yang terukur meskipun terdapat pengeluaran sebesar $30 miliar hingga $40 miliar. Angka-angka tersebut dan penjelasan artikel mengenai penyebabnya dilaporkan oleh Forbes namun tidak diverifikasi secara independen di sini.
Dampaknya mungkin akan meningkatkan, bukannya mengurangi, permintaan akan komputasi. Agen gigih yang berulang kali merencanakan, bertindak, mengevaluasi, dan memulihkan dapat melakukan lebih banyak panggilan model dibandingkan pertukaran chatbot singkat. Penyelesaian yang lebih andal dapat membuat penggunaan AI tambahan menarik secara ekonomi, namun sumber yang disediakan tidak menghitung biaya inferensi, latensi, kebutuhan memori, atau penggunaan energi AVO. Tanpa angka-angka tersebut, tidak mungkin untuk menentukan apakah peningkatan efisiensi yang dilaporkan berarti total biaya operasional yang lebih rendah.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Apa yang harus ditonton selanjutnya
Pertanyaan kuncinya adalah apakah hasilnya dapat direproduksi secara independen, seberapa besar keuntungan yang didapat berasal dari AVO dibandingkan Claude Opus 5 itu sendiri, dan apakah pendekatan tersebut dapat ditransfer ke kerja praktek. Sumber yang dipasok tidak menentukan kinerja perangkat swasta, keandalan perusahaan secara umum, biaya pengoperasian, atau ketersediaan luas.
Replikasi independen adalah prioritas pertama. Peninjau harus mencari konfigurasi Claude Opus 5 yang tepat, implementasi AVO, izin alat, konten memori, aturan penghentian, penghitungan tindakan, dan protokol benchmark. Tingkat penyelesaian 100% pada set publik dapat bermakna namun tetap sensitif terhadap pilihan penyiapan. Artikel Forbes yang disediakan tidak menentukan apakah peneliti luar telah mereproduksi hasilnya atau apakah lingkungan tolok ukur dan prosedur evaluasi diaudit secara independen.
Kontribusi masing-masing komponen juga perlu dipisahkan. Laporan tersebut mengaitkan peningkatan tersebut dengan harness lengkap, namun tidak menunjukkan hasil ablasi untuk memori persisten, supervisor, loop berulang, atau alat yang dapat ditukar. Oleh karena itu, tidak diketahui elemen mana yang paling penting, apakah sistem menambahkan overhead inferensi yang besar, dan apakah peningkatan serupa akan muncul pada model lain. Perbandingan harus membedakan model dasar, model dengan loop agen sederhana dan sistem AVO lengkap.
Kinerja pada set ARC-AGI-3 pribadi dan pada tugas-tugas yang tidak terkait akan menjadi penting. Forbes mengatakan lingkungan publik bukanlah tempat pembuktian akhir, namun tidak memberikan skor yang ditetapkan secara pribadi. Bukti di masa depan harus menguji alur kerja perangkat lunak yang tidak biasa, tugas penelitian, dan pengaturan lain di mana tujuan, keadaan, dan umpan balik lebih rumit daripada yang ada dalam tolok ukur. Hasil yang paling berguna adalah melaporkan tingkat keberhasilan dan biaya kegagalan, termasuk tindakan yang diambil, waktu, intervensi manusia, dan panggilan model.
Terakhir, sumber tersebut tidak menetapkan ketersediaan produk, perizinan, penerapan pelanggan, atau hasil perusahaan. Penggunaan AVO internal yang dilaporkan Nvidia untuk pengoptimalan kode GPU tidak sama dengan produk yang tersedia secara umum. Pembaca juga harus berhati-hati dengan kesimpulan investor dan perusahaan yang lebih luas dari artikel ini, termasuk pembahasannya mengenai perusahaan yang diposisikan untuk mendapatkan manfaat dari perangkat lunak agen. Itu adalah analisis Forbes, bukan hasil pasar yang ditunjukkan secara independen. Pertanyaan utama yang belum terselesaikan adalah apakah sistem pemanfaatan yang terdepan dalam tolok ukur dapat menjadi sistem yang dapat diandalkan, terjangkau, dan dapat diaudit untuk pekerjaan nyata.