Kembali ke Berita
InovasiAI Understanding pengarahan

Forbes melaporkan memanfaatkan AVO Nvidia membantu Claude Opus 5 mencapai 100% pada ARC-AGI-3

Forbes melaporkan bahwa agen AVO Nvidia meningkatkan tingkat penyelesaian Claude Opus 5 di perangkat publik ARC-AGI-3 dari sekitar 30% menjadi 100% tanpa mengubah bobot model. Hasilnya secara signifikan memajukan laporan yang ada tentang sistem AVO Nvidia, namun klaim artikel yang disertakan tidak dikonfirmasi secara independen…

6 min readRead the original reporting
Source-provided image accompanying Forbes reports Nvidia’s AVO harness helped Claude Opus 5 reach 100% on ARC-AGI-3
Pelaporan yang diatribusikanSumber direkam
Penerbit
forbes.com
Tautan sumber
forbes.comhttps://www.forbes.com/sites/jonmarkman/2026/08/24/nvidia-avo-pushes-claude-opus-5-to-a-perfect-arc-agi-3-benchmark-score/
Jenis sumber
Pelaporan oleh outlet berita — bukan dokumen pihak pertama.
Juga dikutip

Yang belum bisa kami konfirmasi secara independen: Klaim ini dikaitkan dengan outlet bernama. Kami tidak memverifikasinya terhadap dokumen pihak pertama. (forbes.com)

Cerita terakhir direvisi

KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

AGI (Kecerdasan Umum Buatan)
Sistem AI hipotetis yang dapat melakukan sebagian besar tugas intelektual pada tingkat manusia di banyak domain.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Penyempurnaan
Melanjutkan pelatihan pada data spesifik domain untuk mengadaptasi model yang telah dilatih sebelumnya ke tugas tertentu.
Uji diri Anda sendiriKuis Agen AI

Apa yang berubah sejak publikasi

  1. Pertama kali diterbitkan
  2. Forbes secara signifikan memajukan laporan benchmark AVO yang ada dengan mengaitkan hasilnya dengan Claude Opus 5, melaporkan peningkatan dari sekitar 30% penyelesaian menjadi 100% pada perangkat publik ARC-AGI-3, mengutip 6,624 tindakan dan efisiensi sekitar 12% lebih besar dibandingkan sistem terdepan sebelumnya, dan merinci memori AVO, supervisor, loop berulang, dan arsitektur alat yang dapat ditukar. Artikel yang disediakan tidak secara independen mengkonfirmasi klaim ini atau menetapkan kinerja perangkat pribadi, ketersediaan penerapan, atau keandalan perusahaan.

Apa yang terjadi

Forbes melaporkan bahwa pemanfaatan perangkat lunak AVO Nvidia memungkinkan Anthropic Opus 5 menyelesaikan setiap level dalam set tolok ukur publik ARC-AGI-3 tanpa melatih ulang atau menyempurnakan model. Artikel ini mengaitkan peningkatan tersebut dengan memori persisten, pengawasan, perencanaan berulang dan pemulihan kesalahan, serta alat yang dapat ditukar di sekitar model.

Forbes melaporkan pada 24 Agustus bahwa sistem AVO Nvidia membantu Anthropic Opus 5 Claude berpindah dari menyelesaikan sekitar 30% tugas yang ditetapkan publik ARC-AGI-3 menjadi menyelesaikan 100%. Artikel tersebut mengatakan bahwa model itu sendiri tidak dilatih ulang atau disempurnakan dan tidak ada bobot model yang diubah. Oleh karena itu, peningkatan yang dilaporkan berasal dari perangkat lunak yang beroperasi di sekitar model. Forbes menyajikan hasilnya sebagai kelanjutan dari benchmark AVO yang dilaporkan sebelumnya oleh Nvidia, namun menambahkan rincian tentang model yang mendasarinya dan jumlah tindakan yang dilaporkan.

Menurut Forbes, ARC-AGI-3 menempatkan agen dalam lingkungan seperti permainan tanpa instruksi, aturan, atau tujuan yang dinyatakan secara eksplisit. Agen harus menyimpulkan apa yang dibutuhkan setiap lingkungan melalui trial and error. Forbes mengatakan kumpulan publik berisi 25 lingkungan, dengan masing-masing enam hingga 10 level dan 183 level secara keseluruhan. Dilaporkan bahwa AVO menyelesaikan tingkat publik dalam 6.624 tindakan, sekitar 12% lebih sedikit dari sistem paling efisien sebelumnya. Angka-angka ini menggambarkan tolok ukur masyarakat; artikel tersebut mengatakan bahwa set kompetisi swasta masih merupakan ujian yang lebih sulit.

Forbes menggambarkan AVO sebagai sistem “operator variasi agen”, atau harness, dengan empat elemen utama: memori persisten, supervisor, loop kerja berulang, dan alat yang dapat ditukar. Ingatan meneruskan apa yang telah dicoba dan dipelajari oleh agen. Supervisor dapat melakukan intervensi ketika kemajuan terhenti. Loop berulang kali memeriksa situasi, merencanakan, bertindak, dan mengevaluasi hasilnya. Alat dapat diubah untuk tugas yang berbeda. Forbes mengatakan Nvidia pertama kali menggunakan sistem untuk mengoptimalkan kode GPU dan kemudian mengganti alat kodenya dengan kontrol permainan, membingkai hasil benchmark sebagai bukti bahwa arsitektur tidak terbatas pada satu tugas.

Artikel Forbes yang disediakan adalah laporan sekunder oleh kontributor yang halamannya menggambarkan karya tersebut sebagai analisis dan wawasan pakar independen. Oleh karena itu, skor benchmark, jumlah tindakan, desain sistem, dan penerapan Claude Opus 5 dikaitkan dengan Forbes dalam artikel ini dan tidak dikonfirmasi secara independen oleh materi sumber yang disediakan. Sumber tidak memberikan catatan evaluasi yang dapat direproduksi, makalah, implementasi lengkap, atau pengujian independen atas hasil yang diklaim.

Detail sumber: forbes.com

Mengapa itu penting

Laporan tersebut menggambarkan bagaimana kinerja agen dapat bergantung pada sistem perangkat lunak di sekitar model, tidak hanya pada bobot model atau skor tolok ukur. Jika direproduksi, hasilnya dapat menjadikan memori, perencanaan, penggunaan alat, dan pemulihan sebagai prioritas rekayasa pusat bagi organisasi yang menerapkan AI pada tugas-tugas jangka panjang.

Laporan ini memfokuskan perhatian pada perbedaan yang penting bagi AI yang diterapkan: kualitas respons terisolasi suatu model tidak sama dengan kemampuan agen untuk menyelesaikan tugas yang panjang. Sebuah model mungkin menghasilkan langkah-langkah individual yang berguna namun gagal karena model tersebut melupakan upaya sebelumnya, mengulangi kesalahan, kehilangan jejak tujuan, atau tidak dapat pulih setelah tindakan yang gagal. Forbes berpendapat bahwa AVO menargetkan mode kegagalan tingkat sistem ini melalui memori, pengawasan, dan evaluasi berulang. Ini adalah klaim rekayasa praktis, bukan bukti bahwa pendekatan tersebut akan bekerja dengan baik di luar tolok ukur.

Jika perhitungan Forbes akurat, hasilnya menunjukkan bahwa orkestrasi perangkat lunak dapat membuka kemampuan yang sudah ada dalam suatu model tanpa biaya atau penundaan dalam pelatihan model frontier baru. Hal ini dapat mengalihkan persaingan ke arah tim yang membangun runtime agen, sistem memori, antarmuka alat, mekanisme pemantauan dan pemulihan. Hal ini juga berarti bahwa membandingkan model tanpa menentukan rangkaian kabel di sekitarnya mungkin memberikan gambaran yang tidak lengkap tentang apa yang sebenarnya dialami pengguna. Unit kinerja yang relevan mungkin merupakan kombinasi model-plus-sistem.

Dampaknya terhadap publik masih belum pasti. ARC-AGI-3 dirancang untuk menguji adaptasi terhadap lingkungan asing, yang relevan dengan agen tujuan umum, namun keberhasilan dalam lingkungan seperti permainan tidak menghasilkan kinerja yang dapat diandalkan di tempat kerja, layanan publik, atau operasi yang kritis terhadap keselamatan. Forbes menghubungkan tolok ukur ini dengan masalah adopsi perusahaan dan mengutip perkiraan MIT NANDA bahwa hanya sekitar 5% dari inisiatif AI perusahaan yang diteliti menghasilkan nilai bisnis yang terukur meskipun terdapat pengeluaran sebesar $30 miliar hingga $40 miliar. Angka-angka tersebut dan penjelasan artikel mengenai penyebabnya dilaporkan oleh Forbes namun tidak diverifikasi secara independen di sini.

Dampaknya mungkin akan meningkatkan, bukannya mengurangi, permintaan akan komputasi. Agen gigih yang berulang kali merencanakan, bertindak, mengevaluasi, dan memulihkan dapat melakukan lebih banyak panggilan model dibandingkan pertukaran chatbot singkat. Penyelesaian yang lebih andal dapat membuat penggunaan AI tambahan menarik secara ekonomi, namun sumber yang disediakan tidak menghitung biaya inferensi, latensi, kebutuhan memori, atau penggunaan energi AVO. Tanpa angka-angka tersebut, tidak mungkin untuk menentukan apakah peningkatan efisiensi yang dilaporkan berarti total biaya operasional yang lebih rendah.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Pemeriksaan Konsep Interaktif+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Apa yang harus ditonton selanjutnya

Pertanyaan kuncinya adalah apakah hasilnya dapat direproduksi secara independen, seberapa besar keuntungan yang didapat berasal dari AVO dibandingkan Claude Opus 5 itu sendiri, dan apakah pendekatan tersebut dapat ditransfer ke kerja praktek. Sumber yang dipasok tidak menentukan kinerja perangkat swasta, keandalan perusahaan secara umum, biaya pengoperasian, atau ketersediaan luas.

Replikasi independen adalah prioritas pertama. Peninjau harus mencari konfigurasi Claude Opus 5 yang tepat, implementasi AVO, izin alat, konten memori, aturan penghentian, penghitungan tindakan, dan protokol benchmark. Tingkat penyelesaian 100% pada set publik dapat bermakna namun tetap sensitif terhadap pilihan penyiapan. Artikel Forbes yang disediakan tidak menentukan apakah peneliti luar telah mereproduksi hasilnya atau apakah lingkungan tolok ukur dan prosedur evaluasi diaudit secara independen.

Kontribusi masing-masing komponen juga perlu dipisahkan. Laporan tersebut mengaitkan peningkatan tersebut dengan harness lengkap, namun tidak menunjukkan hasil ablasi untuk memori persisten, supervisor, loop berulang, atau alat yang dapat ditukar. Oleh karena itu, tidak diketahui elemen mana yang paling penting, apakah sistem menambahkan overhead inferensi yang besar, dan apakah peningkatan serupa akan muncul pada model lain. Perbandingan harus membedakan model dasar, model dengan loop agen sederhana dan sistem AVO lengkap.

Kinerja pada set ARC-AGI-3 pribadi dan pada tugas-tugas yang tidak terkait akan menjadi penting. Forbes mengatakan lingkungan publik bukanlah tempat pembuktian akhir, namun tidak memberikan skor yang ditetapkan secara pribadi. Bukti di masa depan harus menguji alur kerja perangkat lunak yang tidak biasa, tugas penelitian, dan pengaturan lain di mana tujuan, keadaan, dan umpan balik lebih rumit daripada yang ada dalam tolok ukur. Hasil yang paling berguna adalah melaporkan tingkat keberhasilan dan biaya kegagalan, termasuk tindakan yang diambil, waktu, intervensi manusia, dan panggilan model.

Terakhir, sumber tersebut tidak menetapkan ketersediaan produk, perizinan, penerapan pelanggan, atau hasil perusahaan. Penggunaan AVO internal yang dilaporkan Nvidia untuk pengoptimalan kode GPU tidak sama dengan produk yang tersedia secara umum. Pembaca juga harus berhati-hati dengan kesimpulan investor dan perusahaan yang lebih luas dari artikel ini, termasuk pembahasannya mengenai perusahaan yang diposisikan untuk mendapatkan manfaat dari perangkat lunak agen. Itu adalah analisis Forbes, bukan hasil pasar yang ditunjukkan secara independen. Pertanyaan utama yang belum terselesaikan adalah apakah sistem pemanfaatan yang terdepan dalam tolok ukur dapat menjadi sistem yang dapat diandalkan, terjangkau, dan dapat diaudit untuk pekerjaan nyata.

Panduan & kuis terkait

Agen AIModel AI DijelaskanPelatihan AIMasa Depan AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kami

Pembaruan dan koreksi

Kisah kanonik ini diperbarui ketika peristiwa yang berkembang berubah secara signifikan. URL dan tanggal publikasi aslinya tidak pernah berubah.

  • Forbes secara signifikan memajukan laporan benchmark AVO yang ada dengan mengaitkan hasilnya dengan Claude Opus 5, melaporkan peningkatan dari sekitar 30% penyelesaian menjadi 100% pada perangkat publik ARC-AGI-3, mengutip 6,624 tindakan dan efisiensi sekitar 12% lebih besar dibandingkan sistem terdepan sebelumnya, dan merinci memori AVO, supervisor, loop berulang, dan arsitektur alat yang dapat ditukar. Artikel yang disediakan tidak secara independen mengkonfirmasi klaim ini atau menetapkan kinerja perangkat pribadi, ketersediaan penerapan, atau keandalan perusahaan.
Lihat log koreksi publik
Apakah ini berguna?