Apa yang terjadi
Para peneliti memperkenalkan AutoWorldModel-Bench, sebuah tolok ukur loop tertutup di mana agen pengkodean memodifikasi dan mengevaluasi model dunia awal dengan anggaran komputasi tetap. Tolok ukur ini menggunakan status permainan kebenaran dasar yang terstruktur, bukan masukan visual mentah, dan mencakup delapan lingkungan permainan. Penulis melaporkan bahwa Codex-5.4 dan Claude Opus 4.6 meningkatkan model permulaannya dalam 63 dari 64 sesi, dengan 91% pengeditan yang menang digambarkan sebagai perubahan gaya penelitian yang substantif, bukan penyesuaian .
Makalah ini, yang diserahkan ke arXiv pada tanggal 20 Juli 2026, menyajikan AutoWorldModel-Bench sebagai tolok ukur untuk penelitian model dunia otomatis. Hal ini membingkai pemodelan dunia sebagai sebuah area yang belum terselesaikan di mana arsitektur, tujuan pelatihan, dan representasi negara berinteraksi, tanpa ada resep tunggal yang dianggap dominan di seluruh lingkungan. Ketidakpastian tersebut merupakan inti dari tujuan : agen tidak hanya diminta untuk menerapkan spesifikasi yang telah ditentukan, namun untuk memutuskan bagaimana starter model dunia yang disediakan harus ditingkatkan.
Tolok ukur beroperasi sebagai loop tertutup. Agen pengkode menerima sistem permulaan, mengusulkan dan mengimplementasikan perubahan, menjalankan evaluasi berdasarkan anggaran komputasi tetap, dan melanjutkan proses penelitian. Abstraknya menyatakan bahwa tolok ukur tersebut mencakup delapan lingkungan game dan mewakili setiap lingkungan melalui status entitas kebenaran dasar yang diekstraksi dari game tersebut. Status tersebut diubah menjadi format tensor bersama, sehingga evaluasi dapat fokus pada pemodelan dinamika lingkungan, bukan pada persepsi visual atau teknik yang diperlukan untuk memproses gambar.
Dalam 64 sesi, penulis melaporkan bahwa Codex-5.4 dan Claude Opus 4.6 meningkatkan starter mereka dalam 63 sesi. Abstrak tidak merinci ukuran atau signifikansi statistik dari peningkatan tersebut, bagaimana sesi dibagi antara kedua sistem, atau apakah agen diberi kondisi awal yang sama. Laporan ini juga melaporkan bahwa 91% hasil edit yang menang merupakan modifikasi gaya penelitian yang tidak sepele, termasuk perubahan pada tujuan, representasi, prosedur peluncuran, atau arsitektur, dan bukan perubahan sederhana.
Hasil ini menetapkan apa yang penulis katakan terjadi dalam tolok ukur yang dilaporkan, namun sumber yang diberikan adalah halaman abstrak dan bibliografi untuk pracetak arXiv versi pertama. Di sini informasi yang diberikan tidak cukup untuk memverifikasi implementasi secara independen, protokol evaluasi, batas komputasi, identitas delapan lingkungan, atau hasil tingkat sesi yang mendasarinya. Tidak ada klaim dalam sumber yang menunjukkan bahwa salah satu agen tersebut adalah ilmuwan otonom yang memiliki kemampuan luas di luar pengaturan ini.
Mengapa itu penting
Tolok ukur ini menargetkan kesenjangan dalam evaluasi yang ada: apakah sistem AI dapat membuat keputusan penelitian yang berguna ketika jalur menuju perbaikan tidak ditentukan sebelumnya. Desain keadaan terstrukturnya mungkin membuat eksperimen lebih cepat dan mengisolasi pemodelan dinamika dari persepsi, namun juga membatasi apa yang dikatakan hasil tentang agen yang bekerja dengan data sensorik dunia nyata. Temuan yang dilaporkan adalah klaim dari satu pracetak arXiv, bukan bukti independen bahwa agen pengkode dapat melakukan penelitian yang dapat diandalkan secara umum.
Sebagian besar tolok ukur agen pengkodean menekankan tugas-tugas rekayasa-ke-spesifikasi: perilaku yang diinginkan ditentukan sebelumnya, dan keberhasilan sebagian besar adalah masalah menghasilkan implementasi yang benar. AutoWorldModel-Bench membahas kemampuan yang berbeda. Ini meminta agen untuk beroperasi dalam situasi di mana peneliti belum menentukan perbaikan berikutnya, sehingga hasilnya mungkin relevan dengan cara sistem AI menghasilkan, menguji, dan memilih hipotesis teknis.
Desain yang berpusat pada negara menawarkan keunggulan pengukuran praktis. Penggunaan status entitas terstruktur menghindari biaya dan variabel persepsi yang membingungkan, yang menurut abstrak memungkinkan iterasi dalam hitungan menit. Iterasi yang lebih cepat dapat mempermudah perbandingan strategi penelitian, mereproduksi eksperimen, dan mempelajari cara agen menggunakan komputasi terbatas. Representasi tensor yang umum juga dapat membuat perbedaan dalam pemodelan dinamika lebih terlihat di berbagai lingkungan.
Rancangan tersebut juga merupakan batasan penting pada temuan. Model dunia yang dilatih berdasarkan keadaan kebenaran di lapangan tidak memecahkan seluruh masalah yang dihadapi oleh sistem yang harus menyimpulkan keadaan dari kamera, bahasa, sensor, atau observasi yang tidak lengkap. Lingkungan permainan memberikan umpan balik yang terkendali dan konsekuensi yang terbatas, sementara lingkungan ilmiah dan operasional yang sebenarnya dapat melibatkan pengukuran yang bising, eksperimen yang mahal, perubahan tujuan, dan batasan keselamatan. Oleh karena itu, tolok ukur yang dilaporkan mengukur kemampuan yang lebih sempit dibandingkan penelitian otonom umum.
Tingkat pengeditan substantif yang dilaporkan dalam makalah ini berpotensi lebih informatif daripada peningkatan skor sederhana karena hal ini menunjukkan bahwa agen terkadang memilih perubahan pada pengaturan penelitian itu sendiri. Namun, abstrak tidak menjelaskan bagaimana suatu suntingan diklasifikasikan sebagai nontrivial, apakah peninjau independen membuat penilaian tersebut, atau seberapa sering suntingan yang rumit menghasilkan perbaikan yang tahan lama. Perubahan yang berhasil dalam satu lingkungan yang terkendali adalah bukti kinerja tolok ukur, bukan bukti bahwa agen memahami ilmu pengetahuan yang mendasarinya atau dapat dengan andal membedakan hipotesis produktif dari keuntungan yang tidak disengaja.
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
crm_get_transaction(id='4092').What is the best response when AI Models Explained makes a mistake in production?
Apa yang harus ditonton selanjutnya
Pertanyaan utamanya adalah apakah tolok ukur tersebut dapat direproduksi, seberapa besar peningkatan yang diukur, dan apakah hasilnya dapat diterapkan di seluruh agen tambahan, lingkungan, anggaran komputasi, dan model awal. Pembaca juga harus mencari detail tentang prosedur penilaian, sesi yang gagal, pilihan edit, dan garis dasar optimasi manusia atau konvensional. Sumber tidak menentukan bagaimana metode ini ditransfer ke luar lingkungan permainan atau apakah perubahan agen tetap berguna dalam kondisi representasi dan evaluasi yang berbeda.
Reproduksibilitas akan menjadi tes pertama. Detail penting mencakup model dunia awal yang tepat, delapan lingkungan, skema keadaan umum, anggaran komputasi, jumlah iterasi yang diizinkan, dan metrik evaluasi. Penting juga untuk mengetahui apakah dan log eksperimen lengkap tersedia untuk umum, karena klaim agregat seperti 63 peningkatan dari 64 sesi dapat menyembunyikan perbedaan besar dalam mode perolehan, kesulitan, atau kegagalan.
Evaluasi di masa depan harus melaporkan perbandingan di luar dua sistem yang disebutkan dalam abstrak. Kontrol yang berguna akan mencakup peneliti manusia, pencarian otomatis standar, heuristik penelitian tetap, dan agen pengkodean tambahan. Hasil harus dipisahkan berdasarkan lingkungan dan jenis pengeditan, dengan besaran dan ketidakpastian setiap perbaikan yang ditampilkan. Tanpa perbandingan tersebut, sulit untuk mengetahui apakah tolok ukur tersebut mengukur penilaian penelitian, kompetensi pengkodean yang luas, struktur tugas yang disukai, atau kombinasi lainnya.
Klasifikasi suntingan gaya penelitian patut dicermati. Perubahan arsitektur, tujuan, representasi, dan peluncuran bisa bermakna, namun kompleksitas saja tidak menunjukkan wawasan. Pekerjaan tindak lanjut harus menguji apakah modifikasi yang dipilih dapat digeneralisasikan ke lingkungan yang sudah ada, bertahan dari perubahan pada model awal, dan terus berfungsi ketika anggaran komputasi atau ruang tindakan berubah. Ini juga harus melacak regresi dan ide-ide yang gagal, tidak hanya hasil edit yang menang dari setiap sesi.
Terakhir, pembaca harus memperhatikan bukti tentang perpindahan ke lingkungan yang kurang terkontrol. Sumber tidak menetapkan kinerja dengan observasi visual, informasi parsial, sistem fisik, kumpulan data ilmiah, atau tugas yang eksperimennya memerlukan biaya nyata. Hal ini juga tidak membahas perlindungan, reproduktifitas kode yang dihasilkan agen, atau risiko bahwa agen mengeksploitasi kebiasaan dalam suatu tolok ukur. Sampai pertanyaan-pertanyaan tersebut terjawab, AutoWorldModel-Bench paling baik dipahami sebagai instrumen penelitian terfokus untuk mempelajari peningkatan model terbuka, bukan sebagai demonstrasi penelitian ilmiah otonom yang dapat diandalkan.