Apa yang terjadi
Para peneliti memperkenalkan RoboPhys-3D, sebuah tolok ukur untuk mengevaluasi model dunia yang diwujudkan melalui rekonstruksi 3D, pemahaman negara, dan pengukuran tingkat tugas. Tolok ukur ini mencakup 50 tugas manipulasi, 5.000 episode, dan 25.000 video kebenaran dasar multi-tayangan. Makalah ini melaporkan bahwa Cosmos 3 mencapai RoboPhyscore tertinggi di antara empat model dunia video yang diuji, sementara metrik berbasis eksekusi mengungkap kelemahan yang tidak dapat ditangkap oleh penilaian model persepsi dan bahasa visi.
Makalah yang dikirimkan ke arXiv pada 28 Agustus 2026 memperkenalkan RoboPhys-3D sebagai tolok ukur untuk model dunia yang diwujudkan. Penulis membingkai permasalahan pada model dunia video yang digunakan sebagai mesin data, perencana tindakan, dan simulator untuk mewujudkan AI. Kritik mereka adalah bahwa evaluasi model dunia yang diwujudkan secara konvensional tidak memberikan protokol terpadu yang didasarkan pada struktur adegan tiga dimensi dan tindakan yang dapat dieksekusi. RoboPhys-3D dibangun di atas RoboTwin 2.0 dan mencakup 50 tugas manipulasi di empat rezim, dengan 5.000 episode dan 25.000 video kebenaran lapangan multi-tayangan.
Proses menghasilkan video dan video kebenaran lapangan melalui jalur rekonstruksi 3D yang sama. Menurut makalah tersebut, desain ini dimaksudkan untuk memisahkan kesalahan yang disebabkan oleh proses rekonstruksi dari kesalahan yang disebabkan oleh video yang dihasilkan. RoboPhys-3D mengelompokkan 50 metrik ke dalam 18 subdimensi dan empat tingkat evaluasi: fidelitas tingkat piksel, konsistensi geometri 3D, pemahaman tingkat negara bagian, dan penyelesaian tingkat tugas. Penulis juga memperkenalkan Skor Penuh Rata-rata, yang menghitung rata-rata seluruh 50 metrik, dan RoboPhyscore, skor penyesuaian tugas yang lebih kecil berdasarkan metrik yang mereka laporkan sebagai korelasi paling kuat dengan keberhasilan tugas.
Abstrak melaporkan hasil untuk empat model dunia video yang representatif. Cosmos 3 menerima RoboPhyscore tertinggi, dengan skor 0,6330, yang digambarkan sebagai 92,7% dari skor kebenaran dasar. Makalah ini mengatakan bahwa langkah-langkah yang didasarkan pada negara dan pelaksanaan eksekusi mengungkapkan kegagalan besar yang tidak ditangkap oleh metrik persepsi atau penilaian dari model bahasa visi. Laporan ini juga melaporkan kesesuaian yang kuat antara RoboPhyscore dan evaluasi manusia, dengan korelasi Pearson sebesar 0,9761 dan korelasi Spearman sebesar 0,8962. Ini adalah klaim dari pracetak arXiv versi satu; sumber tidak memberikan verifikasi independen atau rincian eksperimental lengkap di balik abstrak.
Mengapa itu penting
Pekerjaan ini mengatasi masalah utama dalam AI yang diwujudkan: video yang dihasilkan dapat terlihat meyakinkan meskipun menyajikan adegan yang salah atau gagal mendukung tindakan yang dapat digunakan. Tolok ukur yang menghubungkan prediksi visual dengan keadaan 3D dan penyelesaian tugas dapat memberi peneliti cara yang lebih praktis untuk membandingkan sistem, meskipun makalah ini masih berupa pracetak dan abstrak tidak menetapkan kinerja pada robot fisik atau di luar pengaturan tolok ukurnya.
Kontribusi utama makalah ini adalah upaya untuk mengukur lebih dari sekadar apakah peluncuran yang dilakukan tampak masuk akal. Untuk sistem yang dimaksudkan untuk memandu robot, kemiripan visual saja mungkin tidak cukup jika prediksi geometri, keadaan objek, atau urutan tindakan salah. Dengan menyertakan konsistensi 3D dan kelengkapan tingkat tugas serta fidelitas tingkat piksel, RoboPhys-3D dapat membantu memisahkan pembuatan video yang menarik dari prediksi yang menjaga informasi yang diperlukan untuk perencanaan dan pelaksanaan. Perbedaan tersebut secara langsung relevan dengan cara sistem AI dievaluasi dan ditingkatkan.
rekonstruksi bersama berpotensi berguna karena memberikan video yang dihasilkan dan referensi proses pengukuran yang umum. Jika artefak rekonstruksi mempengaruhi kedua sisi perbandingan dengan cara yang sebanding, peneliti mungkin akan lebih mampu mengidentifikasi apakah skor yang rendah mencerminkan masalah dalam model dunia atau dalam evaluator. Sumber tersebut hanya menyatakan bahwa pipeline memungkinkan perbedaan ini; hal ini tidak membuktikan bahwa pemisahan tersebut sempurna atau bahwa setiap kegagalan rekonstruksi dapat didiagnosis dengan andal.
Hubungan yang dilaporkan antara RoboPhyscore dan evaluasi manusia menunjukkan bahwa skor kompak yang diusulkan dapat melacak penilaian manusia dalam lingkungan yang diuji. Jika direplikasi, skor yang diselaraskan dengan tugas dapat membuat perbandingan menjadi lebih mudah dibandingkan melaporkan lusinan metrik yang tidak terkait. Namun, bukti-bukti tersebut masih dibatasi oleh tolok ukur makalah tersebut, empat model representatif, dan desain evaluasi yang disebutkan. Sumber tersebut tidak menunjukkan bahwa RoboPhyscore yang tinggi menjamin keberhasilan manipulasi fisik, menggeneralisasi lingkungan yang tidak terlihat, atau memprediksi kinerja dalam penerapan yang sangat penting bagi keselamatan.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Langkah penting berikutnya adalah replikasi independen, publikasi tugas rinci dan prosedur evaluasi, serta bukti bahwa RoboPhyscore memprediksi kinerja di lingkungan baru atau pada perangkat keras sebenarnya. Pembaca juga harus memperhatikan apakah peringkat model tetap stabil di seluruh jenis tugas, bagaimana kesalahan rekonstruksi memengaruhi skor, dan apakah kesesuaian yang dilaporkan dengan evaluasi manusia dapat diterapkan dalam pengujian yang lebih luas.
Nilai praktis tolok ukur ini akan bergantung pada detail yang tidak disertakan dalam abstrak sumber: identitas dan konfigurasi keempat model yang diuji, skema tugas yang tepat, 50 metrik, implementasi rekonstruksi, dan kriteria yang digunakan untuk mengidentifikasi metrik yang berkorelasi dengan keberhasilan tugas. Detail tersebut penting untuk replikasi dan untuk menilai apakah RoboPhyscore mengukur kemampuan yang luas atau sangat sesuai dengan distribusi tugas tolok ukur.
Hal utama yang tidak diketahui adalah transfer di luar rekaman video dan episode simulasi atau yang diwakili oleh RoboTwin 2.0. Sumbernya tidak melaporkan pengujian pada robot fisik, lingkungan baru, kebisingan sensor, batasan waktu nyata, atau pengaturan objek asing. Pekerjaan tindak lanjut harus menguji apakah skor memprediksi keberhasilan tindakan dalam kondisi tersebut, di mana kesalahan kecil dalam geometri atau keadaan dapat menimbulkan konsekuensi yang lebih besar dibandingkan dengan evaluasi offline.
Peneliti juga harus memeriksa seberapa stabil peringkat model yang dilaporkan. Abstrak memberikan RoboPhyscore Cosmos 3 tetapi tidak mengidentifikasi skor sistem lain, rentang ketidakpastian, atau variasi per tugas. Versi masa depan dan studi independen dapat menunjukkan apakah evaluasi model persepsi dan bahasa visi secara konsisten gagal mencapai tingkat kegagalan yang sama, apakah pilihan rekonstruksi secara signifikan mengubah peringkat, dan apakah model dapat mengoptimalkan tolok ukur tanpa meningkatkan pelaksanaan di dunia nyata. Korelasi Pearson dan Spearman yang dilaporkan juga memerlukan replikasi pada sampel pemeringkatan manusia yang lebih luas dan kumpulan tugas yang berbeda.