Apa yang berlaku
Penyelidik memperkenalkan PhysElite, penanda aras multimodal dwibahasa yang direka untuk menguji model bahasa besar pada masalah fizik peringkat Olympiad. Set data mengandungi 11,586 masalah, gambar rajah visual, terbitan penyelesaian Cina-Inggeris dan jawapan akhir. Kertas kerja melaporkan hasil daripada penilaian 18 model bahasa multimodal sumber terbuka dan sumber tertutup, dengan model terkuat mencapai 33.7% ketepatan jawapan.
Makalah ini membentangkan PhysElite sebagai penanda aras untuk penaakulan fizik peringkat Olympiad oleh model bahasa besar multimodal. Ia telah diserahkan kepada arXiv pada 25 Ogos 2026. Penulis berpendapat bahawa penanda aras fizik sedia ada adalah terhad kerana ia tidak mengandungi masalah kesukaran tinggi yang mencukupi dan tidak merangkumi maklumat visual, bidang pengetahuan fizik dan proses penyelesaian langkah demi langkah secara menyeluruh.
Menurut abstrak kertas itu, PhysElite mengandungi 11,586 masalah peringkat Olympiad dalam bahasa Cina dan Inggeris. Setiap masalah dipasangkan dengan gambar rajah visual, terbitan dwibahasa yang dipecahkan kepada langkah-langkah, dan jawapan akhir. Sumber mengatakan set data telah dikeluarkan, walaupun teks yang dibekalkan tidak termasuk pautan destinasi atau menerangkan keperluan lesen, format atau aksesnya.
Penulis menilai 18 model bahasa multimodal, termasuk kedua-dua sistem sumber terbuka dan sumber tertutup. Model terkuat mencapai 33.7% ketepatan jawapan. Para penyelidik juga menjalankan penilaian proses peringkat langkah untuk mengenal pasti di mana model gagal dalam rantaian penaakulan. Sumber tidak memberikan nama model, bilangan percubaan setiap masalah, peraturan pemarkahan atau keputusan terperinci mengikut jenis masalah.
Mengapa ia penting
Hasilnya menunjukkan bahawa prestasi kukuh pada fizik sedia ada atau ujian penaakulan am mungkin tidak diterjemahkan kepada penyelesaian yang boleh dipercayai untuk masalah fizik berbilang langkah yang sukar, bergantung pada rajah. PhysElite bertujuan untuk menjadikan kelemahan tersebut lebih jelas dengan menilai kedua-dua jawapan akhir dan peringkat individu proses penaakulan model.
Penanda aras menangani kelemahan praktikal dalam cara sistem penaakulan AI sering dinilai. Model boleh menghasilkan penjelasan yang fasih atau berprestasi baik pada soalan yang lebih pendek sementara masih gagal apabila ia mesti mentafsir gambar rajah, memilih prinsip fizikal yang berkaitan, menjalankan beberapa potongan berpaut, dan mencapai jawapan yang tepat. PhysElite direka bentuk mengikut cabaran gabungan itu daripada menganggap fizik sebagai jawapan soalan teks sahaja.
Keputusan 33.7% yang dilaporkan adalah berbangkit kerana ia meletakkan had yang jelas pada apa yang ditunjukkan oleh sistem yang diuji pada tugasan yang mempunyai kesukaran tinggi ini. Ia tidak menunjukkan bahawa model bahasa multimodal tidak mampu menyelesaikan fizik Olimpik, dan ia tidak menetapkan bahawa setiap model berprestasi pada tahap yang sama. Ia menunjukkan, menurut kertas itu, walaupun sistem yang dinilai paling kukuh tidak menyelesaikan kebanyakan masalah penanda aras dengan betul.
Penilaian peringkat langkah mungkin lebih berguna daripada skor akhir tunggal untuk penyelidik dan pengguna. Jika kegagalan berlaku terutamanya semasa mentafsir gambar rajah, memilih persamaan, melakukan pengiraan atau menyambungkan hasil perantaraan, pembangun mungkin dapat menyasarkan kelemahan tersebut dengan lebih tepat. Sumber yang dibekalkan tidak menyatakan peringkat mana yang paling banyak menghasilkan ralat, jadi nilai diagnostik penanda aras belum lagi dapat dinilai secara terperinci.
Bagi orang ramai, penemuan ini menawarkan berhati-hati terhadap menganggap sistem AI tujuan umum sebagai pengganti yang boleh dipercayai untuk penaakulan fizik pakar. Sistem yang memberikan penyelesaian berbilang langkah yang munasabah tetapi salah mungkin sukar untuk diperiksa oleh bukan pakar. Reka bentuk dwibahasa dan visual penanda aras juga boleh membantu mendedahkan batasan yang disembunyikan oleh penilaian yang tertumpu pada teks bahasa Inggeris atau format jawapan akhir pendek.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Soalan utama ialah sama ada set data dan kod penilaian boleh diakses secukupnya untuk replikasi bebas, cara prestasi berbeza-beza merentas topik fizik dan format visual, dan sama ada model masa hadapan bertambah baik pada penanda aras tanpa bergantung pada penyelesaian yang dihafal. Sumber tidak mengenal pasti model yang diuji atau memberikan pecahan penilaian, jadi 33.7% yang dilaporkan tidak boleh digunakan untuk memberi kedudukan kepada sistem tertentu.
Replikasi bebas adalah ujian segera. Penyelidik perlu memeriksa masalah, rajah, penyelesaian dan prosedur pemarkahan yang dikeluarkan untuk menentukan sama ada penanda aras bebas daripada kesamaran, item pendua atau faktor lain yang boleh menjejaskan keputusan. Sumber mengesahkan keluaran set data tetapi tidak memberikan maklumat yang mencukupi untuk menilai kebolehcapaian atau kebolehulangannya.
Liputan masa hadapan harus menunjukkan cara pecahan angka 33.7% merentas subjek fizik, tahap kesukaran, jenis rajah, bahasa dan format jawapan. Ia juga penting untuk mengetahui sama ada model menerima gesaan yang sama, sama ada alat seperti kalkulator dibenarkan dan cara kredit separa dikendalikan. Tiada satu pun daripada butiran tersebut muncul dalam sumber yang dibekalkan.
Penanda aras mungkin menjadi lebih bermaklumat jika penilaian kemudian membandingkan versi model dari semasa ke semasa dan melaporkan ketepatan jawapan akhir dan kebolehpercayaan peringkat langkah. Penyelidik juga harus memeriksa sama ada model boleh mengenali ketidakpastian, mengenal pasti langkah perantaraan yang salah, atau meminta penjelasan apabila gambar rajah adalah samar-samar. Abstrak kertas itu tidak melaporkan tingkah laku tersebut.
Perkara yang paling penting yang tidak diketahui ialah bagaimana PhysElite mewakili kerja fizik sebenar. Masalah olimpik sengaja sukar dan mungkin tidak menggambarkan latihan bilik darjah, analisis makmal, reka bentuk kejuruteraan atau amalan penyelidikan. Sumber menetapkan skop penanda aras dan hasil yang dilaporkan, tetapi ia tidak menentukan cara prestasi pada PhysElite meramalkan prestasi dalam tetapan lain tersebut.
Diambil bersama, huraian yang tersedia menyokong tafsiran terhad hasil. Angka 33.7% tergolong dalam penilaian ketepatan jawapan yang dilaporkan bagi 18 model bahasa multimodal yang diuji pada penanda aras ini. Ia harus dibaca bersama-sama masalah dwibahasa set data, gambar rajah visual, terbitan dan jawapan akhir, serta penilaian proses peringkat langkah yang berasingan. Oleh kerana sumber yang dibekalkan tidak termasuk nama model, peraturan pemarkahan, kiraan percubaan, pecahan topik atau kod penilaian, pembaca tidak boleh menggunakan abstrak sahaja untuk membina semula perbandingan atau menentukan bahagian tugasan yang mendorong hasilnya. Oleh itu, butiran yang hilang adalah penting untuk memahami laporan seterusnya tentang PhysElite.