Kembali ke Berita
InovasiAI Understanding pengarahan

Benchmark OmniPhys menguji AI multimodal pada penalaran fisika dan pembuatan diagram

Makalah yang diterima dalam Temuan EMNLP 2026 memperkenalkan OmniPhys, sebuah tolok ukur dari 15.246 soal fisika dan 19.850 gambar yang diambil dari corpora pendidikan Tiongkok. Ini mengevaluasi sistem AI multimodal pada penalaran fisika dan pembuatan diagram fisika terstruktur.

5 min readRead the primary source
Primary-source image accompanying OmniPhys benchmark tests multimodal AI on physics reasoning and diagram generation
Dokumen sumber utamaSumber direkam
Penerbit
arxiv.org
Tautan sumber
arxiv.orghttps://arxiv.org/abs/2608.25398
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Tolok ukur
Tes atau kumpulan data standar yang digunakan untuk mengukur dan membandingkan kinerja model.
Anotasi
Label atau metadata yang ditambahkan manusia digunakan untuk melatih atau mengevaluasi model pembelajaran mesin.
Kekokohan
Kemampuan model untuk mempertahankan performa di bawah gangguan, pergeseran, atau masukan yang berlawanan.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang terjadi

Para peneliti memperkenalkan OmniPhys, tolok ukur multimodal yang dirancang untuk mengevaluasi bagaimana sistem AI memahami dan menghasilkan konten fisika. Tolok ukur ini mencakup masalah tingkat sekolah menengah hingga universitas dan menggabungkan teks, gambar, anotasi terperinci, dan tugas pembuatan diagram terstruktur.

Makalah yang diserahkan ke arXiv pada 26 Agustus 2026, menggambarkan OmniPhys sebagai tolok ukur terpadu untuk pemahaman, penalaran, dan pembangkitan fisika multimodal. Catatan arXiv menyatakan bahwa makalah tersebut diterima dalam Temuan EMNLP 2026. Subjek utamanya adalah evaluasi model bahasa besar multimodal, bukan pendidikan fisika saja: penulis merancang sumber daya untuk menguji apakah sistem AI dapat menafsirkan masalah fisika visual dan tekstual dan menghasilkan keluaran terstruktur yang relevan.

Tolok ukurnya berisi 15.246 pertanyaan dan 19.850 gambar yang diambil dari korpora pendidikan Tiongkok. Makalah tersebut mengatakan bahwa pertanyaan-pertanyaan tersebut berkisar dari tingkat sekolah menengah hingga universitas, sehingga memberikan sumber daya dengan rentang kesulitan yang lebih luas daripada tes yang berfokus pada satu kelompok umur atau topik yang sempit. Sumbernya tidak mengidentifikasi buku teks, institusi, mata pelajaran, atau distribusi geografis tertentu yang terwakili dalam korpora tersebut, sehingga cakupan materi pendidikan yang mendasarinya masih menjadi batasan penting.

OmniPhys menyertakan anotasi terperinci yang dimaksudkan untuk mendukung analisis mendalam tentang proses penalaran dan penggunaan pengetahuan. Hal ini juga mengevaluasi keluaran multimodal daripada membatasi penilaian pada jawaban yang dipilih dari pilihan tetap atau tanggapan tertulis. Secara khusus, penulis mengatakan bahwa hal ini mengukur apakah model dapat menghasilkan diagram fisika terstruktur, yang mereka gambarkan sebagai bagian mendasar dari pemecahan masalah fisika otentik. Sumber tidak memberikan contoh diagram, skema anotasi, prosedur penilaian, atau jumlah dan identitas model yang digunakan dalam evaluasi yang dilaporkan.

Para penulis mengatakan evaluasi ekstensif mereka mengungkapkan kesenjangan kritis dalam model bahasa multimodal besar saat ini, terutama dalam penalaran kompleks dan generasi visual. Sumber ini tidak memberikan skor, peringkat, nama model, tingkat kesalahan, ketidakpastian statistik, atau perbandingan dengan kinerja manusia. Dikatakan bahwa kode dan data tersedia, tetapi halaman arXiv tidak menentukan lisensi, proses akses, atau apakah setiap komponen dapat diunduh secara terbuka.

Detail sumber: arxiv.org ↗

Mengapa itu penting

Tolok ukur ini mengatasi kesenjangan yang diidentifikasi oleh penulisnya: evaluasi yang ada tidak menguji AI multimodal pada fisika secara komprehensif atau menilai apakah sistem dapat menghasilkan diagram yang merupakan bagian dari pemecahan masalah fisika nyata. Sumber daya evaluasi bersama dapat membuat kelemahan dalam penalaran ilmiah dan generasi visual lebih mudah diukur.

Soal fisika seringkali memerlukan sistem untuk menggabungkan instruksi tertulis dengan diagram, hubungan spasial, persamaan, dan konsep fisika. Tolok ukur yang hanya menguji jawaban teks akhir dapat mengetahui apakah model menafsirkan informasi visual dengan benar atau sampai pada jawaban melalui rangkaian penalaran yang andal. OmniPhys dirancang untuk mengungkap dimensi tersebut dengan memasangkan pertanyaan multimodal dengan anotasi dan dengan memeriksa diagram yang dihasilkan serta respons konvensional.

Komponen pembuatan diagram sangat penting karena diagram membawa informasi yang sulit diungkapkan secara ekonomis dalam bentuk prosa. Suatu model mungkin menyatakan kesimpulan yang masuk akal namun salah menempatkan gaya, sinar, sirkuit, vektor, atau hubungan lainnya dalam representasi visual. Makalah ini berpendapat bahwa pembuatan diagram terstruktur adalah bagian dari pemecahan masalah fisika otentik, sehingga mengevaluasinya dapat memberikan gambaran yang lebih praktis tentang kemampuan model kepada pendidik dan peneliti daripada akurasi hanya teks saja.

Kode dan data yang dirilis secara publik dapat memberikan pengembang model target umum untuk menguji peningkatan dalam penalaran multimodal. Peneliti dapat menggunakan anotasi untuk mempelajari kegagalan sistem: apakah masalahnya adalah kurangnya pengetahuan fisika, interpretasi visual yang lemah, koordinasi yang buruk antara bahasa dan gambar, atau ketidakmampuan untuk membuat diagram terstruktur. Perbedaan tersebut penting untuk memutuskan apakah hasil yang lebih baik memerlukan data pelatihan baru, perubahan arsitektur model, metode penalaran yang lebih baik, atau evaluasi yang lebih cermat.

Potensi tolok ukur tersebut tetap harus diperlakukan sebagai klaim penelitian dan bukan sebagai ukuran kecerdasan ilmiah umum. Sumbernya adalah makalah penulis dan tidak melaporkan replikasi independen, hasil penerapan, efek ruang kelas, atau bukti bahwa OmniPhys memprediksi kinerja di luar kumpulan datanya. Penggunaan korpora pendidikan Tiongkok dapat memberikan liputan yang berharga sekaligus menimbulkan pertanyaan tentang bahasa, kurikulum, notasi, konteks budaya, dan transfer materi fisika dari wilayah lain.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

Langkah penting berikutnya adalah pengujian independen terhadap model multimoda saat ini dan masa depan di OmniPhys. Hal-hal penting yang belum diketahui mencakup perizinan dan rincian akses tolok ukur, sistem mana yang dievaluasi dan bagaimana kinerjanya, seberapa representatif materi pendidikan Tiongkok dibandingkan kurikulum lain, dan apakah manfaat dari OmniPhys dapat ditransfer ke karya ilmiah nyata.

Perkembangan yang paling mendesak untuk diperhatikan adalah peluncuran dan penggunaan OmniPhys oleh peneliti di luar kelompok penulis. Evaluasi independen harus memperjelas model multimodal mana yang berhasil atau gagal, apakah kesenjangan yang dilaporkan besar dan konsisten, dan apakah metode penilaian yang berbeda menghasilkan kesimpulan yang sama. Karena sumber tersebut tidak memberikan hasil numerik, pembaca belum dapat menentukan seberapa baik atau buruk kinerja sistem saat ini berdasarkan atau tugas mana yang paling sulit.

Peneliti juga perlu memeriksa bagaimana skor menghasilkan diagram. Sumber tersebut mengatakan bahwa tugas tersebut melibatkan diagram fisika terstruktur tetapi tidak menjelaskan apakah evaluasi didasarkan pada struktur yang tepat, hubungan geometris, kebenaran semantik, kesamaan visual, atau penilaian manusia. Pilihan tersebut dapat mengubah peringkat secara signifikan. Sebuah model mungkin menghasilkan diagram yang terlihat berbeda dari referensi sambil mempertahankan hubungan fisik yang relevan, atau mencocokkan tampilan permukaan sambil mengkodekan konsep yang salah.

Cakupan kumpulan data dan ketentuan aksesnya masih menjadi pertanyaan lebih lanjut. Sumber tidak mengidentifikasi keseimbangan antara tingkat pendidikan, topik fisika, bahasa, jenis gambar, atau format pertanyaan. Hal ini juga tidak menyatakan apakah materi sumber mencakup konten berhak cipta, bagaimana diagram dikumpulkan, atau apa yang mungkin dilakukan pengguna dengan data yang dirilis. Rincian ini akan mempengaruhi reproduktifitas dan menentukan seberapa luas tolok ukur tersebut dapat diadopsi.

Terakhir, penelitian di masa depan harus menguji apakah kinerja di OmniPhys sesuai dengan perilaku yang berguna dalam lingkungan pendidikan atau ilmiah yang sebenarnya. Hal ini mencakup pemeriksaan ketahanan terhadap diagram yang tidak dikenal, notasi yang berbeda, pertanyaan yang diterjemahkan, gambar yang ambigu, dan permasalahan yang tidak menyerupai materi sumber tolok ukur. Makalah ini menyajikan OmniPhys sebagai sumber daya dasar untuk kecerdasan multimodal dalam bidang fisika dan ilmiah, namun sumber tersebut tidak menetapkan bahwa keberhasilannya akan meningkatkan pengajaran, pembelajaran, penelitian, atau hasil praktis lainnya.

Panduan & kuis terkait

Model AI DijelaskantransformatorPelatihan AIChatGPT & LLMUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?