Apa yang berlaku
Penyelidik mencadangkan DirEAG, kaedah Agregasi Bukti Dirichlet untuk menentukur keyakinan lisan daripada model bahasa yang menyelesaikan masalah matematik. Makalah ini melaporkan penentukuran yang lebih baik daripada purata langsung dan pengagregatan heuristik merentas tiga set data dan tiga keluarga model, sambil mengekalkan pemilihan jawapan yang kompetitif.
Kertas kerja yang disiarkan ke arXiv pada 21 Ogos 2026, mencadangkan DirEAG, singkatan kepada Dirichlet Evidence Agregation. Subjeknya ialah kelemahan khusus dalam model bahasa besar yang digunakan untuk penaakulan matematik: menanyakan model sejauh mana keyakinannya tidak secara automatik menghasilkan skor keyakinan yang sepadan dengan pasti dengan ketepatan. Pengarang menggambarkan keyakinan verbal kotak hitam sebagai sukar untuk ditentukur kerana makna berangka jawapan model boleh beralih dengan gesaan, model atau set data.
Kaedah ini menggunakan beberapa gesaan pemandu keyakinan pada masalah yang sama. Setiap gesaan menghasilkan pemerhatian jawapan-keyakinan. Daripada sekadar purata nilai keyakinan tersebut, DirEAG menukar setiap pemerhatian kepada bukti lembut yang diedarkan merentasi jawapan calon yang dijana semasa proses. Ia juga menambah keadaan batal yang mewakili kemungkinan tiada calon yang betul. Reka bentuk ini penting kerana ia menganggap laporan keyakinan sebagai bukti tentang jawapan yang bersaing dan bukannya mengandaikan bahawa setiap peratusan yang dilaporkan sudah berada pada skala yang sama dan bermakna.
Makalah itu melaporkan eksperimen pada GSM8K, SVAMP dan GSM-Hard, tiga set data penaakulan matematik yang dinamakan dalam sumber. Ia menguji model daripada keluarga Qwen, Mistral dan Gemma. Menurut pengarang, DirEAG sering menghasilkan penentukuran yang lebih baik daripada purata keyakinan langsung dan agregasi pemandu keyakinan heuristik, sambil mengekalkan prestasi kompetitif dalam memilih jawapan. Sumber tidak menyatakan skor penentukuran yang tepat, skor pilihan jawapan, versi model atau tetapan percubaan.
Penulis juga melaporkan hasil ablasi yang menunjukkan bahawa dua bahagian pendekatan menangani masalah yang berbeza. Pengagregatan bukti menggabungkan maklumat daripada pemerhatian jawapan-keyakinan, manakala langkah penentukuran binari terakhir mengendalikan bahagian lain daripada tugas penentukuran. Kertas itu sepanjang 16 muka surat, mengandungi tiga angka, mengatakan kod tersedia dan disenaraikan sebagai diterima oleh PRICAI 2026. Sumber mengenal pasti karya itu sebagai pracetak dan tidak menerangkan replikasi bebas atau hasil semakan rakan di luar pernyataan penerimaan itu.
Mengapa ia penting
Pernyataan keyakinan model bahasa boleh menjadi sukar untuk ditafsirkan, terutamanya apabila mendorong perubahan skala kepastian model yang dilaporkan sendiri. Kaedah yang memisahkan pemilihan jawapan dengan lebih baik daripada anggaran ketidakpastian boleh membantu pembangun mengenal pasti bila jawapan matematik patut disemak tambahan, walaupun sumber itu tidak memberikan bukti penggunaan di luar eksperimen yang dilaporkan.
Isu praktikal bukan semata-mata sama ada model bahasa boleh menghasilkan jawapan matematik. Ia adalah sama ada pengguna atau sistem hiliran boleh mentafsir kepastian model yang dinyatakan semasa memutuskan perkara yang perlu dipercayai. Jika nilai keyakinan mengubah makna merentas gesaan, maka nombor yang tinggi dalam satu tetapan mungkin tidak dapat dibandingkan dengan nombor tinggi dalam tetapan lain. Sumbangan utama kertas kerja itu ialah percubaan untuk menangani masalah perbandingan itu secara berstruktur.
Keadaan batal DirEAG ialah ciri berguna cadangan kerana ia membenarkan kaedah mewakili ketidakpastian yang tidak diselesaikan oleh jawapan calon yang sedang dipertimbangkan. Sistem yang mesti memilih antara jawapan tersenarai sebaliknya boleh kelihatan lebih pasti hanya kerana ia tidak mempunyai tempat yang jelas untuk menyatakan bahawa semua calon yang ada mungkin salah. Sumber membentangkan ini sebagai sebahagian daripada kaedah; ia tidak menunjukkan sama ada keadaan nol meningkatkan keselamatan atau membuat keputusan dalam sistem yang digunakan.
Pemisahan antara pemilihan jawapan dan penentukuran juga memberikan penyelidikan sudut diagnostik yang berpotensi berguna. Model boleh memilih jawapan yang betul dengan kerap semasa masih menyatakan keyakinan dengan lemah, atau ia boleh menentukur keyakinan semasa memilih jawapan dengan kurang berkesan. Penghapusan yang dilaporkan menunjukkan bahawa pengarang tidak menganggapnya sebagai objektif yang sama. Perbezaan itu mungkin berkaitan dengan pembangun yang menilai sistem yang memerlukan kedua-dua output yang betul dan isyarat yang boleh dipercayai untuk masa meminta semakan.
Buktinya masih terhad kepada eksperimen kertas itu sendiri. Sumber melaporkan keputusan pada penanda aras matematik dan beberapa keluarga model, tetapi ia tidak menetapkan bahawa DirEAG meningkatkan anggaran keyakinan untuk pengekodan, analisis saintifik, soalan perubatan atau tugas lain. Ia juga tidak melaporkan bagaimana kaedah tersebut dibandingkan dengan setiap pendekatan anggaran ketidakpastian yang lain, sama ada ia menambahkan kos pengiraan atau kependaman yang bermakna, atau sama ada keuntungannya cukup besar untuk mengubah keputusan operasi. Had tersebut mengekalkan keputusan dalam kategori penyelidikan yang menjanjikan dan bukannya menunjukkan keupayaan pengeluaran.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang perlu ditonton seterusnya
Soalan utama seterusnya ialah sama ada DirEAG bertahan di luar penanda aras matematik yang diuji, seberapa besar keuntungan penentukurannya, dan sama ada ia kekal berguna merentas saiz model, strategi mendorong dan aplikasi sebenar. Sumber tidak memberikan hasil berangka, butiran pelaksanaan atau bukti daripada sistem operasi.
Titik pengesahan pertama ialah kuantitatif. Abstrak mengatakan DirEAG sering mencapai penentukuran yang lebih baik dan pemilihan jawapan yang kompetitif, tetapi ia tidak memberikan saiz, konsistensi atau kepentingan statistik bagi keuntungan tersebut. Pembaca harus melihat kertas penuh dan kod yang dikeluarkan untuk metrik penentukuran khusus, julat keyakinan, garis dasar, pemisahan set data, pusat pemeriksaan model dan hasil dijalankan berulang yang diperlukan untuk menilai sejauh mana tuntutan itu teguh.
Soalan kedua ialah generalisasi. GSM8K, SVAMP dan GSM-Hard semuanya membimbangkan penaakulan matematik, jadi bukti yang dilaporkan tidak menunjukkan sama ada kaedah itu berfungsi apabila jawapan terbuka, bukti tidak lengkap atau ketepatan lebih sukar untuk ditentukan. Pengujian merentas domain tambahan akan menjelaskan sama ada DirEAG menangkap sifat umum keyakinan model lisan atau terutamanya menangani struktur penanda aras ini.
Kaedah ini mungkin juga bergantung pada cara jawapan calon dan gesaan pemandu keyakinan dijana. Sumber tidak menyatakan bilangan gesaan yang digunakan, cara jawapan calon dipilih, cara keadaan nol diparameterkan, atau cara penentukuran binari akhir dilatih. Butiran tersebut boleh menjejaskan kos, kebolehulangan dan prestasi. Adalah penting untuk melihat sama ada pendekatan itu kekal berkesan apabila gesaan, versi model atau set data berubah.
Akhir sekali, ujian praktikal yang berkaitan ialah sama ada keyakinan yang ditentukur meningkatkan keputusan dan bukannya metrik penanda aras sahaja. Sumber tidak melaporkan penggunaan, kajian pengguna, hasil semakan manusia atau penyepaduan dengan alatan matematik. Kerja selanjutnya harus memeriksa sama ada DirEAG membantu orang ramai mengenal pasti jawapan yang salah, memperuntukkan usaha pengesahan atau mengelakkan terlalu mempercayai model, sambil juga mengukur sebarang kerumitan tambahan dan kes kegagalan.