Apa yang berlaku
Pracetak yang diserahkan kepada arXiv pada 24 Ogos memperkenalkan Model Bahasa Besar Kredal, atau CLLM, yang menggunakan himpunan penyesuai LoRA untuk mewakili julat ramalan yang munasabah dan bukannya taburan kebarangkalian tunggal. Penulis memperoleh markah komitmen tahap token dan tahap semantik dan menilai mereka untuk menjawab soalan, penentukuran, ramalan terpilih, pengesanan halusinasi dan penaakulan.
Makalah ini menerangkan batasan dalam cara biasa model bahasa mewakili ketidakpastian: model standard menghasilkan pengedaran ramalan tunggal, yang dikatakan pengarang boleh menggabungkan kejahilan dengan kekaburan yang tulen. CLLM yang dicadangkan mereka sebaliknya menggunakan ensemble penyesuai LoRA untuk membentuk apa yang disebut oleh kertas sebagai set kredit. Dari segi praktikal, kaedah ini bertujuan untuk mengekalkan perselisihan faham atau merebak di kalangan pengedaran ramalan yang munasabah dan bukannya memampatkan semua ketidakpastian menjadi satu output softmax. Sumber itu tidak mendakwa bahawa perwakilan ini menjadikan model betul; ia mendakwa bahawa ia boleh menjadikan tahap komitmen model lebih bermaklumat.
Penulis memperkenalkan dua langkah yang berkaitan. Komitmen Token Kredal, atau CTC, beroperasi dalam ruang token dan menggabungkan sokongan sempadan bawah, lebar kredal dan entropi persimpangan. Abstrak mengatakan CTC boleh dikira tanpa penjanaan tambahan, yang berpotensi penting untuk sistem yang pensampelan berulang akan menambah kependaman atau kos. Konsistensi Komitmen Semantik, atau SCC, memanjangkan idea kepada ruang semantik menggunakan pelengkapan sampel. Makalah ini juga mentakrifkan SCC-Gap untuk mengukur ketidakpadanan antara sokongan peringkat token dan sokongan peringkat semantik. Markah ini dibentangkan sebagai alat untuk mengenal pasti apabila keyakinan tahap permukaan model mungkin tidak sejajar dengan julat makna yang dinyatakan oleh kemungkinan jawapannya.
Penilaian meliputi Gemma-2-9B, Llama-3.1-8B dan Qwen2.5-7B pada OpenBookQA, CoQA, TriviaQA dan ARC-Challenge. Menurut abstrak, CLLM ialah kaedah berprestasi terbaik pada ketepatan menjawab soalan sambil mengekalkan ralat penentukuran jangkaan yang kompetitif. Penulis juga melaporkan bahawa CTC berada dalam 1.5 mata peratusan kawasan pengesanan halusinasi terbaik di bawah lengkung ciri operasi penerima dalam kebanyakan tetapan, tanpa penjanaan tambahan. Pada ramalan terpilih pada liputan 80%, abstrak melaporkan ketepatan 99.0% pada OpenBookQA untuk CLLM dengan SCC. Ia mula menyatakan keputusan ARC-Challenge untuk CLLM dengan keyakinan Csem tetapi dipotong sebelum memberikan keputusan, supaya tuntutan tidak dapat dinilai daripada sumber yang dibekalkan.
Mengapa ia penting
Model bahasa boleh menghasilkan jawapan yang lancar dengan keyakinan yang tidak wajar. Jika keputusan yang dilaporkan bertahan, mengukur ketidakpastian merentas berbilang pengedaran ramalan yang munasabah boleh membantu sistem mengenal pasti jawapan yang memerlukan pengesahan, pantang atau semakan manusia tanpa memerlukan penjanaan tambahan dalam banyak kes.
Isu praktikal utama bukan sahaja sama ada model bahasa boleh menjawab soalan, tetapi sama ada ia boleh membezakan pengetahuan daripada ketidakpastian. Jawapan yang lancar tetapi salah boleh menjadi lebih berbahaya daripada penolakan yang jelas apabila pengguna menganggap keyakinan sebagai bukti. Perwakilan kredal yang dicadangkan oleh kertas itu menangani masalah itu dengan mengekalkan perselisihan antara ramalan berasaskan penyesuai. Jika kaedah itu digeneralisasikan, ia boleh memberikan pembangun isyarat sisi model untuk memutuskan masa menjawab terus, meminta pengesahan, mengarahkan soalan ke sistem lain atau melibatkan seseorang.
Keputusan ramalan selektif yang dilaporkan adalah sangat berkaitan dengan penggunaan kerana sistem terpilih tidak perlu menjawab setiap soalan. Sistem yang boleh mengekalkan ketepatan yang tinggi sambil meliputi hanya kes yang dianggapnya cukup disokong mungkin lebih berguna dalam tetapan di mana ralat membawa kos yang bermakna. Ketepatan 99.0% yang dilaporkan pada liputan 80% pada OpenBookQA adalah menggalakkan dalam set data dan konfigurasi itu, tetapi ia harus difahami sebagai hasil kertas dan bukannya bukti bahawa sistem yang digunakan akan mencapai prestasi yang sama. Abstrak tidak menyatakan bilangan contoh, kaedah perbandingan atau definisi operasi liputan.
Tuntutan tanpa penjanaan tambahan untuk CTC juga mungkin penting untuk reka bentuk inferens. Banyak teknik ketidakpastian bergantung pada menghasilkan berbilang penyiapan, yang boleh meningkatkan pengiraan dan kelewatan. Sumber itu mengatakan CTC menggabungkan beberapa kuantiti berkaitan ketidakpastian tanpa penjanaan tambahan, manakala SCC secara eksplisit menggunakan penyiapan sampel. Perbezaan itu memberikan kertas sudut kejuruteraan konkrit: satu skor mungkin lebih murah untuk digunakan, manakala yang lain mungkin menangkap perselisihan semantik secara lebih langsung. Abstrak tidak mengukur kos ensembel LoRA itu sendiri, walau bagaimanapun, jadi jumlah pertukaran servis masih tidak diketahui.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang perlu ditonton seterusnya
Hasilnya pada masa ini ialah penilaian pracetak yang dilaporkan oleh pengarang, bukan penemuan prestasi yang ditubuhkan secara bebas. Butiran penting kekal tidak tersedia dalam abstrak yang dibekalkan, termasuk keputusan penuh ARC-Challenge, garis dasar yang tepat, overhed pengiraan dan sejauh mana kaedah memindahkan melangkaui model dan set data yang diuji.
Soalan pertama ialah sama ada keuntungan yang dilaporkan bertahan daripada replikasi bebas. Sumbernya ialah pracetak arXiv yang diserahkan pada 24 Ogos 2026 dan bahan yang dibekalkan hanya mengandungi abstrak. Hasilnya adalah dakwaan yang dibuat oleh pengarang, bukan fakta yang disahkan secara bebas. Pemeriksaan susulan harus meneliti jadual penuh, garis dasar, definisi keyakinan, variasi statistik dan sama ada kelebihan yang dilaporkan adalah konsisten merentas keempat-empat set data dan ketiga-tiga keluarga model.
Ayat ARC-Challenge abstrak tidak lengkap: ia mengatakan bahawa CLLM dengan keyakinan Csem mencapai hasil tetapi tidak memberikan nilai. Maklumat yang hilang itu mengehadkan perbandingan dengan tuntutan OpenBookQA yang lengkap dan menghalang penilaian penuh terhadap prestasi penaakulan kaedah. Kertas itu juga melaporkan hasil pengesanan halusinasi dari segi berada dalam 1.5 mata peratusan daripada AUROC terbaik dalam kebanyakan tetapan, tetapi sumber yang dibekalkan tidak mengenal pasti skor mutlak, kaedah bersaing terbaik atau pengecualian.
Soalan penyebaran adalah sama penting. Kertas ini menggunakan ensemble penyesuai LoRA, dan abstrak tidak menyatakan bilangan penyesuai yang diperlukan, cara mereka dilatih, atau berapa banyak memori dan masa inferens yang mereka tambahkan. Ia juga menilai hanya tiga model bahasa bernama dan empat set data menjawab soalan. Masih tidak diketahui sama ada skor berfungsi untuk perbualan yang lebih panjang, penjanaan terbuka, input berbilang bahasa, tugas khusus domain atau model di luar julat saiz dan seni bina yang diuji. Sehingga soalan-soalan tersebut dijawab, CLLM dianggap paling baik sebagai kaedah penyelidikan yang menjanjikan untuk pengukuran ketidakpastian dan bukannya perlindungan yang disahkan untuk penggunaan yang mempunyai kepentingan tinggi.