Apa yang terjadi
Pracetak yang dikirimkan ke arXiv pada tanggal 24 Agustus memperkenalkan Credal Large Language Models, atau CLLM, yang menggunakan kumpulan adaptor LoRA untuk mewakili serangkaian prediksi yang masuk akal, bukan distribusi probabilitas tunggal. Penulis memperoleh skor komitmen tingkat token dan tingkat semantik dan mengevaluasinya untuk menjawab pertanyaan, kalibrasi, prediksi selektif, deteksi halusinasi, dan penalaran.
Makalah ini menjelaskan keterbatasan dalam cara model bahasa biasa merepresentasikan ketidakpastian: model standar menghasilkan distribusi prediktif tunggal, yang menurut penulis dapat menyamakan ketidaktahuan dengan ambiguitas yang sebenarnya. CLLM yang mereka usulkan malah menggunakan ansambel adaptor LoRA untuk membentuk apa yang oleh makalah disebut sebagai kumpulan kredal. Dalam istilah praktis, metode ini dimaksudkan untuk menjaga ketidaksepakatan atau penyebaran di antara distribusi prediktif yang masuk akal daripada memampatkan semua ketidakpastian menjadi satu keluaran softmax. Sumber tersebut tidak mengklaim bahwa representasi ini membuat suatu model menjadi benar; ia mengklaim bahwa hal ini dapat membuat tingkat komitmen model menjadi lebih informatif.
Para penulis memperkenalkan dua langkah terkait. Komitmen Token Credal, atau CTC, beroperasi di ruang token dan menggabungkan dukungan batas bawah, lebar kredal, dan entropi persimpangan. Abstraknya mengatakan CTC dapat dihitung tanpa pembangkitan tambahan, yang berpotensi penting untuk sistem di mana pengambilan sampel berulang akan menambah latensi atau biaya. Konsistensi Komitmen Semantik, atau SCC, memperluas gagasan ke ruang semantik menggunakan penyelesaian sampel. Makalah ini juga mendefinisikan SCC-Gap untuk mengukur ketidaksesuaian antara dukungan tingkat token dan dukungan tingkat semantik. Skor ini disajikan sebagai alat untuk mengidentifikasi ketika tingkat kepercayaan permukaan suatu model mungkin tidak selaras dengan rentang makna yang diungkapkan oleh kemungkinan jawaban yang ada.
Evaluasi meliputi Gemma-2-9B, Llama-3.1-8B, dan Qwen2.5-7B pada OpenBookQA, CoQA, TriviaQA, dan ARC-Challenge. Berdasarkan abstrak, CLLM adalah metode dengan kinerja terbaik dalam akurasi menjawab pertanyaan sambil mempertahankan kesalahan kalibrasi yang diharapkan secara kompetitif. Para penulis juga melaporkan bahwa CTC berada dalam 1,5 poin persentase dari area deteksi halusinasi terbaik di bawah kurva karakteristik pengoperasian penerima di sebagian besar pengaturan, tanpa pembangkitan tambahan. Pada prediksi selektif pada cakupan 80%, abstrak melaporkan akurasi 99,0% pada OpenBookQA untuk CLLM dengan SCC. Ini mulai menyatakan hasil ARC-Challenge untuk CLLM dengan keyakinan Csem tetapi terpotong sebelum memberikan hasil, sehingga klaim tidak dapat dinilai dari sumber yang disediakan.
Mengapa itu penting
Model bahasa dapat menghasilkan jawaban yang lancar dengan keyakinan yang tidak beralasan. Jika hasil yang dilaporkan tetap sama, mengukur ketidakpastian di berbagai distribusi prediktif yang masuk akal dapat membantu sistem mengidentifikasi jawaban yang memerlukan verifikasi, abstain, atau tinjauan manusia tanpa memerlukan pembuatan tambahan dalam banyak kasus.
Persoalan praktis utamanya bukan sekadar apakah model bahasa dapat menjawab pertanyaan, namun apakah model tersebut dapat membedakan pengetahuan dari ketidakpastian. Jawaban yang lancar namun salah bisa lebih berbahaya daripada penolakan yang jelas ketika pengguna memperlakukan kepercayaan sebagai bukti. Representasi kepercayaan yang diusulkan dalam makalah ini mengatasi masalah tersebut dengan mempertahankan ketidaksepakatan di antara prediksi berbasis adaptor. Jika metode ini digeneralisasikan, metode ini dapat memberikan sinyal sisi model kepada pengembang untuk memutuskan kapan harus menjawab secara langsung, meminta verifikasi, meneruskan pertanyaan ke sistem lain, atau melibatkan seseorang.
Hasil prediksi selektif yang dilaporkan sangat relevan dengan penerapan karena sistem selektif tidak perlu menjawab setiap pertanyaan. Sebuah sistem yang dapat mempertahankan akurasi tinggi dan hanya mencakup kasus-kasus yang dianggap cukup didukung mungkin akan lebih berguna dalam situasi di mana kesalahan menimbulkan kerugian yang berarti. Akurasi 99,0% yang dilaporkan pada cakupan 80% pada OpenBookQA cukup menggembirakan dalam kumpulan data dan konfigurasi tersebut, namun hal ini harus dipahami sebagai hasil tertulis dan bukan sebagai bukti bahwa sistem yang diterapkan akan mencapai kinerja yang sama. Abstrak tidak merinci jumlah contoh, metode perbandingan, atau definisi operasional cakupan.
Klaim CTC tanpa generasi tambahan juga penting dalam desain inferensi. Banyak teknik ketidakpastian bergantung pada menghasilkan banyak penyelesaian, yang dapat meningkatkan komputasi dan penundaan. Sumber tersebut mengatakan CTC menggabungkan beberapa kuantitas terkait ketidakpastian tanpa pembangkitan tambahan, sementara SCC secara eksplisit menggunakan penyelesaian sampel. Perbedaan tersebut memberikan makalah ini sudut pandang rekayasa yang konkrit: satu skor mungkin lebih murah untuk diterapkan, sementara skor lainnya mungkin menangkap ketidaksepakatan semantik secara lebih langsung. Namun, abstrak ini tidak menghitung biaya dari rangkaian LoRA itu sendiri, sehingga total trade-off penyajiannya masih belum diketahui.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang harus ditonton selanjutnya
Hasilnya saat ini merupakan evaluasi pracetak yang dilaporkan oleh penulis, bukan temuan kinerja yang ditetapkan secara independen. Detail penting masih belum tersedia dalam abstrak yang disediakan, termasuk hasil lengkap ARC-Challenge, garis dasar yang tepat, overhead komputasi, dan seberapa baik metode tersebut mentransfer melampaui model dan kumpulan data yang diuji.
Pertanyaan pertama adalah apakah keuntungan yang dilaporkan dapat bertahan dari replikasi independen. Sumbernya adalah pracetak arXiv yang dikirimkan pada 24 Agustus 2026, dan materi yang diberikan hanya berisi abstrak. Oleh karena itu, hasil yang diperoleh hanyalah klaim yang dibuat oleh penulis, bukan fakta yang diverifikasi secara independen. Pengawasan tindak lanjut harus memeriksa tabel lengkap, garis dasar, definisi kepercayaan, variasi statistik, dan apakah keuntungan yang dilaporkan konsisten di keempat kumpulan data dan ketiga kelompok model.
Kalimat ARC-Challenge pada abstrak tidak lengkap: dikatakan bahwa CLLM dengan keyakinan Csem mencapai hasil tetapi tidak memberikan nilai. Informasi yang hilang tersebut membatasi perbandingan dengan klaim OpenBookQA yang lengkap dan mencegah penilaian penuh terhadap kinerja penalaran metode tersebut. Makalah ini juga melaporkan hasil deteksi halusinasi dalam hal berada dalam 1,5 poin persentase dari AUROC terbaik di sebagian besar pengaturan, namun sumber yang diberikan tidak mengidentifikasi skor absolut, metode persaingan terbaik, atau pengecualian.
Pertanyaan penerapan juga sama pentingnya. Makalah ini menggunakan kumpulan adaptor LoRA, dan abstraknya tidak menyatakan berapa banyak adaptor yang diperlukan, bagaimana adaptor tersebut dilatih, atau berapa banyak memori dan waktu inferensi yang ditambahkan. Ini juga hanya mengevaluasi tiga model bahasa bernama dan empat kumpulan data tanya jawab. Masih belum diketahui apakah skor tersebut berfungsi untuk percakapan yang lebih panjang, pembuatan jawaban terbuka, masukan multibahasa, tugas khusus domain, atau model di luar ukuran dan rentang arsitektur yang diuji. Sampai pertanyaan-pertanyaan tersebut terjawab, CLLM sebaiknya diperlakukan sebagai metode penelitian yang menjanjikan untuk pengukuran ketidakpastian daripada sebagai upaya perlindungan yang tervalidasi untuk penggunaan berisiko tinggi.