Apa yang terjadi
Pracetak arXiv baru memeriksa mengapa model bahasa yang dilengkapi alat terkadang berkomitmen pada klaim yang tidak didukung oleh bukti yang tersedia. Studi ini membagi masalahnya menjadi seberapa sering klaim yang tidak didukung muncul dan seberapa sering klaim tersebut dapat diperbaiki ketika bukti yang hilang diberikan.
Makalah ini mempelajari model bahasa yang dapat menjadi alat untuk menyelesaikan ketidakpastian. Temuan utamanya adalah bahwa akses alat saja tidak selalu mengarahkan model untuk melakukan pengecekan. Dalam satu pengaturan Qwen3-32B yang telah diperbaiki, 33 dari 512 tanggapan pertama terhadap 256 templat cepat baru berakhir dengan klaim yang tidak didukung, meskipun satu alat yang tersedia dapat menyelesaikan ketidakpastian dan instruksi tersebut secara eksplisit melarang asumsi dan tebakan. Penulis mendefinisikan klaim yang tidak didukung dengan menggunakan bukti yang terlihat oleh model dan jawaban akhirnya, tanpa bergantung pada jawaban benar yang tersembunyi.
Para peneliti kemudian memutar ulang masing-masing dari 33 kasus tersebut dari salinan persis negara bagian di mana klaim tersebut terjadi. Respons alat alternatif dicocokkan dalam struktur dan panjangnya dan hanya berbeda dalam kode respons satu karakter. Menurut surat kabar tersebut, memberikan bukti penyelesaian memperbaiki semua 33 klaim yang tidak didukung. Respons yang cocok dan tidak membawa informasi berguna tidak akan memperbaiki satupun. Ketika bukti mendukung jawaban asli model, model tersebut mempertahankan jawaban tersebut di seluruh 33 kasus, tanpa ada bahaya yang terlihat dalam pengujian ini.
Eksperimen terpisah menguji aturan pemeriksaan otomatis pada 64 kasus yang memerlukan bukti. Aturan tersebut memicu 21 panggilan bukti tambahan. Makalah ini melaporkan bahwa mereka mengoreksi 10 klaim salah yang tidak didukung, mempertahankan 11 jawaban yang benar secara tidak sengaja, dan tidak pernah mengubah jawaban yang benar menjadi salah. Hasil ini menunjukkan bahwa intervensi tersebut ditargetkan pada kondisi yang diuji, namun tidak menetapkan bagaimana aturan tersebut akan bekerja dengan petunjuk, model, alat, atau jenis bukti yang berbeda.
Model perbandingan memberikan hasil yang sangat berbeda. Pada penyiapan Gemma 4 tetap yang menggunakan pengaturan pengambilan sampel yang sama, model memanggil alat tersebut di semua 512 tanggapan pertama dan tidak pernah membuat klaim akhir yang tidak didukung. Karena tidak ada klaim alami yang tidak didukung yang muncul dalam pengaturan tersebut, penulis tidak dapat mengukur perbaikan bersyarat untuk klaim tersebut. Sumber mengidentifikasi eksperimen sebagai dua pengaturan model tetap lokal pada dua kelompok tugas sintetis.
Mengapa itu penting
Temuan ini menunjukkan adanya masalah keandalan praktis pada sistem AI yang dapat berkonsultasi dengan alat, database, atau layanan eksternal: akses terhadap verifikasi tidak menjamin bahwa model akan menggunakannya sebelum membuat klaim. Makalah ini juga melaporkan bahwa aturan pemeriksaan otomatis sederhana mengoreksi kesalahan yang diamati dalam satu pengaturan yang diuji, meskipun buktinya terbatas.
Persoalan praktisnya bukan sekadar apakah suatu model mempunyai alat. Suatu sistem mungkin terhubung ke fungsi pencarian, database atau kalkulator dan masih menjawab sebelum memperoleh informasi yang dapat menyelesaikan ketidakpastian. Untuk aplikasi yang klaimnya tidak didukung dapat menyesatkan pengguna, perbedaan antara ketersediaan alat dan penggunaan alat sangatlah penting. Hasil makalah ini memberikan cara konkrit untuk menggambarkan perbedaan tersebut daripada memperlakukan keandalan sebagai skor tunggal.
Studi ini juga menawarkan kerangka evaluasi yang berpotensi berguna. Mengukur kejadian menanyakan seberapa sering model secara independen membuat klaim yang tidak didukung. Mengukur perbaikan bersyarat menanyakan apakah klaim yang sama berubah ketika bukti yang hilang diberikan. Pemisahan tersebut dapat membantu evaluator menentukan apakah masalah model adalah kegagalan pemeriksaan, kegagalan pembaruan setelah pemeriksaan, atau keduanya. Dalam percobaan ini, pengaturan Qwen menunjukkan kegagalan yang diamati untuk memeriksa tetapi merespons dengan benar ketika bukti penyelesaian diberikan.
Hasil pemeriksaan otomatis penting karena menguji kemungkinan pengamanan operasional dibandingkan hanya mendokumentasikan kegagalan. Dalam percobaan 64 kasus yang dilaporkan, aturan tersebut menambahkan 21 panggilan bukti dan mengoreksi 10 klaim salah yang tidak didukung tanpa mengubah jawaban yang benar. Kombinasi tersebut cukup menggembirakan dalam eksperimen ini, terutama untuk sistem yang panggilan verifikasinya lebih murah dibandingkan dengan jawaban yang tidak didukung untuk menjangkau pengguna.
Batasan juga sama pentingnya. Sumber tersebut menjelaskan pracetak, bukan studi tinjauan sejawat, dan melaporkan hasil hanya dari dua penyiapan model tetap dan dua kelompok tugas sintetis. Para penulis secara eksplisit mengatakan bahwa temuan ini tidak menunjukkan seberapa umum kegagalan dalam penerapan di dunia nyata atau mencerminkan mekanisme umum yang terjadi di seluruh model. Oleh karena itu, angka-angka tersebut mendukung temuan reliabilitas yang sempit, bukan klaim luas tentang model bahasa secara keseluruhan.
Hasil yang berbeda dari Qwen3-32B dan Gemma 4 juga memperingatkan terhadap generalisasi. Satu model terkadang gagal melakukan pemeriksaan, sementara model lainnya memanggil alat tersebut di setiap respons pertama dalam pengaturan yang disebutkan. Sumber tersebut tidak menentukan faktor arsitektur, pelatihan, dorongan, atau tugas spesifik mana yang menyebabkan perbedaan tersebut. Laporan ini juga tidak melaporkan apakah model tersebut diuji dengan bukti yang berisik, bertentangan, tertunda, atau mahal.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Pertanyaan kuncinya adalah apakah perilaku yang dilaporkan muncul di luar dua konfigurasi model tetap dan rangkaian tugas sintetik dari penelitian tersebut. Pekerjaan lebih lanjut harus menguji lebih banyak model, alat yang realistis, dan kondisi penerapan, serta menetapkan apakah aturan pemeriksaan tetap aman dan berguna ketika bukti tidak jelas, tidak lengkap, atau mahal untuk diperoleh.
Replikasi adalah langkah terpenting berikutnya. Peneliti harus menguji tindakan kejadian dan perbaikan pada kelompok model tambahan, ukuran model, pengaturan pengambilan sampel, dan kebijakan penggunaan alat. Sumber saat ini tidak menentukan apakah 33 klaim yang tidak didukung tersebut merupakan klaim yang khas, sangat sering, atau sangat jarang. Hal ini juga tidak menunjukkan apakah aturan pemeriksaan otomatis akan berfungsi ketika model menghadapi instruksi yang lebih bervariasi atau rangkaian panggilan alat yang lebih panjang.
Tugas yang realistis akan menjadi ujian kritis. Makalah ini menggunakan rangkaian tugas sintetis, sementara sistem yang diterapkan dapat menelusuri web, menanyakan catatan bisnis, mengambil dokumen, mengeksekusi kode, atau berinteraksi dengan API. Lingkungan tersebut dapat menghasilkan bukti yang tidak lengkap, sumber yang kontradiktif, dan kegagalan pada alat itu sendiri. Masih belum diketahui apakah penyediaan kode penyelesaian satu karakter dapat mengatasi kesulitan dalam memutuskan kapan harus memeriksa dalam pengaturan praktis.
Evaluator juga harus memeriksa biaya dan efek samping dari pemeriksaan. Sumber tersebut melaporkan 21 panggilan bukti tambahan dalam eksperimen terpisah, namun sumber tersebut tidak memberikan analisis biaya yang lebih luas atau menunjukkan bagaimana aturan berperilaku ketika alat lambat, terbatas, atau tidak tersedia. Perlindungan yang meningkatkan dukungan faktual masih dapat memengaruhi latensi, penggunaan komputasi, atau pengalaman pengguna. Pengorbanan tersebut tidak diukur di sini.
Bidang ini harus melacak apakah peraturan pemeriksaan tetap konservatif di tengah ketidakpastian. Dalam eksperimen yang dilaporkan, aturan tersebut tidak pernah mengubah jawaban yang benar menjadi jawaban yang salah, namun hasil tersebut berasal dari sampel kecil yang terkontrol. Pengujian yang lebih besar harus mencari intervensi yang salah, kegagalan dalam perbaikan, dan kasus-kasus dimana bukti secara teknis tersedia namun tidak dapat diandalkan. Sumber tersebut tidak memberikan bukti mengenai kondisi tersebut.
Pada akhirnya, definisi makalah ini dapat mendukung pelaporan yang lebih sebanding. Memisahkan kejadian klaim yang tidak didukung dari perbaikan bersyarat memungkinkan untuk mengetahui apakah suatu sistem gagal mencari bukti atau gagal menggunakan bukti setelah diperoleh. Apakah langkah-langkah tersebut menjadi standar akan bergantung pada replikasi dan menunjukkan bahwa langkah-langkah tersebut memprediksi kegagalan yang dihadapi pengguna di luar evaluasi sintetik.