Kembali ke Berita
InovasiAI Understanding taklimat

Kajian mendapati model bahasa yang dilengkapi alat boleh membuat tuntutan yang tidak disokong walaupun semakan boleh dilakukan

Pracetak baharu melaporkan bahawa satu model bahasa yang diuji kadangkala membuat tuntutan akhir yang tidak disokong walaupun mempunyai akses kepada alat penyelesaian bukti, manakala peraturan semakan automatik membetulkan ralat dalam penilaian sintetik kecil.

6 min readRead the primary source
Source-page capture accompanying Study finds tool-equipped language models can make unsupported claims even when checking is possible
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.27768
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Generalisasi
Seberapa baik prestasi model pada data baharu yang tidak kelihatan di luar set latihan.
Penggunaan Alat
Keupayaan model untuk memanggil alat luaran seperti carian, kalkulator atau API.
Kira
Sumber pemprosesan yang diperlukan untuk melatih dan menjalankan model, selalunya diukur dalam jam FLOPS atau GPU.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Pracetak arXiv baharu meneliti sebab model bahasa yang dilengkapi alat kadangkala melakukan tuntutan yang tidak disokong oleh bukti yang tersedia untuk mereka. Kajian itu memisahkan masalah kepada kekerapan tuntutan yang tidak disokong berlaku dan kekerapan ia boleh dibaiki apabila bukti yang hilang dibekalkan.

Makalah itu mengkaji model bahasa yang boleh memanggil alat untuk menyelesaikan ketidakpastian. Penemuan utamanya ialah akses alat sahaja tidak selalu membawa model untuk menyemak. Dalam satu tetapan tetapan Qwen3-32B, 33 daripada 512 respons pertama kepada 256 templat gesaan baharu berakhir dengan tuntutan yang tidak disokong, walaupun satu panggilan alat yang tersedia boleh menyelesaikan ketidakpastian dan arahan secara jelas melarang andaian dan tekaan. Pengarang mentakrifkan tuntutan yang tidak disokong menggunakan bukti yang boleh dilihat oleh model dan jawapan terakhirnya, tanpa bergantung pada jawapan betul yang tersembunyi.

Para penyelidik kemudian memainkan semula setiap 33 kes tersebut daripada salinan tepat keadaan di mana tuntutan itu berlaku. Respons alat alternatif dipadankan dalam struktur dan panjang dan berbeza hanya dalam kod tindak balas satu aksara. Menurut akhbar itu, membekalkan bukti penyelesaian membaiki kesemua 33 tuntutan yang tidak disokong. Sambutan yang sepadan yang tidak membawa maklumat berguna tidak membaiki satu pun daripadanya. Apabila bukti menyokong jawapan asal model, model itu mengekalkan jawapan itu dalam semua 33 kes, tanpa bahaya yang diperhatikan dalam ujian ini.

Percubaan berasingan meneliti peraturan semakan automatik merentas 64 kes yang memerlukan bukti. Peraturan itu mencetuskan 21 panggilan bukti tambahan. Akhbar itu melaporkan bahawa ia membetulkan semua 10 tuntutan yang salah tidak disokong, mengekalkan 11 jawapan yang betul secara tidak sengaja dan tidak pernah menukar jawapan yang betul kepada yang salah. Keputusan ini menunjukkan bahawa campur tangan telah disasarkan dalam tetapan yang diuji, tetapi mereka tidak menetapkan cara peraturan itu akan berfungsi dengan gesaan, model, alat atau jenis bukti yang berbeza.

Model perbandingan menghasilkan hasil yang sangat berbeza. Pada persediaan Gemma 4 tetap menggunakan tetapan pensampelan yang sama, model memanggil alat itu dalam semua 512 respons pertama dan tidak pernah membuat tuntutan akhir yang tidak disokong. Oleh kerana tiada tuntutan yang tidak disokong secara semula jadi muncul dalam persediaan itu, pengarang tidak dapat mengukur pembaikan bersyarat untuknya. Sumber mengenal pasti eksperimen sebagai dua tetapan model tetap tempatan pada dua keluarga tugas sintetik.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Penemuan menunjukkan masalah kebolehpercayaan praktikal untuk sistem AI yang boleh merujuk alat, pangkalan data atau perkhidmatan luaran: akses kepada pengesahan tidak menjamin bahawa model akan menggunakannya sebelum membuat tuntutan. Kertas itu juga melaporkan bahawa peraturan semakan automatik mudah membetulkan ralat yang diperhatikan dalam satu persediaan yang diuji, walaupun buktinya terhad.

Isu praktikal bukan semata-mata sama ada model mempunyai alat. Sistem mungkin disambungkan ke fungsi carian, pangkalan data atau kalkulator dan masih menjawab sebelum mendapatkan maklumat yang akan menyelesaikan ketidakpastian. Untuk aplikasi yang tuntutan yang tidak disokong boleh mengelirukan pengguna, perbezaan antara ketersediaan alat dan penggunaan alat adalah berbangkit. Keputusan kertas itu memberikan cara yang konkrit untuk menerangkan perbezaan itu daripada menganggap kebolehpercayaan sebagai skor tunggal.

Kajian ini juga menawarkan rangka kerja penilaian yang berpotensi berguna. Mengukur kejadian menanyakan kekerapan model secara bebas membuat tuntutan yang tidak disokong. Mengukur pembaikan bersyarat bertanya sama ada tuntutan yang sama berubah apabila bukti yang hilang dibekalkan. Pemisahan itu boleh membantu penilai menentukan sama ada masalah model ialah kegagalan untuk menyemak, kegagalan untuk mengemas kini selepas menyemak, atau kedua-duanya. Dalam eksperimen ini, persediaan Qwen menunjukkan kegagalan yang diperhatikan untuk menyemak tetapi bertindak balas dengan betul apabila bukti penyelesaian diberikan.

Keputusan semakan automatik penting kerana ia menguji kemungkinan perlindungan operasi dan bukannya hanya mendokumentasikan kegagalan. Dalam eksperimen 64 kes yang dilaporkan, peraturan itu menambah 21 panggilan bukti dan membetulkan 10 tuntutan yang salah tidak disokong tanpa mengubah sebarang jawapan yang betul. Gabungan itu adalah menggalakkan dalam percubaan, terutamanya untuk sistem yang panggilan pengesahan lebih murah daripada membenarkan jawapan yang tidak disokong untuk sampai kepada pengguna.

Had adalah sama penting. Sumber itu menerangkan pracetak, bukan kajian semakan rakan sebaya, dan melaporkan hasil daripada hanya dua tetapan model tetap dan dua keluarga tugas sintetik. Penulis secara eksplisit mengatakan penemuan itu tidak menunjukkan betapa biasa kegagalan itu dalam penyebaran dunia sebenar atau ia mencerminkan mekanisme umum yang dikongsi merentas model. Oleh itu, angka tersebut menyokong penemuan kebolehpercayaan yang sempit, bukan dakwaan luas tentang model bahasa secara keseluruhan.

Keputusan yang berbeza daripada Qwen3-32B dan Gemma 4 juga berhati-hati terhadap generalisasi. Satu model kadangkala gagal untuk menyemak, manakala yang lain memanggil alat dalam setiap respons pertama di bawah persediaan yang dinyatakan. Sumber itu tidak menentukan faktor seni bina, latihan, dorongan atau tugas khusus yang menyebabkan perbezaan itu. Ia juga tidak melaporkan sama ada model telah diuji dengan bukti yang bising, bercanggah, tertangguh atau mahal.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Persoalan utama ialah sama ada tingkah laku yang dilaporkan muncul di luar dua konfigurasi model tetap kajian dan keluarga tugas sintetik. Kerja selanjutnya harus menguji lebih banyak model, alat yang realistik dan keadaan penggunaan, dan menentukan sama ada peraturan pemeriksaan kekal selamat dan berguna apabila bukti samar-samar, tidak lengkap atau mahal untuk diperoleh.

Replikasi adalah langkah seterusnya yang paling penting. Penyelidik harus menguji kejadian dan langkah pembaikan merentas keluarga model tambahan, saiz model, tetapan pensampelan dan dasar penggunaan alat. Sumber semasa tidak menentukan sama ada 33 tuntutan yang tidak disokong adalah tipikal, luar biasa kerap atau luar biasa jarang berlaku. Ia juga tidak menunjukkan sama ada peraturan semakan automatik akan berfungsi apabila model menghadapi arahan yang lebih pelbagai atau rangkaian panggilan alat yang lebih panjang.

Tugasan yang realistik akan menjadi ujian kritikal. Kertas itu menggunakan keluarga tugas sintetik, manakala sistem yang digunakan boleh mencari di web, menanya rekod perniagaan, mendapatkan semula dokumen, melaksanakan kod atau berinteraksi dengan API. Persekitaran tersebut boleh menghasilkan bukti separa, sumber bercanggah dan kegagalan dalam alatan itu sendiri. Ia masih tidak diketahui sama ada membekalkan kod penyelesaian satu aksara menangkap kesukaran untuk menentukan masa untuk menyemak tetapan praktikal.

Penilai juga harus meneliti kos dan kesan sampingan pemeriksaan. Sumber itu melaporkan 21 panggilan bukti tambahan dalam percubaan berasingan, tetapi ia tidak memberikan analisis kos yang lebih luas atau menunjukkan cara peraturan bertindak apabila alat perlahan, terhad kadar atau tidak tersedia. Perlindungan yang meningkatkan sokongan fakta masih boleh menjejaskan kependaman, penggunaan pengiraan atau pengalaman pengguna. Pertukaran tersebut tidak diukur di sini.

Medan harus menjejaki sama ada peraturan semakan kekal konservatif di bawah ketidakpastian. Dalam percubaan yang dilaporkan, peraturan tidak pernah menukar jawapan yang betul kepada jawapan yang salah, tetapi keputusan itu datang daripada sampel terkawal yang kecil. Ujian yang lebih besar harus mencari campur tangan palsu, kegagalan untuk membaiki, dan kes di mana bukti tersedia secara teknikal tetapi dengan sendirinya tidak boleh dipercayai. Sumber tidak memberikan bukti tentang syarat tersebut.

Akhir sekali, takrifan kertas itu boleh menyokong pelaporan yang lebih setanding. Mengasingkan kejadian tuntutan tidak disokong daripada pembaikan bersyarat memungkinkan untuk mengatakan sama ada sistem gagal mendapatkan bukti atau gagal menggunakan bukti setelah diperolehi. Sama ada langkah tersebut menjadi standard bergantung pada replikasi dan pada menunjukkan bahawa mereka meramalkan kegagalan yang dihadapi pengguna di luar penilaian sintetik.

Panduan & kuiz berkaitan

Model AI DiterangkanEjen AIEtika AIPrompt EngineeringUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?