Apa yang berlaku
Kertas arXiv memperkenalkan TrustDABench, penanda aras untuk menguji sama ada model bahasa besar boleh menganalisis data berstruktur dengan pasti seperti hamparan dan fail CSV. Pengarang mencipta 2,340 kejadian terganggu yang disahkan manusia daripada 19 jenis perubahan dan menilai lapan LLM. Makalah itu melaporkan bahawa model sering menghasilkan jawapan yang munasabah tetapi tidak disokong, terlepas bukti bercanggah dan mengubah kesimpulan mereka apabila struktur jadual atau hubungan silang jadual diubah.
Tuntutan utama kertas itu ialah analisis data berstruktur yang kelihatan betul memerlukan lebih daripada melaksanakan urutan operasi. Ia mentakrifkan kebolehpercayaan di sekitar laluan yang sah daripada soalan pengguna kepada bukti data yang berkaitan. Pembingkaian itu membawa kepada dua ujian: sama ada LLM enggan menjawab atau meminta penjelasan apabila tiada laluan bukti yang sah wujud dan sama ada ia mengekalkan analisis yang betul apabila bukti yang sama dinyatakan dalam bentuk jadual yang berbeza. Sumber membentangkan ujian ini sebagai ukuran kebolehpercayaan dan keteguhan penanda aras.
TrustDABench dibina dengan bermula dengan pandangan laluan bukti dan menggunakan 19 pengendali gangguan. Pengarang mengatakan pengendali tersebut telah dibuat melalui rangka kerja penjanaan berasaskan Agentik-LLM, menghasilkan 2,340 kejadian yang disahkan oleh manusia. Abstrak tidak menyenaraikan kesemua 19 operator atau menerangkan protokol pengesahan secara terperinci. Ia membuktikan bahawa penanda aras telah direka untuk memperkenalkan perubahan terkawal kepada tugas data berstruktur dan bukannya hanya mengumpulkan soalan dan jawapan biasa. Penulis menilai lapan LLM wakil, tetapi abstrak tidak mengenal pasti semua lapan sistem atau menerangkan gesaan, akses alat atau persekitaran pelaksanaannya.
Penemuan tajuk adalah prestasi yang lemah pada kedua-dua dimensi. Keputusan kebolehpercayaan terbaik yang dilaporkan ialah purata MRS sebanyak 24.21%, dicapai oleh GPT-5.5. Keputusan keteguhan terbaik yang dilaporkan ialah purata ASR sebanyak 9.10%, dicapai oleh Claude-Sonnet-5. Sumber tidak mentakrifkan akronim dalam abstrak, jadi pengiraan dan arah tepatnya harus disahkan dalam kertas penuh sebelum membandingkan nombor dengan penanda aras lain. Pengarang mencirikan kegagalan sebagai sistematik: model jarang mengesan bukti yang bercanggah, selalunya diteruskan melalui laluan analisis yang boleh dilaksanakan tetapi tidak disokong, dan kekal sensitif terhadap perubahan yang melibatkan sempadan pemerhatian atau hubungan silang jadual.
Mengapa ia penting
LLM semakin digunakan untuk mentafsir data perniagaan, saintifik dan pentadbiran, di mana jawapan yang lancar boleh menyembunyikan laluan analisis yang tidak sah. TrustDABench memberi tumpuan kepada sama ada model mengetahui apabila bukti tidak mencukupi dan sama ada ia mencapai kesimpulan yang sama apabila maklumat yang setara diwakili secara berbeza. Keputusan yang dilaporkan menunjukkan bahawa lulus tugasan analisis data konvensional mungkin tidak menunjukkan alasan yang boleh dipercayai di atas jadual.
Isu praktikal ialah jurang antara jawapan yang boleh dijana dan jawapan yang disokong oleh data. Model mungkin boleh mengikuti urutan operasi hamparan atau jadual semasa bermula dari baris yang salah, mengabaikan percanggahan atau melintasi hubungan yang tidak dibenarkan oleh bukti. Dalam kes tersebut, pelaksanaan yang berjaya tidak menjamin kesimpulan yang sah. TrustDABench adalah berbangkit kerana ia menyasarkan perbezaan itu secara langsung dan bukannya menganggap sebarang jawapan yang boleh dibaca atau diformat secara berangka sebagai bukti kebolehpercayaan.
Perkara ini penting di mana-mana sahaja orang menggunakan LLM untuk meringkaskan atau menganalisis maklumat berstruktur. Sumber itu secara khusus menamakan hamparan, fail CSV dan data berstruktur lain, tetapi ia tidak mendokumenkan penggunaan dalam industri tertentu atau melaporkan bahaya dunia sebenar. Kelemahan yang dilaporkan oleh penanda aras bagaimanapun mengenal pasti masalah semakan praktikal: pengguna mungkin perlu menyemak bukan sahaja nombor atau penjelasan akhir, tetapi juga rekod, sempadan jadual dan perhubungan model yang digunakan. Penemuan kertas itu menyokong berhati-hati itu sebagai kesimpulan penyelidikan, bukan sebagai ukuran yang disahkan secara bebas bagi setiap sistem yang digunakan.
Hasilnya juga mencabar andaian pemeringkatan model yang mudah. GPT-5.5 mencapai skor kebolehpercayaan yang dilaporkan paling kuat, manakala Claude-Sonnet-5 mencapai skor kekukuhan yang dilaporkan paling kuat; abstrak tidak mengatakan bahawa sistem adalah yang terbaik pada setiap tugas atau bahawa metrik mengukur tingkah laku yang sama. Oleh itu, model boleh kelihatan lebih kuat pada satu dimensi sambil kekal terdedah pada dimensi lain. Implikasi yang lebih luas, menurut kertas itu, ialah analisis data berstruktur yang boleh dipercayai memerlukan pengecaman sempadan bukti dan penaakulan invarian perwakilan, bukan sahaja keupayaan yang lebih besar pada tugas standard.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang perlu ditonton seterusnya
Makalah ini menunjukkan dua keutamaan: pengiktirafan yang lebih baik terhadap sempadan bukti dan penaakulan yang kekal stabil merentas perwakilan jadual yang berbeza. Sumber mengatakan kod dan data tersedia, tetapi ia tidak menentukan sama ada penanda aras mencerminkan set data dunia sebenar, cara lapan model membandingkan merentas tugasan individu atau sama ada kelemahan yang dilaporkan berterusan selepas peningkatan yang disasarkan. Kerja susulan harus menguji set data luaran, aliran kerja operasi dan tingkah laku model selepas mitigasi.
Perkara pertama yang perlu diperhatikan ialah sama ada kod dan data penanda aras membolehkan pembiakan bebas. Sumber mengatakan "Kod&Data" tersedia, tetapi teks yang dibekalkan tidak termasuk pautan repositori, lesen penanda aras, format tugasan atau definisi pemarkahan. Butiran tersebut akan menentukan betapa mudahnya penyelidik boleh memeriksa gangguan, mengesahkan pemeriksaan manusia dan memahami apa yang diukur oleh nilai MRS dan ASR. Sehingga maklumat itu diperiksa, peratusan yang dilaporkan harus dianggap sebagai tuntutan daripada pracetak tunggal ini dan bukannya anggaran prestasi yang diselesaikan.
Soalan kedua ialah kesahan luaran. TrustDABench mengandungi kejadian terganggu yang disahkan manusia, tetapi abstrak tidak menyatakan betapa hampir kejadian tersebut menyerupai hamparan organisasi yang tidak kemas, saluran paip data yang berkembang atau analisis yang dilakukan dengan alat luaran. Ia juga tidak melaporkan sama ada keputusan berbeza mengikut saiz data, domain, tahap kesamaran atau jenis perhubungan jadual. Penilaian susulan pada set data bebas dan aliran kerja yang realistik akan membantu menentukan sama ada corak kegagalan yang dilaporkan adalah khusus untuk penanda aras atau biasa digunakan secara praktikal.
Akhir sekali, penyelidik dan pelaksana harus menguji mitigasi dan bukannya hanya menambah lebih banyak markah penanda aras. Kertas kerja mengenal pasti penjelasan, penolakan, pengesanan konflik dan kestabilan merentas borang jadual sebagai tingkah laku penting, tetapi sumber tidak melaporkan campur tangan yang memperbaikinya. Langkah seterusnya yang berguna termasuk menilai pengesanan bukti eksplisit, pemeriksaan perantaraan berstruktur, gesaan percanggahan dan semakan manusia terhadap gangguan yang sama. Sumber juga membuka cara model berkelakuan apabila data benar-benar tidak mempunyai jawapan, apabila pelbagai tafsiran adalah munasabah, atau apabila pengguna menekan sistem untuk meneruskan walaupun tiada sokongan.