Apa yang berlaku
Kajian arXiv baharu menilai sama ada model bahasa besar boleh mengenal pasti perhubungan kausal langsung dan menyampaikan keyakinan yang ditentukur dengan pasti. Merentasi enam graf kausal penanda aras, lima strategi dorongan dan empat kaedah keyakinan, para penyelidik mendapati bahawa model tersebut cenderung untuk menghasilkan graf yang terlalu padat dengan banyak tepi positif palsu.
Kertas kerja menilai 12 model bahasa berat terbuka yang ditala arahan di bawah protokol berpasangan bahasa sahaja. Model-model tersebut telah diuji pada enam graf kausal penanda aras, dengan lima strategi dorongan dan empat sumber keyakinan: keyakinan yang dinyatakan dalam jawapan, keyakinan yang diperoleh daripada logit model, persetujuan merentas gesaan dan persetujuan merentas model. Matlamatnya bukan semata-mata untuk mengukur sama ada model mengiktiraf bahawa dua pembolehubah adalah berkaitan, tetapi sama ada ia menilai dengan betul bahawa satu pembolehubah adalah punca langsung yang lain dan mengenal pasti arah kelebihan itu.
Penilaian mendapati bahawa model-model tersebut adalah sangat dominan ingat. Mereka mengenal pasti banyak perhubungan calon, tetapi graf ramalan mereka adalah terlalu padat dan termasuk sejumlah besar tepi positif palsu. Menukar gesaan terutamanya menggerakkan keseimbangan antara ketepatan dan ingat semula; ia tidak menyelesaikan kecenderungan yang lebih luas untuk meramalkan hubungan sebab akibat. Meningkatkan skala model membantu kurang pada graf terbesar dan tidak menghapuskan salah kalibrasi, menurut kertas itu.
Perbezaan antara perkaitan dan sebab langsung adalah titik kegagalan pusat. Berbanding dengan graf rujukan yang diterbitkan, model tersebut salah mengklasifikasikan 40.0% hubungan tidak langsung dan 36.0% bukan tepi terbalik sebagai tepi langsung, berbanding dengan 28.2% bukan tepi lain. Di antara positif palsu tersebut, 80.8% daripada kes tidak langsung dan 84.6% daripada kes bukan tepi terbalik menerima keyakinan lisan sekurang-kurangnya 80%. Penulis juga melaporkan bahawa keyakinan berasaskan logit kerap berkumpul berhampiran 1.0 tanpa mengira sama ada ramalan itu betul. Audit tanda aras-kebiasaan mengenal pasti kemungkinan kebiasaan dalam lima pasangan set data model, semuanya melibatkan set data AsiaM.
Mengapa ia penting
Model bahasa semakin digunakan untuk membekalkan andaian sebab bagi sistem yang menemui struktur sebab akibat. Kajian itu mencadangkan output mereka mungkin berguna sebagai hipotesis sementara, disemak secara luaran, tetapi tidak boleh dianggap sebagai bukti langsung struktur penyebab atau dipercayai semata-mata kerana model itu kelihatan yakin.
Sistem penemuan sebab menggunakan andaian tentang pembolehubah yang boleh mempengaruhi orang lain secara langsung. Jika model bahasa membekalkan kelebihan yang hanya mencerminkan perkaitan yang luas, laluan tidak langsung atau arah yang salah, andaian itu boleh memesongkan analisis kemudian. Oleh itu, kajian itu menangani soalan kebolehpercayaan praktikal untuk pembangun dan penyelidik yang ingin menggunakan LLM sebagai sumber pengetahuan sebab-akibat terdahulu.
Penemuan juga menunjukkan mengapa penjelasan fasih atau keyakinan berangka tidak boleh disalah anggap sebagai penaakulan sebab yang boleh dipercayai. Model boleh mengenali bahawa dua konsep disambungkan sementara gagal untuk menentukan sama ada sambungan itu secara langsung atau ke arah mana hubungan sebab-akibat berjalan. Keyakinan lisan yang tinggi dalam ramalan yang tidak betul dari segi struktur menjadikan perbezaan itu amat penting dalam aliran kerja di mana orang ramai boleh menggunakan skor keyakinan untuk mengutamakan semakan.
Kertas itu tidak menunjukkan bahawa LLM tidak berguna untuk kerja kausal. Kesimpulannya adalah lebih sempit dan lebih boleh diambil tindakan: model mungkin berguna untuk menghasilkan prior kausal lembut, dengan syarat priors tersebut disemak terhadap bukti luaran. Pembingkaian itu mengekalkan peranan untuk model bahasa dalam mencadangkan hipotesis sambil mengekalkan pengesahan sebab untuk kaedah dan data yang direka bentuk untuk mewujudkan struktur. Ia juga mencadangkan bahawa skala model sahaja bukanlah perlindungan yang mencukupi terhadap kelas ralat ini. Kesan awam dan praktikal adalah terutamanya metodologi. Penyelidik membina alat penemuan sebab, sistem sokongan keputusan atau penilaian boleh menggunakan keputusan sebagai amaran untuk memisahkan kaitan sebab akibat daripada pengenalan tepi langsung dan untuk menguji penentukuran secara eksplisit. Sumber tidak menetapkan prestasi dalam mana-mana penggunaan perubatan, ekonomi, dasar atau operasi tertentu, jadi penemuan itu tidak seharusnya digeneralisasikan kepada tetapan tersebut tanpa bukti tambahan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Kertas itu menunjukkan persetujuan merentas gesaan atau model sebagai isyarat keyakinan yang berpotensi lebih baik daripada keyakinan berasaskan verbal atau logit, walaupun kelebihan yang dilaporkan tidak signifikan secara statistik selepas pembetulan. Ujian lanjut akan diperlukan merentas lebih banyak set data, model dan masalah penyebab dunia sebenar.
Isyarat yang paling menjanjikan yang diperiksa oleh kajian itu ialah persetujuan: sama ada beberapa gesaan yang diberikan kepada model yang sama, atau beberapa model yang diberi tugas yang setanding, menghasilkan pertimbangan yang sama. Makalah ini melaporkan penentukuran dan diskriminasi min yang lebih baik untuk persetujuan silang dan model silang daripada untuk anggaran keyakinan konvensional. Walau bagaimanapun, kelebihan tersebut tidak signifikan secara statistik selepas pembetulan Holm, jadi persetujuan harus dianggap sebagai hala tuju penyelidikan dan bukannya penyelesaian yang disahkan.
Penilaian masa depan harus menguji sama ada corak itu berterusan dengan model tertutup dan terbuka di luar 12 sistem yang dikaji, dengan struktur graf tambahan dan dengan soalan kausal yang berasaskan data pemerhatian atau eksperimen sebenar. Keputusan semasa datang daripada enam graf kausal penanda aras dan protokol berpasangan bahasa sahaja. Sumber itu tidak melaporkan bahawa kaedah itu telah diuji dalam aliran kerja membuat keputusan secara langsung.
Kebiasaan penanda aras adalah satu lagi isu yang perlu dipantau. Audit mendapati potensi kebiasaan dalam lima pasangan model-dataset, semuanya melibatkan AsiaM. Keputusan itu mungkin menunjukkan bahawa beberapa prestasi jelas mencerminkan pendedahan kepada bahan penanda aras, tetapi kertas itu membentangkannya sebagai potensi kebiasaan dan bukannya bukti bahawa model tersebut menghafal jawapan. Penilai perlu memeriksa pencemaran dan kebiasaan apabila membandingkan model pada tugas kausal.
Kajian itu juga meninggalkan perkara yang tidak diketahui yang bermakna. Ia tidak menentukan sama ada pengambilan luaran, alat, demonstrasi atau akses kepada pakar domain akan meningkatkan pertimbangan keterus dan orientasi secara material. Ia tidak menunjukkan prestasi model apabila dibekalkan dengan bukti eksperimen, dan juga tidak mengukur kos semakan manusia yang diperlukan untuk membetulkan positif palsu. Akhirnya, kerana kertas itu adalah pracetak yang baru diserahkan, penemuannya tidak dapat dipastikan melalui semakan rakan sebaya dalam sumber yang disediakan.