Apa yang berlaku
Kertas kerja yang diserahkan kepada arXiv pada 25 Ogos memperkenalkan MTDiag, set data yang direka untuk menilai model bahasa besar dalam perbualan diagnostik berbilang pusingan. Penulis berpendapat bahawa diagnosis adalah interaktif dan berperingkat, manakala banyak penilaian sedia ada bergantung pada tanda aras menjawab soalan statik atau dialog templat. Sumber itu berkata model boleh mengalami kemerosotan ketepatan dan kebolehpercayaan apabila interaksi menjangkau beberapa pusingan.
MTDiag dibentangkan sebagai sumber penilaian untuk kelemahan khusus dalam ujian model bahasa perubatan: perbezaan antara menjawab satu soalan klinikal dan menguruskan pertukaran diagnostik yang berkembang. Dalam pertemuan berbilang pusingan, sistem mesti menggabungkan gejala baharu, mengekalkan fakta lebih awal, menyemak diagnosis pembezaan dan mengelak daripada menjadi kurang dipercayai apabila perbualan berkembang. Tuntutan utama kertas itu ialah ujian menjawab soalan statik tidak mengukur tingkah laku tersebut dengan secukupnya.
Set data menggunakan DDXPlus, MIMIC-IV dan laporan kes yang diterbitkan, memberikannya gabungan kes jabatan kecemasan yang dinyatakan dan keadaan yang kurang biasa atau atipikal. Sumber tidak menerangkan bilangan kes, pengedaran diagnosis, populasi pesakit yang diwakili atau kriteria kemasukan yang tepat. Peninggalan tersebut penting kerana kegunaan penanda aras klinikal bergantung sebahagiannya pada sejauh mana kesnya mewakili amalan dunia sebenar.
Untuk menjadikan bahan setanding merentas sumber, pengarang mengatakan mereka menormalkan kes menjadi skema kanonik yang dikaitkan dengan pengecam konsep UMLS dan kod diagnosis ICD-10. Mereka kemudian menggunakan saluran paip penjanaan ujaran berasaskan UserLM-8B untuk menukar bukti klinikal berstruktur kepada dialog bahasa semula jadi. Kertas itu mengatakan set data yang terhasil adalah disahkan doktor, tetapi sumber yang dibekalkan tidak menerangkan bilangan doktor yang mengambil bahagian, perkara yang mereka semak, cara perselisihan pendapat diselesaikan atau cara kualiti pengesahan diukur.
Kertas itu juga mencadangkan metrik berasaskan pengetahuan klinikal untuk menilai model sebagai agen diagnostik dalam diagnosis pembezaan berbilang giliran. Ini adalah pengembangan metodologi melebihi satu skor ketepatan. Walau bagaimanapun, sumber yang disediakan di sini tidak melaporkan hasil yang menunjukkan bahawa MTDiag mengubah kedudukan antara model, meramalkan prestasi klinikal atau meningkatkan hasil pesakit. Ia menerangkan pendekatan penanda aras dan penilaian, bukan sistem klinikal yang disahkan. Dalam akaun yang dibekalkan, komponen ini diterangkan sebagai sebahagian daripada satu sumber penilaian: kes sumber dinormalisasi, bukti dipaparkan sebagai ujaran dan model dinilai melalui berbilang giliran dengan langkah berasaskan pengetahuan. Akaun tersebut tidak menentukan prestasi komponen tersebut dalam amalan, jumlah setiap komponen menyumbang kepada penilaian, atau sama ada skor yang terhasil boleh dipercayai di luar reka bentuk yang dilaporkan.
Mengapa ia penting
Jika pembingkaian pengarang adalah betul, penilaian AI perubatan boleh memberikan gambaran yang tidak lengkap apabila mereka hanya menguji jawapan terpencil. Model mungkin mengenal pasti diagnosis dalam masa yang singkat namun gagal mengemas kini alasannya apabila maklumat baharu tiba, kehilangan jejak bukti terdahulu atau menyampaikan pembezaan yang tidak stabil. Itu adalah kebimbangan praktikal untuk mana-mana sistem yang bertujuan untuk menyokong doktor melalui pertukaran yang berterusan.
Projek ini menangani jurang berbangkit dalam cara orang boleh mentafsir prestasi LLM perubatan. Skor tinggi pada soalan statik tidak dengan sendirinya menetapkan bahawa model boleh mengambil bahagian dengan selamat dalam interaksi klinikal yang berlaku. Ujian berbilang pusingan memberi ruang untuk menilai sama ada sistem bertindak balas dengan sewajarnya kepada perubahan bukti, yang lebih dekat dengan struktur diagnosis yang diterangkan oleh pengarang.
Kemasukan pembentangan kecemasan biasa bersama-sama keadaan yang jarang berlaku dan atipikal boleh menjadikan kegagalan lebih mudah untuk dibezakan. Penanda aras terhad kepada kes biasa mungkin melebih-lebihkan kebolehpercayaan, manakala penanda aras hanya terdiri daripada kes luar biasa mungkin tidak menggambarkan penggunaan rutin. Gabungan MTDiag yang dinyatakan berpotensi berguna kerana kerja diagnostik sebenar termasuk pembentangan yang kerap dan kes yang tidak sesuai dengan penjelasan pertama yang jelas.
Metrik yang dicadangkan juga boleh mengalih perhatian daripada diagnosis akhir kepada kualiti proses diagnostik. Abstrak tidak menamakan metrik atau menerangkan formulanya, jadi nilai praktikalnya masih belum boleh dinilai daripada sumber ini sahaja. Pada dasarnya, langkah berasaskan pengetahuan boleh memeriksa sama ada model menggunakan bukti yang berkaitan secara klinikal dan mengekalkan perbezaan yang koheren, tetapi kemungkinan itu kekal sebagai tuntutan pengarang sehingga keputusan dan penilaian luaran tersedia.
Bagi penyelidik dan organisasi yang menilai model bahasa klinikal, keluaran mungkin menyediakan format ujian biasa untuk membandingkan sistem di bawah keadaan interaktif. Nilai awamnya bergantung pada butiran yang tidak dibekalkan di sini: kebolehcapaian set data, dokumentasi, perlindungan privasi, pelesenan, kebolehulangan dan prestasi merentas institusi dan kepakaran. Tiada apa-apa dalam sumber yang menetapkan bahawa MTDiag bersedia untuk penggunaan klinikal atau bahawa ia harus menggantikan kajian prospektif dan pengawasan manusia.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Bukti penting seterusnya ialah eksperimen kertas penuh yang dilaporkan, termasuk model yang diuji, saiz dan komposisi set data, metrik tepat dan magnitud sebarang kemerosotan prestasi berbilang pusingan. Replikasi bebas akan diperlukan untuk menentukan sama ada penanda aras mengukur tingkah laku bermakna secara klinikal dan bukannya kefasihan atau kebiasaan dengan bahan sumbernya.
Perhatikan sama ada MTDiag menghasilkan kesimpulan yang berbeza daripada penanda aras statik. Bukti yang paling kukuh akan menunjukkan bahawa model yang berprestasi serupa pada soalan terpencil berbeza apabila diperlukan untuk menyepadukan maklumat merentas selekoh, dan metrik yang dicadangkan mengenal pasti perbezaan yang bermakna. Sumber yang dibekalkan tidak memberikan perbandingan tersebut, jadi tiada tuntutan tentang prestasi model tertentu boleh dibuat lagi.
Asal dan tadbir urus set data akan menjadi penting. MIMIC-IV mengandungi data klinikal, manakala projek itu juga menggunakan laporan kes yang diterbitkan dan ujaran sintetik atau terhasil. Kertas kerja itu harus menjelaskan nyah pengenalan, kebenaran, pelesenan, prosedur transformasi dan sama ada dialog yang dijana mengekalkan bukti klinikal yang mendasari tanpa memperkenalkan perkataan atau artifak yang mengelirukan.
Kesahan luaran adalah satu lagi soalan terbuka. Keputusan mungkin berbeza mengikut bahasa, sistem kesihatan, kepakaran, aliran kerja doktor dan jumlah maklumat yang tersedia pada setiap giliran. Kes yang jarang berlaku boleh menguji keluasan diagnostik, tetapi ia juga mungkin sukar untuk dinilai secara konsisten. Doktor bebas harus menilai sama ada struktur dialog dan peraturan pemarkahan mencerminkan pertemuan sebenar dan bukannya urutan buatan yang direka di sekitar penanda aras.
Akhir sekali, MTDiag harus dianggap sebagai sumber penilaian, bukan bukti bahawa LLM selamat untuk mendiagnosis pesakit. Sumber itu tidak melaporkan ujian klinikal prospektif, kesan ke atas keputusan doktor, hasil pesakit atau perlindungan terhadap cadangan berbahaya. Perkara yang tidak diketahui yang bermakna ialah sama ada prestasi pada set data ini berkorelasi dengan tingkah laku yang lebih selamat dan boleh dipercayai dalam amalan; soalan itu memerlukan pengesahan di luar penanda aras kertas itu sendiri.