Apa yang berlaku
Penyelidik menilai model bahasa besar pada abstraksi pendaftaran klinikal menggunakan data rekod perubatan elektronik yang tidak diproses daripada dua tetapan Pendaftaran Data Kardiovaskular Kebangsaan Kolej Kardiologi Amerika. Kajian itu menganjurkan soalan pendaftaran kepada enam kategori berdasarkan kekaburan dan alasan klinikal yang diperlukan untuk menjawabnya.
Kertas itu, disemak pada arXiv pada 25 Ogos, melaporkan perintis dan kajian pengesahan yang melibatkan soalan pendaftaran klinikal dari American College of Cardiology's National Cardiovascular Data Registry. Dalam perintis di pusat perubatan akademik, model mengenal pasti sumber data calon untuk setiap soalan pendaftaran. Abstraktor yang berpengalaman kemudian menggunakan keputusan tersebut untuk menentukan set dokumen khusus soalan. Dalam kajian pengesahan di pusat kedua, menggunakan pendaftaran ACC NCDR kedua, model menjawab soalan daripada set tersebut. Reka bentuk ini memfokuskan penilaian pada mengekstrak dan mentafsir maklumat daripada bahan rekod perubatan sedia ada dan bukannya pada jadual data prapilihan yang dipermudahkan.
Sebelum menyemak output model, dua abstraktor secara bebas menetapkan kebenaran asas dan menugaskan setiap soalan kepada satu daripada enam kategori: Bendera Ubat/Peristiwa, Kehadiran Klinikal Perduaan, Pentadbiran, Makmal Kuantitatif/Fisiologi, Tafsiran Klinikal dan Masa Peristiwa. Kategori-kategori tersebut telah diperintahkan oleh kekaburan dan penaakulan klinikal yang diperlukan untuk menyelesaikan setiap soalan. Makalah itu melaporkan 9,430 jawapan abstrak yang diselaraskan menjadi 4,715 jawapan konsensus, termasuk 501 jawapan perintis dan 4,214 jawapan pengesahan. Dalam perintis, purata bilangan sumber data calon berjulat dari 14.6 untuk demografi hingga 89.2 untuk sejarah dan faktor risiko, dengan variasi yang besar ditunjukkan dalam sisihan piawai yang dilaporkan.
Dalam pengesahan, perjanjian antara penilai manusia adalah kira-kira 98%, menurut kajian itu. Jawapan LLM betul-betul sepadan dengan konsensus dalam 87% kes, diklasifikasikan sebagai padanan separa dalam 2%, dan tidak sepadan dalam 9%. Makalah ini melaporkan min ketepatan peringkat soalan sebanyak 91.5%, dengan sisihan piawai 13.4%, merentas 157 soalan yang masing-masing mempunyai sekurang-kurangnya 20 jawapan. Ketepatan berbeza mengikut kategori kekaburan, menurun daripada 96% untuk soalan Ubat/Bendera Acara kepada 62% untuk soalan Masa Acara. Sumber mengenal pasti kajian sebagai pracetak dan tidak menamakan model yang dinilai dalam abstrak.
Mengapa ia penting
Keputusan menunjukkan bahawa ketepatan purata boleh menyembunyikan kelemahan penting dalam AI penjagaan kesihatan. Model ini menunjukkan prestasi terbaik pada soalan ubat dan bendera acara yang agak langsung dan paling teruk apabila ia perlu mentafsir konteks klinikal atau menentukan apabila sesuatu peristiwa berlaku.
Penemuan utama bukan semata-mata bahawa LLM membuat kesilapan. Ia adalah prestasi menurun secara berstruktur apabila soalan menjadi lebih samar-samar dan menuntut lebih banyak penaakulan klinikal. Oleh itu, angka ketepatan keseluruhan tunggal sebanyak 91.5% boleh memberikan gambaran yang tidak lengkap tentang risiko operasi. Aliran kerja pendaftaran yang mengandungi banyak medan mudah mungkin kelihatan boleh dipercayai sementara masih berprestasi rendah pada set soalan yang lebih kecil yang memerlukan membina semula konteks, mentafsir bukti klinikal atau meletakkan peristiwa dalam masa.
Pendaftaran klinikal menyokong penyelidikan, pengukuran kualiti, penanda aras dan bentuk pelaporan penjagaan kesihatan yang lain. Ralat dalam pengabstrakan boleh menjejaskan kualiti rekod hiliran tersebut walaupun sistem tidak membuat diagnosis atau pengesyoran rawatan. Jurang yang dilaporkan antara kira-kira 98% persetujuan manusia dan kadar padanan tepat model yang lebih rendah menunjukkan bahawa semakan manusia kekal penting untuk tugas ini, terutamanya apabila jawapan bergantung pada berbilang dokumen atau pada mentafsir urutan peristiwa.
Kajian ini juga menawarkan cara praktikal untuk menilai model bahasa penjagaan kesihatan: bahagikan soalan mengikut jenis kekaburan yang terkandung di dalamnya, dan bukannya menganggap semua tugas pengekstrakan sebagai setara. Pendekatan itu boleh membantu organisasi mengenal pasti bidang mana yang sesuai untuk bantuan dan yang memerlukan semakan lebih dekat. Sumber tidak menunjukkan bahawa model itu menyebabkan kecederaan pesakit, operasi pendaftaran yang lebih baik, mengurangkan kos atau digunakan dalam penjagaan rutin. Hasil tersebut tetap tidak mantap.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Kajian itu tidak menentukan sama ada penemuan itu digeneralisasikan kepada model lain, hospital, kepakaran perubatan, pendaftaran atau membuat keputusan klinikal. Kerja selanjutnya harus menguji tetapan yang lebih luas, membandingkan versi model, memeriksa akibat daripada ralat separa dan menilai sama ada semakan manusia boleh menangkap kesilapan yang paling sukar dengan pasti.
Perkara utama yang tidak diketahui ialah sejauh mana hasil digunakan. Sumber itu menerangkan juruterbang di satu pusat perubatan akademik dan pengesahan di pusat kedua menggunakan pendaftaran NCDR ACC yang lain, tetapi ia tidak memberikan bukti secara abstrak tentang hospital komuniti, kepakaran lain, sistem rekod yang berbeza atau reka bentuk pendaftaran lain. Model yang dinilai juga tidak dikenal pasti dalam abstrak. Perbandingan merentas model dan versi model diperlukan sebelum membuat kesimpulan tentang prestasi LLM secara amnya.
Penilaian masa hadapan harus melaporkan lebih daripada ketepatan padanan tepat agregat. Soalan penting termasuk sama ada jawapan separa boleh digunakan secara klinikal, jenis kesilapan yang paling biasa, kekerapan ralat melibatkan tarikh atau rekod bercanggah, dan sama ada pengulas boleh mengesan kesilapan model secara konsisten. Keputusan peringkat kategori kajian menjadikan Masa Peristiwa sebagai kawasan yang sangat penting untuk tindakan susulan, tetapi sumber tidak menyatakan soalan individu, contoh ralat atau keterukan jawapan yang salah.
Ia juga tidak diketahui sama ada pemilihan sumber calon model dalam perintis mempengaruhi aliran kerja pengesahan kemudian atau sama ada prestasi serupa akan berlaku apabila set dokumen tidak dipilih susun oleh abstrak yang berpengalaman. Kajian lanjut boleh menguji rekod yang tidak diproses sepenuhnya, tahap bantuan manusia yang berbeza dan pemantauan prospektif dalam operasi pendaftaran sebenar. Sehingga bukti sedemikian tersedia, penemuan menyokong pengawasan manusia yang disasarkan untuk tugas abstrak yang samar-samar dan bukannya kesimpulan bahawa LLM bersedia untuk menggantikan abstraktor klinikal. Oleh itu, sumber membuka cara pendekatan yang sama akan berfungsi apabila pemilihan dokumen tidak dipandu oleh abstraktor berpengalaman, apabila rekod mengandungi tahap struktur yang berbeza, atau apabila penyemak memasuki proses pada titik yang berbeza.