Kembali ke Berita
InovasiAI Understanding taklimat

Kajian prospektif mendapati ketepatan LLM jatuh mendadak pada soalan pendaftaran klinikal yang samar-samar

Kajian prospektif berbilang tapak melaporkan bahawa model bahasa yang besar sepadan dengan 87% jawapan konsensus manusia apabila mengekstrak maklumat daripada rekod perubatan yang tidak diproses, tetapi ketepatan jatuh kepada 62% pada soalan yang memerlukan masa peristiwa dan penaakulan klinikal yang lebih besar.

5 min readRead the primary source
Source-page capture accompanying Prospective study finds LLM accuracy falls sharply on ambiguous clinical registry questions
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.20373
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Kebenaran Tanah
Label rujukan yang dipercayai digunakan untuk melatih atau menilai output model.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Penyelidik menilai model bahasa besar pada abstraksi pendaftaran klinikal menggunakan data rekod perubatan elektronik yang tidak diproses daripada dua tetapan Pendaftaran Data Kardiovaskular Kebangsaan Kolej Kardiologi Amerika. Kajian itu menganjurkan soalan pendaftaran kepada enam kategori berdasarkan kekaburan dan alasan klinikal yang diperlukan untuk menjawabnya.

Kertas itu, disemak pada arXiv pada 25 Ogos, melaporkan perintis dan kajian pengesahan yang melibatkan soalan pendaftaran klinikal dari American College of Cardiology's National Cardiovascular Data Registry. Dalam perintis di pusat perubatan akademik, model mengenal pasti sumber data calon untuk setiap soalan pendaftaran. Abstraktor yang berpengalaman kemudian menggunakan keputusan tersebut untuk menentukan set dokumen khusus soalan. Dalam kajian pengesahan di pusat kedua, menggunakan pendaftaran ACC NCDR kedua, model menjawab soalan daripada set tersebut. Reka bentuk ini memfokuskan penilaian pada mengekstrak dan mentafsir maklumat daripada bahan rekod perubatan sedia ada dan bukannya pada jadual data prapilihan yang dipermudahkan.

Sebelum menyemak output model, dua abstraktor secara bebas menetapkan kebenaran asas dan menugaskan setiap soalan kepada satu daripada enam kategori: Bendera Ubat/Peristiwa, Kehadiran Klinikal Perduaan, Pentadbiran, Makmal Kuantitatif/Fisiologi, Tafsiran Klinikal dan Masa Peristiwa. Kategori-kategori tersebut telah diperintahkan oleh kekaburan dan penaakulan klinikal yang diperlukan untuk menyelesaikan setiap soalan. Makalah itu melaporkan 9,430 jawapan abstrak yang diselaraskan menjadi 4,715 jawapan konsensus, termasuk 501 jawapan perintis dan 4,214 jawapan pengesahan. Dalam perintis, purata bilangan sumber data calon berjulat dari 14.6 untuk demografi hingga 89.2 untuk sejarah dan faktor risiko, dengan variasi yang besar ditunjukkan dalam sisihan piawai yang dilaporkan.

Dalam pengesahan, perjanjian antara penilai manusia adalah kira-kira 98%, menurut kajian itu. Jawapan LLM betul-betul sepadan dengan konsensus dalam 87% kes, diklasifikasikan sebagai padanan separa dalam 2%, dan tidak sepadan dalam 9%. Makalah ini melaporkan min ketepatan peringkat soalan sebanyak 91.5%, dengan sisihan piawai 13.4%, merentas 157 soalan yang masing-masing mempunyai sekurang-kurangnya 20 jawapan. Ketepatan berbeza mengikut kategori kekaburan, menurun daripada 96% untuk soalan Ubat/Bendera Acara kepada 62% untuk soalan Masa Acara. Sumber mengenal pasti kajian sebagai pracetak dan tidak menamakan model yang dinilai dalam abstrak.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Keputusan menunjukkan bahawa ketepatan purata boleh menyembunyikan kelemahan penting dalam AI penjagaan kesihatan. Model ini menunjukkan prestasi terbaik pada soalan ubat dan bendera acara yang agak langsung dan paling teruk apabila ia perlu mentafsir konteks klinikal atau menentukan apabila sesuatu peristiwa berlaku.

Penemuan utama bukan semata-mata bahawa LLM membuat kesilapan. Ia adalah prestasi menurun secara berstruktur apabila soalan menjadi lebih samar-samar dan menuntut lebih banyak penaakulan klinikal. Oleh itu, angka ketepatan keseluruhan tunggal sebanyak 91.5% boleh memberikan gambaran yang tidak lengkap tentang risiko operasi. Aliran kerja pendaftaran yang mengandungi banyak medan mudah mungkin kelihatan boleh dipercayai sementara masih berprestasi rendah pada set soalan yang lebih kecil yang memerlukan membina semula konteks, mentafsir bukti klinikal atau meletakkan peristiwa dalam masa.

Pendaftaran klinikal menyokong penyelidikan, pengukuran kualiti, penanda aras dan bentuk pelaporan penjagaan kesihatan yang lain. Ralat dalam pengabstrakan boleh menjejaskan kualiti rekod hiliran tersebut walaupun sistem tidak membuat diagnosis atau pengesyoran rawatan. Jurang yang dilaporkan antara kira-kira 98% persetujuan manusia dan kadar padanan tepat model yang lebih rendah menunjukkan bahawa semakan manusia kekal penting untuk tugas ini, terutamanya apabila jawapan bergantung pada berbilang dokumen atau pada mentafsir urutan peristiwa.

Kajian ini juga menawarkan cara praktikal untuk menilai model bahasa penjagaan kesihatan: bahagikan soalan mengikut jenis kekaburan yang terkandung di dalamnya, dan bukannya menganggap semua tugas pengekstrakan sebagai setara. Pendekatan itu boleh membantu organisasi mengenal pasti bidang mana yang sesuai untuk bantuan dan yang memerlukan semakan lebih dekat. Sumber tidak menunjukkan bahawa model itu menyebabkan kecederaan pesakit, operasi pendaftaran yang lebih baik, mengurangkan kos atau digunakan dalam penjagaan rutin. Hasil tersebut tetap tidak mantap.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Kajian itu tidak menentukan sama ada penemuan itu digeneralisasikan kepada model lain, hospital, kepakaran perubatan, pendaftaran atau membuat keputusan klinikal. Kerja selanjutnya harus menguji tetapan yang lebih luas, membandingkan versi model, memeriksa akibat daripada ralat separa dan menilai sama ada semakan manusia boleh menangkap kesilapan yang paling sukar dengan pasti.

Perkara utama yang tidak diketahui ialah sejauh mana hasil digunakan. Sumber itu menerangkan juruterbang di satu pusat perubatan akademik dan pengesahan di pusat kedua menggunakan pendaftaran NCDR ACC yang lain, tetapi ia tidak memberikan bukti secara abstrak tentang hospital komuniti, kepakaran lain, sistem rekod yang berbeza atau reka bentuk pendaftaran lain. Model yang dinilai juga tidak dikenal pasti dalam abstrak. Perbandingan merentas model dan versi model diperlukan sebelum membuat kesimpulan tentang prestasi LLM secara amnya.

Penilaian masa hadapan harus melaporkan lebih daripada ketepatan padanan tepat agregat. Soalan penting termasuk sama ada jawapan separa boleh digunakan secara klinikal, jenis kesilapan yang paling biasa, kekerapan ralat melibatkan tarikh atau rekod bercanggah, dan sama ada pengulas boleh mengesan kesilapan model secara konsisten. Keputusan peringkat kategori kajian menjadikan Masa Peristiwa sebagai kawasan yang sangat penting untuk tindakan susulan, tetapi sumber tidak menyatakan soalan individu, contoh ralat atau keterukan jawapan yang salah.

Ia juga tidak diketahui sama ada pemilihan sumber calon model dalam perintis mempengaruhi aliran kerja pengesahan kemudian atau sama ada prestasi serupa akan berlaku apabila set dokumen tidak dipilih susun oleh abstrak yang berpengalaman. Kajian lanjut boleh menguji rekod yang tidak diproses sepenuhnya, tahap bantuan manusia yang berbeza dan pemantauan prospektif dalam operasi pendaftaran sebenar. Sehingga bukti sedemikian tersedia, penemuan menyokong pengawasan manusia yang disasarkan untuk tugas abstrak yang samar-samar dan bukannya kesimpulan bahawa LLM bersedia untuk menggantikan abstraktor klinikal. Oleh itu, sumber membuka cara pendekatan yang sama akan berfungsi apabila pemilihan dokumen tidak dipandu oleh abstraktor berpengalaman, apabila rekod mengandungi tahap struktur yang berbeza, atau apabila penyemak memasuki proses pada titik yang berbeza.

Panduan & kuiz berkaitan

Model AI DiterangkanEtika AILatihan AIChatGPT & LLMUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?