發生了什麼事
研究人員使用來自兩個美國心臟病學會國家心血管數據註冊設置的未處理電子病歷數據評估了臨床註冊抽象的大型語言模型。研究根據模糊性和回答這些問題所需的臨床推理,將登記問題分為六類。
該論文於 8 月 25 日在 arXiv 上進行了修訂,報告了一項試點研究和一項驗證研究,涉及美國心臟病學會國家心血管數據登記處的臨床登記問題。在學術醫療中心的試點中,該模型確定了每個註冊問題的候選資料來源。然後,經驗豐富的抽象者使用這些結果來定義特定於問題的文件集。在第二個中心的驗證研究中,使用第二個 ACC NCDR 註冊中心,該模型回答了這些集合中的問題。該設計將評估重點放在從現有病歷材料中提取和解釋信息,而不是簡化的預選數據表上。
在審查模型輸出之前,兩名抽象者獨立建立了基本事實,並將每個問題分配給六個類別之一:藥物/事件標記、二元臨床存在、管理、定量實驗室/生理、臨床解釋和事件計時。這些類別是根據解決每個問題所需的模糊性和臨床推理來排序的。論文報告了 9,430 個摘要答案,已調整為 4,715 個共識答案,其中包括 501 個試點答案和 4,214 個驗證答案。在試點中,候選資料來源的平均數量範圍從人口統計資料的 14.6 個到歷史和風險因素的 89.2 個,報告的標準差反映了巨大的變化。
根據該研究,在驗證中,人類評估者之間的一致性約為 98%。 LLM 的答案在 87% 的情況下與共識完全一致,在 2% 的情況下被歸類為部分匹配,在 9% 的情況下不匹配。該論文報告了 157 個問題的平均問題級準確率為 91.5%,標準差為 13.4%,每個問題至少有 20 個答案。準確度因模糊類別而異,從藥物/事件標記問題的 96% 下降到事件計時問題的 62%。消息來源將研究確定為預印本,但沒有在摘要中命名評估的模型。
為什麼這很重要
結果表明,平均準確度可以掩蓋醫療保健人工智慧的重要弱點。該模型在相對直接的藥物和事件標記問題上表現最佳,在必須解釋臨床背景或確定事件發生時間時表現最差。
核心發現不只是法學碩士犯了錯。隨著問題變得更加模糊並且需要更多的臨床推理,成績會以結構化的方式下降。因此,91.5% 的整體準確度數字可能無法完整地反映操作風險。包含許多簡單欄位的註冊工作流程可能看起來很可靠,但在需要重建上下文、解釋臨床證據或及時放置事件的較小問題集上仍然表現不佳。
臨床註冊支援研究、品質測量、基準測試和其他形式的醫療保健報告。即使系統沒有做出診斷或治療建議,抽象錯誤也會影響這些下游記錄的品質。據報導,大約 98% 的人類一致性與模型較低的精確匹配率之間存在差距,這表明人類審查對於這項任務仍然很重要,特別是當答案取決於多個文件或解釋事件順序時。
該研究還提供了一種評估醫療保健語言模型的實用方法:根據問題所包含的歧義類型來劃分問題,而不是將所有提取任務視為等效。這種方法可以幫助組織確定哪些領域適合援助,哪些領域需要更仔細的審查。消息來源並未表明該模型造成了患者傷害、改善了登記操作、降低了成本或被部署在日常護理中。这些结果仍未确定。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
Which component of an AI application is the machine-learning model itself?
接下來看什麼
該研究並未確定這些發現是否可以推廣到其他模式、醫院、醫學專業、登記處或臨床決策。進一步的工作應該測試更廣泛的設置,比較模型版本,檢查部分錯誤的後果,並評估人工審查是否能夠可靠地發現最嚴重的錯誤。
一個關鍵的未知數是結果的適用範圍有多大。這個消息來源描述了一個學術醫療中心的試點以及使用另一個 ACC NCDR 註冊中心在第二個中心進行的驗證,但它沒有提供有關社區醫院、其他專業、不同記錄系統或其他註冊設計的摘要證據。评估的模型也没有在摘要中标识。在得出關於 LLM 表現的總體結論之前,需要對模型和模型版本進行比較。
未來的評估應該報告的不僅僅是總體的精確匹配準確性。重要的問題包括部分答案在臨床上是否可用、哪些類型的錯誤最常見、錯誤涉及日期或矛盾記錄的頻率以及審閱者是否能夠一致地檢測模型錯誤。研究的類別層級結果使事件計時成為一個特別重要的後續領域,但來源沒有具體說明各個問題、錯誤範例或錯誤答案的嚴重程度。
目前尚不清楚試點中模型的候選來源選擇是否影響了後續的驗證工作流程,或者當文件集不是由經驗豐富的抽象者策劃時是否會出現類似的效能。進一步的研究可以測試完全未經處理的記錄、不同程度的人工協助以及實際登記操作中的前瞻性監控。在獲得此類證據之前,研究結果支持對模糊抽象任務進行有針對性的人類監督,而不是得出法學碩士已準備好取代臨床抽象器的結論。因此,當文件選擇沒有由經驗豐富的摘要者指導時、當記錄包含不同層級的結構時、或當審閱者在不同點進入流程時,來源未公開相同的方法將如何執行。