發生了什麼事
由明尼蘇達大學領導的研究小組證明,混合開源光學字元辨識 (OCR) 管道可以從掃描的 Oncotype DX 乳癌報告中準確提取基因組復發評分。研究發表在《Cancer Causes & Control》上,結合使用 Tesseract 和 EasyOCR 引擎處理 675 份報告,與人工抽象的一致率達到 97%。此自動化系統的速度明顯優於傳統的手動註冊表輸入速度,後者通常面臨 12 至 18 個月的延遲。
包括Qianyun Luo和Schelomo Marmor在內的研究團隊開發了一種「混合OCR」(H-OCR)管道來解決癌症登記中的延遲問題。基因組測試結果(例如 Oncotype DX 復發評分)經常作為非結構化掃描圖像而不是機器可讀資料儲存在電子健康記錄 (EHR) 中,需要手動轉錄。
H-OCR 管道使用 EasyOCR 進行基於深度學習的文字偵測,並使用 Tesseract 作為字元辨識的後備引擎。這種混合方法旨在利用 EasyOCR 本地化報告上圓圈註解的能力,同時利用 Tesseract 的速度和字元辨識功能。
在 675 份報告的驗證集中,H-OCR 管道與手動參考標準的一致性達到 97%,優於傳統註冊表抽象的 91% 準確率。自動化流程在大約 4.9 小時內完成了任務,而當前手動工作流程通常會延遲數月之久。
研究發現,管道的置信度分數有效地識別了潛在的錯誤,這表明未來的實施可以使用這些分數來標記不確定的提取以供人工審查,從而最大限度地減少臨床上重大錯誤分類的風險。
為什麼這很重要
目前對基因組數據手動轉錄的依賴在癌症研究和精準腫瘤學中造成了重大瓶頸。透過自動從非結構化 PDF 中提取結構化數據,這種開源方法允許衛生系統近乎即時地填充癌症登記處。這種轉變對於提高現實世界證據的品質、實現更快的比較有效性研究以及提供訓練未來腫瘤學人工智慧模型所需的結構化資料至關重要。由於這些工具是開源的,並且可以在符合 HIPAA 的環境中運行,因此該方法為資源有限的機構提供了一種低成本、可重複的解決方案,使其無需專有軟體即可實現資料基礎設施的現代化。
基因組生物標記對於精準腫瘤學和品質測量至關重要,但其實用性目前受到將其納入研究資料庫所需時間的限制。減少這種延遲可以更及時地產生證據。
使用 Tesseract 和 EasyOCR 等開源工具可確保小型或資源有限的癌症中心可以使用該解決方案,這些中心可能缺乏昂貴的專有醫療數據提取軟體的預算。
該研究表明,這種自動捕獲的好處廣泛適用於不同的患者群體,因為研究人員發現患者人口統計和臨床因素並不能顯著預測提取錯誤。
透過將非結構化二元物件轉換為結構化數據,該管道提供了訓練和完善腫瘤學領域未來人工智慧和機器學習模型所需的高品質縱向數據。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
Which component of an AI application is the machine-learning model itself?
接下來看什麼
未來的研究需要解決該管道超出標準化 Oncotype DX 格式的可擴展性。作者指出,體細胞次世代定序報告在不同供應商之間表現出更大的異質性,對自動提取提出了更複雜的挑戰。此外,雖然該研究根據回顧性資料集驗證了管道,但需要在即時臨床註冊工作流程中進行前瞻性測試,以確認其在現實世界、大容量環境中的可靠性。
研究人員明確指出需要在更異質的文件類型(例如體細胞下一代定序報告)上測試管道,這些文件類型因供應商和格式而異。
該研究是在單一衛生系統中進行的;未來的工作必須評估多個機構的管道性能,以確保其在掃描品質、傳真解析度和不同 EHR 配置方面保持穩健。
下一個邏輯步驟是前瞻性地整合到即時註冊工作流程中,以確定係統在即時處理傳入的臨床資料時是否保持其準確性和效率。