Co se stalo
Výzkumný tým vedený univerzitou v Minnesotě prokázal, že hybridní open-source potrubí pro optické rozpoznávání znaků (OCR) dokáže přesně extrahovat skóre genomové recidivy z naskenovaných zpráv o rakovině prsu Oncotype DX. Studie publikovaná v Cancer Causes & Control využila kombinaci enginů Tesseract a EasyOCR ke zpracování 675 zpráv, čímž bylo dosaženo 97% míry shody s manuální abstrakcí člověka. Automatizovaný systém výrazně překonal rychlost tradičního ručního zápisu do registru, který se často potýká s 12 až 18měsíčním zpožděním.
Výzkumný tým, včetně Qianyun Luo a Schelomo Marmor, vyvinul „hybridní OCR“ (H-OCR) potrubí pro řešení latence v registrech rakoviny. Výsledky genomických testů, jako je skóre recidivy Oncotype DX, jsou často uloženy v elektronických zdravotních záznamech (EHR) jako nestrukturované naskenované obrázky spíše než strojově čitelná data, která vyžadují ruční přepis.
H-OCR potrubí využívá EasyOCR pro svou detekci textu založenou na hlubokém učení a Tesseract jako záložní modul pro rozpoznávání znaků. Tento hybridní přístup byl navržen tak, aby využil schopnost EasyOCR lokalizovat zakroužkované anotace na sestavách při využití rychlosti Tesseract a schopností rozpoznávání znaků.
Ve validační sadě 675 zpráv dosáhlo potrubí H-OCR 97% shody s manuálními referenčními standardy, čímž překonalo 91% míru přesnosti konvenční abstrakce registru. Automatizovaný proces dokončil úkol přibližně za 4,9 hodiny ve srovnání s měsíčními prodlevami typickými pro současné manuální pracovní postupy.
Studie zjistila, že skóre spolehlivosti potrubí účinně identifikovalo potenciální chyby, což naznačuje, že budoucí implementace by mohly tato skóre použít k označení nejistých extrakcí pro kontrolu člověkem, čímž se minimalizuje riziko klinicky významné nesprávné klasifikace.
Podrobnosti o zdroji: bioengineer.org ↗
Proč na tom záleží
Současná závislost na manuální transkripci genomických dat vytváří významnou překážku ve výzkumu rakoviny a přesné onkologii. Automatizací extrakce strukturovaných dat z nestrukturovaných PDF umožňuje tento přístup s otevřeným zdrojovým kódem zdravotnickým systémům naplňovat registry rakoviny téměř v reálném čase. Tento posun je zásadní pro zlepšení kvality důkazů v reálném světě, umožňující rychlejší výzkum srovnávací účinnosti a poskytování strukturovaných dat nezbytných pro trénování budoucích modelů umělé inteligence v onkologii. Vzhledem k tomu, že nástroje jsou open source a mohou fungovat v prostředích kompatibilních s HIPAA, nabízí tato metoda levné a reprodukovatelné řešení pro instituce s omezenými zdroji k modernizaci jejich datové infrastruktury bez proprietárního softwaru.
Genomické biomarkery jsou nezbytné pro precizní onkologii a měření kvality, ale jejich využitelnost je v současné době omezena časem, který zabere jejich zpřístupnění ve výzkumných databázích. Snížení této latence umožňuje včasnější generování důkazů.
Použití nástrojů s otevřeným zdrojovým kódem, jako jsou Tesseract a EasyOCR, zajišťuje, že řešení je přístupné menším onkologickým centrům nebo centrům s omezenými zdroji, kterým může chybět rozpočet na drahý, patentovaný software pro extrakci lékařských dat.
Studie prokázala, že výhody tohoto automatického zachycení jsou široce použitelné napříč různými populacemi pacientů, protože výzkumníci zjistili, že demografické a klinické faktory pacientů významně nepředpovídaly chyby při extrakci.
Převedením nestrukturovaných binárních objektů na strukturovaná data poskytuje tento kanál vysoce kvalitní, longitudinální data nezbytná pro trénování a zdokonalování budoucích modelů umělé inteligence a strojového učení v onkologickém prostoru.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
Which component of an AI application is the machine-learning model itself?
Na co se dále dívat
Budoucí výzkum bude muset řešit škálovatelnost tohoto potrubí nad rámec standardizovaného formátu Oncotype DX. Autoři poznamenali, že zprávy o somatickém sekvenování nové generace, které vykazují větší heterogenitu mezi prodejci, představují složitější výzvu pro automatizovanou extrakci. Kromě toho, zatímco studie ověřovala kanál na základě retrospektivního souboru dat, je nutné prospektivní testování v rámci pracovních postupů v reálném klinickém registru, aby se potvrdila jeho spolehlivost v reálných prostředích s velkým objemem.
Výzkumníci výslovně identifikovali potřebu otestovat kanál na více heterogenních typech dokumentů, jako jsou somatické zprávy o sekvenování nové generace, které se výrazně liší podle dodavatele a formátu.
Studie byla provedena v jediném zdravotnickém systému; budoucí práce musí vyhodnotit výkon potrubí napříč různými institucemi, aby bylo zajištěno, že zůstane odolný vůči změnám v kvalitě skenování, rozlišení faxu a různým konfiguracím EHR.
Prospektivní integrace do pracovních postupů živého registru je dalším logickým krokem k určení, zda si systém zachová svou přesnost a efektivitu při zpracování příchozích klinických dat v reálném čase.