Tillbaka till Nyheter
InnovationAI Understanding genomgång

OCR-pipeline med öppen källkod minskar fördröjningen av cancerregisterdata

Forskare vid University of Minnesota utvecklade en hybrid OCR-pipeline med öppen källkod som extraherar genomiska testresultat från kliniska rapporter med 97 % noggrannhet, vilket potentiellt kan ersätta långsam manuell datainmatning.

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
KällhänvisningKälla inspelad
Förläggare
bioengineer.org
Källlänk
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
Källtyp
Länkad källa – status för primär källa har inte fastställts.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

OCR (Optical Character Recognition)
Teknik som konverterar text i bilder eller skannar till maskinläsbar text.
Rörledning
Ett ordnat arbetsflöde av förbearbetnings-, modellsteg och efterbearbetningssteg.
Latens
Tiden mellan att skicka en förfrågan och ta emot modellens utdata.
Testa dig självAI Models Explained Quiz

Vad hände

En forskargrupp ledd av University of Minnesota har visat att en hybrid för optisk teckenigenkänning (OCR) med öppen källkod kan extrahera genomiska återfallspoäng från skannade Oncotype DX-bröstcancerrapporter. Studien, publicerad i Cancer Causes & Control, använde en kombination av Tesseract- och EasyOCR-motorer för att bearbeta 675 rapporter, vilket uppnådde en överensstämmelsegrad på 97 % med manuell mänsklig abstraktion. Det automatiserade systemet överträffade avsevärt hastigheten för traditionell manuell registerinmatning, som ofta möter 12 till 18 månaders förseningar.

Forskargruppen, inklusive Qianyun Luo och Schelomo Marmor, utvecklade en "hybrid OCR" (H-OCR) för att hantera latensen i cancerregister. Genomiska testresultat, såsom Oncotype DX recurrence-poäng, lagras ofta i elektroniska hälsojournaler (EHR) som ostrukturerade skannade bilder snarare än maskinläsbara data, vilket kräver manuell transkription.

H-OCR-pipelinen använder EasyOCR för sin djupinlärningsbaserade textdetektering och Tesseract som en reservmotor för teckenigenkänning. Den här hybridmetoden utformades för att utnyttja EasyOCR:s förmåga att lokalisera inringade anteckningar på rapporter samtidigt som Tesseracts hastighets- och teckenigenkänningsfunktioner används.

I en valideringsuppsättning av 675 rapporter uppnådde H-OCR-pipelinen 97 % överensstämmelse med manuella referensstandarder, vilket överträffade 91 % noggrannhetsgraden för konventionell registerabstraktion. Den automatiserade processen slutförde uppgiften på cirka 4,9 timmar, jämfört med de månader långa förseningar som är typiska för nuvarande manuella arbetsflöden.

Studien fann att pipelinens konfidenspoäng effektivt identifierade potentiella fel, vilket tyder på att framtida implementeringar skulle kunna använda dessa poäng för att flagga osäkra extraktioner för mänsklig granskning, och därigenom minimera risken för kliniskt signifikant felklassificering.

Källinformation: bioengineer.org ↗

Varför det spelar roll

Det nuvarande beroendet av manuell transkription för genomiska data skapar en betydande flaskhals i cancerforskning och precision onkologi. Genom att automatisera extraheringen av strukturerad data från ostrukturerade PDF-filer, tillåter detta tillvägagångssätt med öppen källkod hälsosystem att fylla i cancerregister i nästan realtid. Denna förändring är avgörande för att förbättra kvaliteten på verkliga bevis, möjliggöra snabbare jämförande effektivitetsforskning och tillhandahålla de strukturerade data som krävs för att träna framtida AI-modeller i onkologi. Eftersom verktygen är öppen källkod och kan fungera i HIPAA-kompatibla miljöer, erbjuder denna metod en billig, reproducerbar lösning för resursbegränsade institutioner att modernisera sin datainfrastruktur utan proprietär programvara.

Genomiska biomarkörer är avgörande för precision onkologi och kvalitetsmätning, men deras användbarhet är för närvarande begränsad av den tid det tar att göra dem tillgängliga i forskningsdatabaser. Att minska denna latens möjliggör mer läglig bevisgenerering.

Användningen av verktyg med öppen källkod som Tesseract och EasyOCR säkerställer att lösningen är tillgänglig för mindre eller resursbegränsade cancercentra som kanske saknar budget för dyr, proprietär programvara för medicinsk dataextraktion.

Studien visade att fördelarna med denna automatiserade infångning är allmänt tillämpliga i olika patientpopulationer, eftersom forskarna fann att patientdemografi och kliniska faktorer inte signifikant förutspådde extraktionsfel.

Genom att konvertera ostrukturerade binära objekt till strukturerad data tillhandahåller denna den högkvalitativa longitudinella data som krävs för att träna och förfina framtida AI- och maskininlärningsmodeller inom onkologiområdet.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Vad du ska titta på härnäst

Framtida forskning kommer att behöva ta itu med skalbarheten av denna utöver det standardiserade Oncotype DX-formatet. Författarna noterade att somatiska nästa generations sekvenseringsrapporter, som uppvisar större heterogenitet mellan leverantörer, utgör en mer komplex utmaning för automatiserad extraktion. Dessutom, medan studien validerade pipelinen mot en retrospektiv datauppsättning, krävs prospektiva tester inom levande kliniska registerarbetsflöden för att bekräfta dess tillförlitlighet i verkliga inställningar med hög volym.

Forskarna identifierade uttryckligen behovet av att testa pipelinen på mer heterogena dokumenttyper, såsom somatiska nästa generations sekvenseringsrapporter, som varierar avsevärt beroende på leverantör och format.

Studien genomfördes vid ett enda hälsosystem; Framtida arbete måste utvärdera pipelinens prestanda över flera institutioner för att säkerställa att den förblir robust mot variationer i skanningskvalitet, faxupplösning och olika EPJ-konfigurationer.

Prospektiv integrering i live registerarbetsflöden är nästa logiska steg för att avgöra om systemet bibehåller sin noggrannhet och effektivitet vid bearbetning av inkommande klinisk data i realtid.

Relaterade guider och frågesporter

AI-modeller förklarasAI utbildningAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?