Hva skjedde
Et forskerteam ledet av University of Minnesota har vist at en hybrid åpen kildekode for optisk karaktergjenkjenning (OCR) kan nøyaktig trekke ut genomiske residivskårer fra skannede Oncotype DX brystkreftrapporter. Studien, publisert i Cancer Causes & Control, brukte en kombinasjon av Tesseract- og EasyOCR-motorer for å behandle 675 rapporter, og oppnådde en 97% samsvarsrate med manuell menneskelig abstraksjon. Det automatiserte systemet overgikk betydelig hastigheten til tradisjonell manuell registrering av registeret, som ofte står overfor 12 til 18 måneders forsinkelser.
Forskerteamet, inkludert Qianyun Luo og Schelomo Marmor, utviklet en 'hybrid OCR' (H-OCR) for å adressere latensen i kreftregistrene. Genomiske testresultater, slik som Oncotype DX-residivscore, lagres ofte i elektroniske helsejournaler (EPJer) som ustrukturerte skannede bilder i stedet for maskinlesbare data, som krever manuell transkripsjon.
H-OCR-pipelinen bruker EasyOCR for sin dyplæringsbaserte tekstgjenkjenning og Tesseract som en reservemotor for karaktergjenkjenning. Denne hybride tilnærmingen ble designet for å utnytte EasyOCRs evne til å lokalisere sirklede merknader på rapporter samtidig som Tesseracts hastighet og karaktergjenkjenningsfunksjoner brukes.
I et valideringssett med 675 rapporter oppnådde H-OCR-pipelinen 97 % samsvar med manuelle referansestandarder, og overgikk 91 % nøyaktighetsgraden for konvensjonell registerabstraksjon. Den automatiserte prosessen fullførte oppgaven på omtrent 4,9 timer, sammenlignet med månedslange forsinkelser som er typiske for gjeldende manuelle arbeidsflyter.
Studien fant at rørledningens konfidensscore effektivt identifiserte potensielle feil, noe som tyder på at fremtidige implementeringer kan bruke disse poengsummene til å flagge usikre ekstraksjoner for menneskelig vurdering, og dermed minimere risikoen for klinisk signifikant feilklassifisering.
Kildedetaljer: bioengineer.org ↗
Hvorfor det betyr noe
Den nåværende avhengigheten av manuell transkripsjon for genomiske data skaper en betydelig flaskehals i kreftforskning og presisjonsonkologi. Ved å automatisere utvinningen av strukturerte data fra ustrukturerte PDF-filer, lar denne åpen kildekode-tilnærmingen helsesystemer fylle ut kreftregistre i nesten sanntid. Dette skiftet er avgjørende for å forbedre kvaliteten på bevis fra den virkelige verden, muliggjøre raskere komparativ effektivitetsforskning og gi de strukturerte dataene som er nødvendige for å trene fremtidige AI-modeller i onkologi. Fordi verktøyene er åpen kildekode og kan operere i HIPAA-kompatible miljøer, tilbyr denne metoden en rimelig, reproduserbar løsning for ressursbegrensede institusjoner for å modernisere datainfrastrukturen deres uten proprietær programvare.
Genomiske biomarkører er avgjørende for presisjon onkologi og kvalitetsmåling, men deres nytte er for tiden begrenset av tiden det tar å gjøre dem tilgjengelige i forskningsdatabaser. Å redusere denne latensen gir mer rettidig bevisgenerering.
Bruken av åpen kildekode-verktøy som Tesseract og EasyOCR sikrer at løsningen er tilgjengelig for mindre eller ressursbegrensede kreftsentre som kanskje mangler budsjett for dyr, proprietær programvare for utvinning av medisinske data.
Studien viste at fordelene med denne automatiserte fangsten er bredt anvendbare på tvers av ulike pasientpopulasjoner, ettersom forskerne fant at pasientdemografi og kliniske faktorer ikke signifikant predikerte ekstraksjonsfeil.
Ved å konvertere ustrukturerte binære objekter til strukturerte data, gir denne rørledningen de høykvalitets, langsgående dataene som er nødvendige for å trene og raffinere fremtidige AI- og maskinlæringsmodeller i onkologiområdet.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
Which component of an AI application is the machine-learning model itself?
Hva du skal se neste
Fremtidig forskning vil måtte ta for seg skalerbarheten til denne rørledningen utover det standardiserte Oncotype DX-formatet. Forfatterne bemerket at somatiske neste generasjons sekvenseringsrapporter, som viser større heterogenitet på tvers av leverandører, utgjør en mer kompleks utfordring for automatisert utvinning. I tillegg, mens studien validerte pipelinen mot et retrospektivt datasett, kreves prospektiv testing innenfor levende kliniske registerarbeidsflyter for å bekrefte dens pålitelighet i reelle høyvolumsinnstillinger.
Forskerne identifiserte eksplisitt behovet for å teste rørledningen på mer heterogene dokumenttyper, for eksempel somatiske neste generasjons sekvenseringsrapporter, som varierer betydelig etter leverandør og format.
Studien ble utført ved et enkelt helsesystem; fremtidig arbeid må evaluere rørledningens ytelse på tvers av flere institusjoner for å sikre at den forblir robust mot variasjoner i skannekvalitet, faksoppløsning og forskjellige EPJ-konfigurasjoner.
Prospektiv integrering i live registerarbeidsflyter er det neste logiske trinnet for å avgjøre om systemet opprettholder nøyaktigheten og effektiviteten når den behandler innkommende kliniske data i sanntid.