Cosa è successo
Un gruppo di ricerca guidato dall’Università del Minnesota ha dimostrato che una ibrida di riconoscimento ottico dei caratteri (OCR) open source può estrarre con precisione i punteggi di recidiva genomica dai rapporti scansionati sul cancro al seno Oncotype DX. Lo studio, pubblicato su Cancer Causes & Control, ha utilizzato una combinazione di motori Tesseract e EasyOCR per elaborare 675 report, ottenendo un tasso di concordanza del 97% con l’astrazione manuale umana. Il sistema automatizzato ha notevolmente superato la velocità del tradizionale inserimento manuale nel registro, che spesso subisce ritardi da 12 a 18 mesi.
Il gruppo di ricerca, che comprende Qianyun Luo e Schelomo Marmor, ha sviluppato una di "OCR ibrido" (H-OCR) per affrontare la latenza nei registri dei tumori. I risultati dei test genomici, come il punteggio di recidiva Oncotype DX, sono spesso archiviati nelle cartelle cliniche elettroniche (EHR) come immagini scansionate non strutturate anziché come dati leggibili dalla macchina, richiedendo la trascrizione manuale.
La H-OCR utilizza EasyOCR per il rilevamento del testo basato sul deep learning e Tesseract come motore di fallback per il riconoscimento dei caratteri. Questo approccio ibrido è stato progettato per sfruttare la capacità di EasyOCR di localizzare le annotazioni cerchiate sui report utilizzando al tempo stesso la velocità e le capacità di riconoscimento dei caratteri di Tesseract.
In un set di convalida di 675 report, la H-OCR ha raggiunto un accordo del 97% con gli standard di riferimento manuali, superando il tasso di accuratezza del 91% dell'astrazione del registro convenzionale. Il processo automatizzato ha completato l'attività in circa 4,9 ore, rispetto ai ritardi di mesi tipici degli attuali flussi di lavoro manuali.
Lo studio ha rilevato che i punteggi di confidenza della identificano efficacemente potenziali errori, suggerendo che le implementazioni future potrebbero utilizzare questi punteggi per contrassegnare estrazioni incerte per la revisione umana, riducendo così al minimo il rischio di errori di classificazione clinicamente significativi.
Dettagli della fonte: bioengineer.org ↗
Perché è importante
L’attuale dipendenza dalla trascrizione manuale dei dati genomici crea un collo di bottiglia significativo nella ricerca sul cancro e nell’oncologia di precisione. Automatizzando l'estrazione di dati strutturati da PDF non strutturati, questo approccio open source consente ai sistemi sanitari di popolare i registri dei tumori quasi in tempo reale. Questo cambiamento è fondamentale per migliorare la qualità delle prove del mondo reale, consentire una ricerca più rapida sull’efficacia comparativa e fornire i dati strutturati necessari per addestrare i futuri modelli di intelligenza artificiale in oncologia. Poiché gli strumenti sono open source e possono funzionare in ambienti conformi a HIPAA, questo metodo offre una soluzione riproducibile e a basso costo per le istituzioni con risorse limitate per modernizzare la propria infrastruttura dati senza software proprietario.
I biomarcatori genomici sono essenziali per l’oncologia di precisione e la misurazione della qualità, ma la loro utilità è attualmente limitata dal tempo necessario per renderli disponibili nei database di ricerca. La riduzione di questa latenza consente una generazione di prove più tempestiva.
L’uso di strumenti open source come Tesseract e EasyOCR garantisce che la soluzione sia accessibile a centri oncologici più piccoli o con risorse limitate che potrebbero non avere il budget per costosi software proprietari di estrazione di dati medici.
Lo studio ha dimostrato che i vantaggi di questa acquisizione automatizzata sono ampiamente applicabili a diverse popolazioni di pazienti, poiché i ricercatori hanno scoperto che i dati demografici dei pazienti e i fattori clinici non prevedevano in modo significativo gli errori di estrazione.
Convertendo oggetti binari non strutturati in dati strutturati, questa fornisce i dati longitudinali di alta qualità necessari per la formazione e il perfezionamento dei futuri modelli di intelligenza artificiale e apprendimento automatico nello spazio oncologico.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
Which component of an AI application is the machine-learning model itself?
Cosa guardare dopo
La ricerca futura dovrà affrontare la scalabilità di questa oltre il formato standardizzato Oncotype DX. Gli autori hanno notato che i rapporti sul sequenziamento somatico di nuova generazione, che mostrano una maggiore eterogeneità tra i fornitori, rappresentano una sfida più complessa per l’estrazione automatizzata. Inoltre, mentre lo studio ha convalidato la pipeline rispetto a un set di dati retrospettivo, sono necessari test prospettici all’interno dei flussi di lavoro dei registri clinici in tempo reale per confermarne l’affidabilità in contesti reali con volumi elevati.
I ricercatori hanno identificato esplicitamente la necessità di testare la su tipi di documenti più eterogenei, come i rapporti di sequenziamento somatico di prossima generazione, che variano in modo significativo in base al fornitore e al formato.
Lo studio è stato condotto presso un unico sistema sanitario; il lavoro futuro dovrà valutare le prestazioni della tra più istituti per garantire che rimanga solida rispetto alle variazioni nella qualità della scansione, nella risoluzione dei fax e nelle diverse configurazioni EHR.
La potenziale integrazione nei flussi di lavoro del registro in tempo reale è il passo logico successivo per determinare se il sistema mantiene la sua accuratezza ed efficienza durante l'elaborazione dei dati clinici in arrivo in tempo reale.