Torna alle notizie
InnovazioneAI Understanding briefing

La pipeline OCR open source riduce la latenza dei dati del registro dei tumori

I ricercatori dell’Università del Minnesota hanno sviluppato una pipeline OCR ibrida open source che estrae i punteggi dei test genomici dai rapporti clinici con una precisione del 97%, sostituendo potenzialmente la lenta immissione manuale dei dati.

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
Riferimento alla fonteFonte registrata
Editore
bioengineer.org
Collegamento alla fonte
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
Tipo di fonte
Fonte collegata: lo stato di fonte primaria non è stato stabilito.
ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

OCR (riconoscimento ottico dei caratteri)
Tecnologia che converte il testo in immagini o esegue la scansione in testo leggibile dalla macchina.
Conduttura
Un flusso di lavoro ordinato di pre-elaborazione, passaggi del modello e fasi di post-elaborazione.
Latenza
Il tempo che intercorre tra l'invio di una richiesta e la ricezione dell'output del modello.
Mettiti alla provaQuiz sulla spiegazione dei modelli di intelligenza artificiale

Cosa è successo

Un gruppo di ricerca guidato dall’Università del Minnesota ha dimostrato che una ibrida di riconoscimento ottico dei caratteri (OCR) open source può estrarre con precisione i punteggi di recidiva genomica dai rapporti scansionati sul cancro al seno Oncotype DX. Lo studio, pubblicato su Cancer Causes & Control, ha utilizzato una combinazione di motori Tesseract e EasyOCR per elaborare 675 report, ottenendo un tasso di concordanza del 97% con l’astrazione manuale umana. Il sistema automatizzato ha notevolmente superato la velocità del tradizionale inserimento manuale nel registro, che spesso subisce ritardi da 12 a 18 mesi.

Il gruppo di ricerca, che comprende Qianyun Luo e Schelomo Marmor, ha sviluppato una di "OCR ibrido" (H-OCR) per affrontare la latenza nei registri dei tumori. I risultati dei test genomici, come il punteggio di recidiva Oncotype DX, sono spesso archiviati nelle cartelle cliniche elettroniche (EHR) come immagini scansionate non strutturate anziché come dati leggibili dalla macchina, richiedendo la trascrizione manuale.

La H-OCR utilizza EasyOCR per il rilevamento del testo basato sul deep learning e Tesseract come motore di fallback per il riconoscimento dei caratteri. Questo approccio ibrido è stato progettato per sfruttare la capacità di EasyOCR di localizzare le annotazioni cerchiate sui report utilizzando al tempo stesso la velocità e le capacità di riconoscimento dei caratteri di Tesseract.

In un set di convalida di 675 report, la H-OCR ha raggiunto un accordo del 97% con gli standard di riferimento manuali, superando il tasso di accuratezza del 91% dell'astrazione del registro convenzionale. Il processo automatizzato ha completato l'attività in circa 4,9 ore, rispetto ai ritardi di mesi tipici degli attuali flussi di lavoro manuali.

Lo studio ha rilevato che i punteggi di confidenza della identificano efficacemente potenziali errori, suggerendo che le implementazioni future potrebbero utilizzare questi punteggi per contrassegnare estrazioni incerte per la revisione umana, riducendo così al minimo il rischio di errori di classificazione clinicamente significativi.

Dettagli della fonte: bioengineer.org ↗

Perché è importante

L’attuale dipendenza dalla trascrizione manuale dei dati genomici crea un collo di bottiglia significativo nella ricerca sul cancro e nell’oncologia di precisione. Automatizzando l'estrazione di dati strutturati da PDF non strutturati, questo approccio open source consente ai sistemi sanitari di popolare i registri dei tumori quasi in tempo reale. Questo cambiamento è fondamentale per migliorare la qualità delle prove del mondo reale, consentire una ricerca più rapida sull’efficacia comparativa e fornire i dati strutturati necessari per addestrare i futuri modelli di intelligenza artificiale in oncologia. Poiché gli strumenti sono open source e possono funzionare in ambienti conformi a HIPAA, questo metodo offre una soluzione riproducibile e a basso costo per le istituzioni con risorse limitate per modernizzare la propria infrastruttura dati senza software proprietario.

I biomarcatori genomici sono essenziali per l’oncologia di precisione e la misurazione della qualità, ma la loro utilità è attualmente limitata dal tempo necessario per renderli disponibili nei database di ricerca. La riduzione di questa latenza consente una generazione di prove più tempestiva.

L’uso di strumenti open source come Tesseract e EasyOCR garantisce che la soluzione sia accessibile a centri oncologici più piccoli o con risorse limitate che potrebbero non avere il budget per costosi software proprietari di estrazione di dati medici.

Lo studio ha dimostrato che i vantaggi di questa acquisizione automatizzata sono ampiamente applicabili a diverse popolazioni di pazienti, poiché i ricercatori hanno scoperto che i dati demografici dei pazienti e i fattori clinici non prevedevano in modo significativo gli errori di estrazione.

Convertendo oggetti binari non strutturati in dati strutturati, questa fornisce i dati longitudinali di alta qualità necessari per la formazione e il perfezionamento dei futuri modelli di intelligenza artificiale e apprendimento automatico nello spazio oncologico.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Verifica concettuale interattiva+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Cosa guardare dopo

La ricerca futura dovrà affrontare la scalabilità di questa oltre il formato standardizzato Oncotype DX. Gli autori hanno notato che i rapporti sul sequenziamento somatico di nuova generazione, che mostrano una maggiore eterogeneità tra i fornitori, rappresentano una sfida più complessa per l’estrazione automatizzata. Inoltre, mentre lo studio ha convalidato la pipeline rispetto a un set di dati retrospettivo, sono necessari test prospettici all’interno dei flussi di lavoro dei registri clinici in tempo reale per confermarne l’affidabilità in contesti reali con volumi elevati.

I ricercatori hanno identificato esplicitamente la necessità di testare la su tipi di documenti più eterogenei, come i rapporti di sequenziamento somatico di prossima generazione, che variano in modo significativo in base al fornitore e al formato.

Lo studio è stato condotto presso un unico sistema sanitario; il lavoro futuro dovrà valutare le prestazioni della tra più istituti per garantire che rimanga solida rispetto alle variazioni nella qualità della scansione, nella risoluzione dei fax e nelle diverse configurazioni EHR.

La potenziale integrazione nei flussi di lavoro del registro in tempo reale è il passo logico successivo per determinare se il sistema mantiene la sua accuratezza ed efficienza durante l'elaborazione dei dati clinici in arrivo in tempo reale.

Guide e quiz correlati

Spiegazione dei modelli di intelligenza artificialeFormazione sull'intelligenza artificialeFuturo dell'IAMetti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker del rilascio del modello AI
Lo hai trovato utile?