Que s'est-il passé
Une équipe de recherche dirigée par l’Université du Minnesota a démontré qu’un hybride de reconnaissance optique de caractères (OCR) peut extraire avec précision les scores de récidive génomique des rapports numérisés sur le cancer du sein Oncotype DX. L'étude, publiée dans Cancer Causes & Control, a utilisé une combinaison des moteurs Tesseract et EasyOCR pour traiter 675 rapports, atteignant un taux de concordance de 97 % avec l'abstraction humaine manuelle. Le système automatisé a largement dépassé la vitesse de la saisie manuelle traditionnelle dans le registre, qui est souvent confrontée à des retards de 12 à 18 mois.
L'équipe de recherche, comprenant Qianyun Luo et Schelomo Marmor, a développé un « OCR hybride » (H-OCR) pour résoudre le problème de latence dans les registres du cancer. Les résultats des tests génomiques, tels que le score de récidive Oncotype DX, sont fréquemment stockés dans les dossiers de santé électroniques (DSE) sous forme d'images numérisées non structurées plutôt que de données lisibles par machine, nécessitant une transcription manuelle.
Le H-OCR utilise EasyOCR pour sa détection de texte basée sur l'apprentissage profond et Tesseract comme moteur de secours pour la reconnaissance de caractères. Cette approche hybride a été conçue pour tirer parti de la capacité d'EasyOCR à localiser les annotations encerclées sur les rapports tout en utilisant la vitesse et les capacités de reconnaissance de caractères de Tesseract.
Dans un ensemble de validation de 675 rapports, le H-OCR a atteint un taux de concordance de 97 % avec les normes de référence manuelles, surpassant le taux d'exactitude de 91 % de l'abstraction conventionnelle des registres. Le processus automatisé a réalisé la tâche en environ 4,9 heures, comparé aux délais de plusieurs mois typiques des flux de travail manuels actuels.
L'étude a révélé que les scores de confiance du identifiaient efficacement les erreurs potentielles, ce qui suggère que les mises en œuvre futures pourraient utiliser ces scores pour signaler les extractions incertaines à des fins d'examen humain, minimisant ainsi le risque d'erreur de classification cliniquement significative.
Détails de la source: bioengineer.org ↗
Pourquoi c'est important
Le recours actuel à la transcription manuelle des données génomiques crée un goulot d’étranglement important dans la recherche sur le cancer et l’oncologie de précision. En automatisant l'extraction de données structurées à partir de fichiers PDF non structurés, cette approche open source permet aux systèmes de santé de remplir les registres du cancer en temps quasi réel. Ce changement est essentiel pour améliorer la qualité des preuves du monde réel, permettre des recherches plus rapides sur l’efficacité comparative et fournir les données structurées nécessaires à la formation des futurs modèles d’IA en oncologie. Étant donné que les outils sont open source et peuvent fonctionner dans des environnements conformes à la loi HIPAA, cette méthode offre une solution peu coûteuse et reproductible aux institutions aux ressources limitées pour moderniser leur infrastructure de données sans logiciel propriétaire.
Les biomarqueurs génomiques sont essentiels pour la précision en oncologie et la mesure de la qualité, mais leur utilité est actuellement limitée par le temps nécessaire pour les rendre disponibles dans les bases de données de recherche. La réduction de cette latence permet une génération de preuves plus rapide.
L'utilisation d'outils open source tels que Tesseract et EasyOCR garantit que la solution est accessible aux centres de cancérologie plus petits ou aux ressources limitées qui peuvent ne pas disposer du budget nécessaire pour un logiciel d'extraction de données médicales exclusif et coûteux.
L'étude a démontré que les avantages de cette capture automatisée sont largement applicables à diverses populations de patients, car les chercheurs ont constaté que les données démographiques des patients et les facteurs cliniques ne permettaient pas de prédire de manière significative les erreurs d'extraction.
En convertissant des objets binaires non structurés en données structurées, ce fournit les données longitudinales de haute qualité nécessaires à la formation et au perfectionnement des futurs modèles d'IA et d'apprentissage automatique dans le domaine de l'oncologie.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
Which component of an AI application is the machine-learning model itself?
Que regarder ensuite
Les recherches futures devront aborder l’évolutivité de ce au-delà du format standardisé Oncotype DX. Les auteurs ont noté que les rapports de séquençage somatique de nouvelle génération, qui présentent une plus grande hétérogénéité entre les fournisseurs, présentent un défi plus complexe pour l'extraction automatisée. De plus, même si l'étude a validé le pipeline par rapport à un ensemble de données rétrospectives, des tests prospectifs au sein des flux de travail des registres cliniques en direct sont nécessaires pour confirmer sa fiabilité dans des contextes réels à volume élevé.
Les chercheurs ont explicitement identifié la nécessité de tester le sur des types de documents plus hétérogènes, tels que les rapports de séquençage somatique de nouvelle génération, qui varient considérablement selon le fournisseur et le format.
L'étude a été menée dans un seul système de santé ; les travaux futurs doivent évaluer les performances du dans plusieurs institutions pour garantir qu'il reste robuste face aux variations de qualité de numérisation, de résolution de télécopie et de différentes configurations de DSE.
L'intégration prospective dans les flux de travail du registre en direct est la prochaine étape logique pour déterminer si le système conserve sa précision et son efficacité lors du traitement des données cliniques entrantes en temps réel.