무슨 일이 일어났나요?
미네소타 대학이 이끄는 연구팀은 하이브리드 오픈 소스 광학 문자 인식(OCR) 파이프라인이 스캔된 Oncotype DX 유방암 보고서에서 게놈 재발 점수를 정확하게 추출할 수 있음을 입증했습니다. Cancer Causes & Control에 발표된 이 연구는 Tesseract와 EasyOCR 엔진의 조합을 사용하여 675개의 보고서를 처리하여 수동 인간 추상화에 대해 97%의 동의율을 달성했습니다. 자동화된 시스템은 종종 12~18개월 지연이 발생하는 기존의 수동 레지스트리 입력 속도보다 훨씬 뛰어났습니다.
Qianyun Luo와 Schelomo Marmor를 포함한 연구팀은 암 등록의 대기 시간을 해결하기 위해 '하이브리드 OCR'(H-OCR) 파이프라인을 개발했습니다. Oncotype DX 재발 점수와 같은 게놈 테스트 결과는 기계 판독이 가능한 데이터가 아닌 구조화되지 않은 스캔 이미지로 전자 건강 기록(EHR)에 저장되는 경우가 많으며 수동 전사가 필요합니다.
H-OCR 파이프라인은 딥러닝 기반 텍스트 감지를 위해 EasyOCR을 사용하고 문자 인식을 위한 대체 엔진으로 Tesseract를 사용합니다. 이 하이브리드 접근 방식은 Tesseract의 속도와 문자 인식 기능을 활용하면서 보고서의 원 주석을 현지화하는 EasyOCR의 기능을 활용하도록 설계되었습니다.
675개 보고서로 구성된 검증 세트에서 H-OCR 파이프라인은 수동 참조 표준과 97% 일치를 달성하여 기존 레지스트리 추상화의 91% 정확도를 능가했습니다. 자동화된 프로세스는 현재 수동 워크플로우에서 일반적으로 몇 달 동안 지연되는 것과 비교하여 약 4.9시간 만에 작업을 완료했습니다.
연구에서는 파이프라인의 신뢰도 점수가 잠재적인 오류를 효과적으로 식별한다는 사실을 발견했으며, 이는 향후 구현에서 이러한 점수를 사용하여 사람의 검토를 위해 불확실한 추출을 표시함으로써 임상적으로 중요한 오분류 위험을 최소화할 수 있음을 시사합니다.
왜 중요한가요?
현재 게놈 데이터의 수동 전사에 대한 의존도는 암 연구 및 정밀 종양학에 심각한 병목 현상을 야기합니다. 구조화되지 않은 PDF에서 구조화된 데이터를 자동으로 추출함으로써 이 오픈 소스 접근 방식을 통해 의료 시스템은 거의 실시간으로 암 등록을 채울 수 있습니다. 이러한 변화는 실제 증거의 품질을 개선하고, 보다 빠른 비교 효과 연구를 가능하게 하며, 종양학에서 미래 AI 모델을 교육하는 데 필요한 구조화된 데이터를 제공하는 데 중요합니다. 도구는 오픈 소스이고 HIPAA 준수 환경 내에서 작동할 수 있기 때문에 이 방법은 리소스가 제한된 기관이 독점 소프트웨어 없이 데이터 인프라를 현대화할 수 있는 저비용의 재현 가능한 솔루션을 제공합니다.
게놈 바이오마커는 정밀 종양학 및 품질 측정에 필수적이지만 현재 연구 데이터베이스에서 사용할 수 있게 되는 데 걸리는 시간으로 인해 그 유용성이 제한됩니다. 이 대기 시간을 줄이면 더 적시에 증거를 생성할 수 있습니다.
Tesseract 및 EasyOCR과 같은 오픈 소스 도구를 사용하면 값비싼 독점 의료 데이터 추출 소프트웨어에 대한 예산이 부족할 수 있는 소규모 또는 자원이 제한된 암 센터에서 솔루션에 액세스할 수 있습니다.
이 연구는 환자 인구통계 및 임상 요인이 추출 오류를 크게 예측하지 못한다는 사실을 발견했기 때문에 이 자동 캡처의 이점이 다양한 환자 집단에 광범위하게 적용 가능하다는 것을 보여주었습니다.
이 파이프라인은 구조화되지 않은 바이너리 개체를 구조화된 데이터로 변환함으로써 종양학 분야에서 미래의 AI 및 기계 학습 모델을 훈련하고 개선하는 데 필요한 고품질 종단적 데이터를 제공합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
Which component of an AI application is the machine-learning model itself?
다음에 무엇을 볼 것인가
향후 연구에서는 표준화된 Oncotype DX 형식을 넘어서는 이 파이프라인의 확장성을 다루어야 합니다. 저자들은 공급업체 간에 더 큰 이질성을 나타내는 체세포 차세대 시퀀싱 보고서가 자동화 추출에 대한 더 복잡한 과제를 제시한다는 점에 주목했습니다. 또한 이 연구에서는 회고적 데이터세트를 기준으로 파이프라인을 검증했지만, 실제 대용량 설정에서 신뢰성을 확인하려면 실시간 임상 레지스트리 워크플로우 내에서 전향적 테스트가 필요합니다.
연구원들은 공급업체와 형식에 따라 크게 달라지는 체세포 차세대 시퀀싱 보고서와 같은 보다 이질적인 문서 유형에 대해 파이프라인을 테스트해야 할 필요성을 명시적으로 식별했습니다.
이 연구는 단일 의료 시스템에서 수행되었습니다. 향후 작업에서는 여러 기관에 걸쳐 파이프라인의 성능을 평가하여 스캔 품질, 팩스 해상도 및 다양한 EHR 구성의 변화에 대해 견고한 상태를 유지해야 합니다.
실시간 레지스트리 워크플로에 대한 전향적 통합은 들어오는 임상 데이터를 실시간으로 처리할 때 시스템이 정확성과 효율성을 유지하는지 확인하기 위한 다음 논리적 단계입니다.