Вернуться к новостям
ИнновацииAI Understanding брифинг

Конвейер OCR с открытым исходным кодом сокращает задержку данных реестра раковых заболеваний

Исследователи из Университета Миннесоты разработали гибридный конвейер оптического распознавания символов с открытым исходным кодом, который извлекает результаты геномных тестов из клинических отчетов с точностью 97%, потенциально заменяя медленный ввод данных вручную.

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
Ссылка на источникИсточник записан
Издатель
bioengineer.org
Ссылка на источник
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

OCR (оптическое распознавание символов)
Технология, которая преобразует текст на изображениях или отсканированных изображениях в машиночитаемый текст.
Трубопровод
Упорядоченный рабочий процесс предварительной обработки, этапов модели и этапов постобработки.
Задержка
Время между отправкой запроса и получением выходных данных модели.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Исследовательская группа под руководством Университета Миннесоты продемонстрировала, что гибридный конвейер оптического распознавания символов (OCR) с открытым исходным кодом может точно извлекать показатели геномного рецидива из отсканированных отчетов о раке молочной железы Oncotype DX. В исследовании, опубликованном в журнале Cancer Causes & Control, использовалась комбинация механизмов Tesseract и EasyOCR для обработки 675 отчетов, что позволило достичь 97% согласия с абстракцией вручную, выполняемой человеком. Автоматизированная система значительно превосходит скорость традиционного ручного ввода реестра, который часто сталкивается с задержками от 12 до 18 месяцев.

Исследовательская группа, в которую вошли Цяньюнь Луо и Шеломо Мармор, разработала конвейер «гибридного оптического распознавания символов» (H-OCR) для решения проблемы задержек в реестрах раковых заболеваний. Результаты геномных тестов, такие как показатель рецидивов Oncotype DX, часто хранятся в электронных медицинских картах (ЭМК) в виде неструктурированных сканированных изображений, а не машиночитаемых данных, требующих ручной транскрипции.

Конвейер H-OCR использует EasyOCR для обнаружения текста на основе глубокого обучения и Tesseract в качестве резервного механизма для распознавания символов. Этот гибридный подход был разработан для использования возможностей EasyOCR локализовать обведенные аннотации в отчетах, одновременно используя скорость Tesseract и возможности распознавания символов.

В наборе проверок, состоящем из 675 отчетов, конвейер H-OCR достиг 97% согласия с ручными эталонными стандартами, превзойдя точность 91% обычного абстрагирования реестра. Автоматизированный процесс выполнил задачу примерно за 4,9 часа по сравнению с многомесячными задержками, типичными для нынешних ручных рабочих процессов.

Исследование показало, что оценки достоверности конвейера эффективно выявляют потенциальные ошибки, что позволяет предположить, что будущие реализации могут использовать эти оценки для обозначения неопределенных извлечений для проверки человеком, тем самым сводя к минимуму риск клинически значимой ошибочной классификации.

Подробности об источнике: bioengineer.org ↗

Почему это важно

Нынешняя зависимость от ручной транскрипции геномных данных создает серьезное препятствие в исследованиях рака и точной онкологии. Автоматизируя извлечение структурированных данных из неструктурированных PDF-файлов, этот подход с открытым исходным кодом позволяет системам здравоохранения пополнять реестры онкологических заболеваний практически в реальном времени. Этот сдвиг имеет решающее значение для улучшения качества реальных данных, обеспечения более быстрых исследований сравнительной эффективности и предоставления структурированных данных, необходимых для обучения будущих моделей ИИ в онкологии. Поскольку инструменты имеют открытый исходный код и могут работать в средах, соответствующих требованиям HIPAA, этот метод предлагает недорогое и воспроизводимое решение для учреждений с ограниченными ресурсами, позволяющее модернизировать свою инфраструктуру данных без проприетарного программного обеспечения.

Геномные биомаркеры необходимы для точной онкологии и измерения качества, однако их полезность в настоящее время ограничена временем, необходимым для их доступности в исследовательских базах данных. Сокращение этой задержки позволяет более своевременно собирать доказательства.

Использование инструментов с открытым исходным кодом, таких как Tesseract и EasyOCR, гарантирует, что решение доступно для небольших онкологических центров или с ограниченными ресурсами, у которых может не хватать бюджета на дорогостоящее проприетарное программное обеспечение для извлечения медицинских данных.

Исследование продемонстрировало, что преимущества этого автоматического сбора широко применимы к различным популяциям пациентов, поскольку исследователи обнаружили, что демографические данные пациентов и клинические факторы не в значительной степени предсказывают ошибки извлечения.

Преобразуя неструктурированные двоичные объекты в структурированные данные, этот конвейер предоставляет высококачественные продольные данные, необходимые для обучения и совершенствования будущих моделей искусственного интеллекта и машинного обучения в области онкологии.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Будущие исследования должны будут решить проблему масштабируемости этого конвейера за пределами стандартизированного формата Oncotype DX. Авторы отметили, что отчеты о соматическом секвенировании следующего поколения, которые демонстрируют большую гетерогенность среди разных поставщиков, представляют собой более сложную задачу для автоматического извлечения. Кроме того, хотя исследование подтвердило эффективность конвейера на основе ретроспективного набора данных, необходимо проспективное тестирование в рамках живых рабочих процессов клинического реестра, чтобы подтвердить его надежность в реальных условиях большого объема.

Исследователи прямо указали на необходимость тестирования конвейера на более разнородных типах документов, таких как отчеты о соматическом секвенировании следующего поколения, которые значительно различаются в зависимости от поставщика и формата.

Исследование проводилось в одной системе здравоохранения; Будущая работа должна оценить производительность конвейера в нескольких учреждениях, чтобы убедиться, что он остается устойчивым к изменениям в качестве сканирования, разрешении факсов и различных конфигурациях EHR.

Перспективная интеграция в рабочие процессы живого реестра является следующим логическим шагом, чтобы определить, сохранит ли система свою точность и эффективность при обработке входящих клинических данных в режиме реального времени.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаОбучение искусственному интеллектуБудущее ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?