Назад до новин
ІнноваціяAI Understanding брифінг

Конвеєр OCR з відкритим кодом зменшує затримку даних реєстру ракових захворювань

Дослідники з Університету Міннесоти розробили гібридний конвеєр OCR з відкритим вихідним кодом, який витягує результати геномних тестів із клінічних звітів із точністю 97%, потенційно замінюючи повільне ручне введення даних.

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
Посилання на джерелоДжерело записано
Видавець
bioengineer.org
Посилання на джерело
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
Тип джерела
Пов’язане джерело — статус первинного джерела не встановлено.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

OCR (оптичне розпізнавання символів)
Технологія, яка перетворює текст із зображень або відсканованих зображень на машиночитаний текст.
Трубопровід
Упорядкований робочий процес попередньої обробки, кроків моделі та етапів постобробки.
Затримка
Час між надсиланням запиту та отриманням виходу моделі.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Дослідницька група під керівництвом Університету Міннесоти продемонструвала, що гібридний конвеєр оптичного розпізнавання символів (OCR) з відкритим вихідним кодом може точно витягувати результати геномних рецидивів із відсканованих звітів про рак молочної залози Oncotype DX. Дослідження, опубліковане в Cancer Causes & Control, використовувало комбінацію механізмів Tesseract і EasyOCR для обробки 675 звітів, досягнувши 97% рівня узгодження з ручним абстрагуванням людини. Автоматизована система значно перевищила швидкість традиційного ручного введення реєстру, який часто стикається із затримками від 12 до 18 місяців.

Дослідницька група, включно з Qianyun Luo і Schelomo Marmor, розробила конвеєр «гібридного OCR» (H-OCR) для усунення затримки в реєстрах раку. Результати геномних тестів, такі як оцінка рецидивів Oncotype DX, часто зберігаються в електронних медичних записах (EHR) як неструктуровані відскановані зображення, а не машинозчитувані дані, що вимагає ручної транскрипції.

Конвеєр H-OCR використовує EasyOCR для виявлення тексту на основі глибокого навчання та Tesseract як резервний механізм для розпізнавання символів. Цей гібридний підхід було розроблено для того, щоб використовувати здатність EasyOCR локалізувати обведені анотації у звітах, одночасно використовуючи швидкість Tesseract і можливості розпізнавання символів.

У наборі перевірки з 675 звітів конвеєр H-OCR досяг 97% узгодженості з ручними довідковими стандартами, перевершуючи рівень точності 91% звичайної абстракції реєстру. Автоматизований процес виконав завдання приблизно за 4,9 години порівняно з місячними затримками, характерними для поточних ручних робочих процесів.

Дослідження показало, що оцінки надійності конвеєра ефективно ідентифікували потенційні помилки, що свідчить про те, що майбутні впровадження можуть використовувати ці оцінки для позначення непевних вилучень для перевірки людиною, тим самим мінімізуючи ризик клінічно значущої неправильної класифікації.

Деталі джерела: bioengineer.org ↗

Чому це важливо

Нинішня залежність від ручної транскрипції геномних даних створює значне вузьке місце в дослідженнях раку та прецизійній онкології. Завдяки автоматизації вилучення структурованих даних із неструктурованих PDF-файлів цей підхід із відкритим вихідним кодом дозволяє системам охорони здоров’я заповнювати реєстри раку майже в реальному часі. Ця зміна має вирішальне значення для покращення якості реальних доказів, забезпечення швидшого порівняльного дослідження ефективності та надання структурованих даних, необхідних для навчання майбутніх моделей ШІ в онкології. Оскільки інструменти є відкритими і можуть працювати в середовищах, сумісних з HIPAA, цей метод пропонує недороге, відтворюване рішення для установ з обмеженими ресурсами для модернізації своєї інфраструктури даних без власного програмного забезпечення.

Геномні біомаркери мають важливе значення для точного вимірювання онкології та якості, але їх корисність наразі обмежена часом, який потрібен для того, щоб зробити їх доступними в дослідницьких базах даних. Зменшення цієї затримки дозволяє своєчасніше генерувати докази.

Використання таких інструментів з відкритим вихідним кодом, як Tesseract і EasyOCR, гарантує, що рішення доступне для менших або обмежених ресурсів онкологічних центрів, яким може бракувати бюджету на дороге запатентоване програмне забезпечення для вилучення медичних даних.

Дослідження продемонструвало, що переваги цього автоматизованого захоплення широко застосовуються для різних груп пацієнтів, оскільки дослідники виявили, що демографічні та клінічні фактори пацієнтів не суттєво передбачають помилки вилучення.

Перетворюючи неструктуровані двійкові об’єкти в структуровані дані, цей конвеєр забезпечує високоякісні поздовжні дані, необхідні для навчання та вдосконалення майбутніх моделей ШІ та машинного навчання в онкологічному просторі.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Що дивитися далі

У майбутніх дослідженнях потрібно буде розглянути можливість масштабування цього конвеєра за межі стандартизованого формату Oncotype DX. Автори відзначили, що соматичні звіти про секвенування наступного покоління, які виявляють більшу гетерогенність між постачальниками, становлять більш складну проблему для автоматизованого вилучення. Крім того, хоча дослідження перевірило конвеєр на основі ретроспективного набору даних, потрібне проспективне тестування в рамках поточних робочих процесів клінічного реєстру, щоб підтвердити його надійність у реальних умовах великого обсягу.

Дослідники чітко визначили необхідність перевірити конвеєр на більш різнорідних типах документів, таких як соматичні звіти про секвенування наступного покоління, які значно відрізняються залежно від постачальника та формату.

Дослідження проводилося в одній системі охорони здоров'я; Майбутня робота повинна оцінити продуктивність конвеєра в багатьох установах, щоб переконатися, що він залишається надійним проти варіацій якості сканування, роздільної здатності факсу та різних конфігурацій EHR.

Майбутня інтеграція в робочі процеси реєстру в реальному часі є наступним логічним кроком для визначення того, чи система підтримує точність і ефективність під час обробки вхідних клінічних даних у режимі реального часу.

Пов’язані посібники та вікторини

Пояснення моделей AIНавчання ШІМайбутнє ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?