Що сталося
Дослідницька група під керівництвом Університету Міннесоти продемонструвала, що гібридний конвеєр оптичного розпізнавання символів (OCR) з відкритим вихідним кодом може точно витягувати результати геномних рецидивів із відсканованих звітів про рак молочної залози Oncotype DX. Дослідження, опубліковане в Cancer Causes & Control, використовувало комбінацію механізмів Tesseract і EasyOCR для обробки 675 звітів, досягнувши 97% рівня узгодження з ручним абстрагуванням людини. Автоматизована система значно перевищила швидкість традиційного ручного введення реєстру, який часто стикається із затримками від 12 до 18 місяців.
Дослідницька група, включно з Qianyun Luo і Schelomo Marmor, розробила конвеєр «гібридного OCR» (H-OCR) для усунення затримки в реєстрах раку. Результати геномних тестів, такі як оцінка рецидивів Oncotype DX, часто зберігаються в електронних медичних записах (EHR) як неструктуровані відскановані зображення, а не машинозчитувані дані, що вимагає ручної транскрипції.
Конвеєр H-OCR використовує EasyOCR для виявлення тексту на основі глибокого навчання та Tesseract як резервний механізм для розпізнавання символів. Цей гібридний підхід було розроблено для того, щоб використовувати здатність EasyOCR локалізувати обведені анотації у звітах, одночасно використовуючи швидкість Tesseract і можливості розпізнавання символів.
У наборі перевірки з 675 звітів конвеєр H-OCR досяг 97% узгодженості з ручними довідковими стандартами, перевершуючи рівень точності 91% звичайної абстракції реєстру. Автоматизований процес виконав завдання приблизно за 4,9 години порівняно з місячними затримками, характерними для поточних ручних робочих процесів.
Дослідження показало, що оцінки надійності конвеєра ефективно ідентифікували потенційні помилки, що свідчить про те, що майбутні впровадження можуть використовувати ці оцінки для позначення непевних вилучень для перевірки людиною, тим самим мінімізуючи ризик клінічно значущої неправильної класифікації.
Деталі джерела: bioengineer.org ↗
Чому це важливо
Нинішня залежність від ручної транскрипції геномних даних створює значне вузьке місце в дослідженнях раку та прецизійній онкології. Завдяки автоматизації вилучення структурованих даних із неструктурованих PDF-файлів цей підхід із відкритим вихідним кодом дозволяє системам охорони здоров’я заповнювати реєстри раку майже в реальному часі. Ця зміна має вирішальне значення для покращення якості реальних доказів, забезпечення швидшого порівняльного дослідження ефективності та надання структурованих даних, необхідних для навчання майбутніх моделей ШІ в онкології. Оскільки інструменти є відкритими і можуть працювати в середовищах, сумісних з HIPAA, цей метод пропонує недороге, відтворюване рішення для установ з обмеженими ресурсами для модернізації своєї інфраструктури даних без власного програмного забезпечення.
Геномні біомаркери мають важливе значення для точного вимірювання онкології та якості, але їх корисність наразі обмежена часом, який потрібен для того, щоб зробити їх доступними в дослідницьких базах даних. Зменшення цієї затримки дозволяє своєчасніше генерувати докази.
Використання таких інструментів з відкритим вихідним кодом, як Tesseract і EasyOCR, гарантує, що рішення доступне для менших або обмежених ресурсів онкологічних центрів, яким може бракувати бюджету на дороге запатентоване програмне забезпечення для вилучення медичних даних.
Дослідження продемонструвало, що переваги цього автоматизованого захоплення широко застосовуються для різних груп пацієнтів, оскільки дослідники виявили, що демографічні та клінічні фактори пацієнтів не суттєво передбачають помилки вилучення.
Перетворюючи неструктуровані двійкові об’єкти в структуровані дані, цей конвеєр забезпечує високоякісні поздовжні дані, необхідні для навчання та вдосконалення майбутніх моделей ШІ та машинного навчання в онкологічному просторі.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Which component of an AI application is the machine-learning model itself?
Що дивитися далі
У майбутніх дослідженнях потрібно буде розглянути можливість масштабування цього конвеєра за межі стандартизованого формату Oncotype DX. Автори відзначили, що соматичні звіти про секвенування наступного покоління, які виявляють більшу гетерогенність між постачальниками, становлять більш складну проблему для автоматизованого вилучення. Крім того, хоча дослідження перевірило конвеєр на основі ретроспективного набору даних, потрібне проспективне тестування в рамках поточних робочих процесів клінічного реєстру, щоб підтвердити його надійність у реальних умовах великого обсягу.
Дослідники чітко визначили необхідність перевірити конвеєр на більш різнорідних типах документів, таких як соматичні звіти про секвенування наступного покоління, які значно відрізняються залежно від постачальника та формату.
Дослідження проводилося в одній системі охорони здоров'я; Майбутня робота повинна оцінити продуктивність конвеєра в багатьох установах, щоб переконатися, що він залишається надійним проти варіацій якості сканування, роздільної здатності факсу та різних конфігурацій EHR.
Майбутня інтеграція в робочі процеси реєстру в реальному часі є наступним логічним кроком для визначення того, чи система підтримує точність і ефективність під час обробки вхідних клінічних даних у режимі реального часу.