Назад към Новини
ИновацияAI Understanding брифинг

Тръбопроводът за OCR с отворен код намалява латентността на данните от раковия регистър

Изследователи от Университета на Минесота разработиха хибриден OCR канал с отворен код, който извлича резултати от геномни тестове от клинични доклади с 97% точност, потенциално замествайки бавното ръчно въвеждане на данни.

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
ИзточникИзточникът е записан
Издател
bioengineer.org
Изходна връзка
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
Тип източник
Свързан източник — статусът на първичен източник не е установен.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

OCR (оптично разпознаване на символи)
Технология, която преобразува текст в изображения или сканиране в машинно четим текст.
Тръбопровод
Подреден работен процес от предварителна обработка, стъпки на модела и етапи на последваща обработка.
Латентност
Времето между изпращането на заявка и получаването на изхода на модела.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Изследователски екип, ръководен от Университета на Минесота, демонстрира, че хибриден тръбопровод за оптично разпознаване на символи (OCR) с отворен код може точно да извлече резултати от геномни рецидиви от сканирани Oncotype DX доклади за рак на гърдата. Проучването, публикувано в Cancer Causes & Control, използва комбинация от Tesseract и EasyOCR двигатели за обработка на 675 доклада, постигайки 97% степен на съгласие с ръчна човешка абстракция. Автоматизираната система значително надмина скоростта на традиционното ръчно въвеждане в регистъра, което често се сблъсква със закъснения от 12 до 18 месеца.

Изследователският екип, включително Qianyun Luo и Schelomo Marmor, разработи тръбопровод за „хибридно OCR“ (H-OCR) за справяне с латентността в раковите регистри. Резултатите от геномни тестове, като Oncotype DX recurrence score, често се съхраняват в електронни здравни досиета (EHRs) като неструктурирани сканирани изображения, а не като машинночетими данни, изискващи ръчно транскрибиране.

H-OCR тръбопроводът използва EasyOCR за своето базирано на дълбоко обучение откриване на текст и Tesseract като резервен двигател за разпознаване на знаци. Този хибриден подход е създаден, за да използва способността на EasyOCR да локализира анотации в кръгове върху отчети, като същевременно използва скоростта на Tesseract и възможностите за разпознаване на знаци.

В набор от 675 отчета за валидиране, конвейерът H-OCR постигна 97% съответствие с ръчните референтни стандарти, надминавайки степента на точност от 91% на конвенционалната абстракция на регистъра. Автоматизираният процес изпълни задачата за приблизително 4,9 часа, в сравнение с месеците забавяния, типични за настоящите ръчни работни процеси.

Проучването установи, че резултатите за доверие на тръбопровода ефективно идентифицират потенциални грешки, което предполага, че бъдещи внедрявания могат да използват тези резултати, за да маркират несигурни екстракции за човешки преглед, като по този начин минимизират риска от клинично значима грешна класификация.

Детайли за източника: bioengineer.org ↗

Защо има значение

Настоящото разчитане на ръчна транскрипция за геномни данни създава значително затруднение в изследванията на рака и прецизната онкология. Чрез автоматизиране на извличането на структурирани данни от неструктурирани PDF файлове, този подход с отворен код позволява на здравните системи да попълват ракови регистри почти в реално време. Тази промяна е от решаващо значение за подобряване на качеството на доказателствата от реалния свят, позволявайки по-бързо сравнително изследване на ефективността и предоставяйки структурираните данни, необходими за обучение на бъдещи модели на ИИ в онкологията. Тъй като инструментите са с отворен код и могат да работят в среда, съвместима с HIPAA, този метод предлага евтино, възпроизводимо решение за институции с ограничени ресурси за модернизиране на тяхната инфраструктура за данни без патентован софтуер.

Геномните биомаркери са от съществено значение за прецизната онкология и измерване на качеството, но тяхната полезност в момента е ограничена от времето, необходимо за предоставянето им в изследователските бази данни. Намаляването на тази латентност позволява по-навременно генериране на доказателства.

Използването на инструменти с отворен код като Tesseract и EasyOCR гарантира, че решението е достъпно за по-малки или ограничени от ресурси онкологични центрове, които може да нямат бюджет за скъп собствен софтуер за извличане на медицински данни.

Проучването показа, че ползите от това автоматизирано улавяне са широко приложими в различни популации пациенти, тъй като изследователите установиха, че демографските данни на пациентите и клиничните фактори не предсказват значително грешки при извличане.

Чрез преобразуване на неструктурирани двоични обекти в структурирани данни, този тръбопровод осигурява висококачествени, надлъжни данни, необходими за обучение и усъвършенстване на бъдещи модели на ИИ и машинно обучение в онкологичното пространство.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Бъдещите изследвания ще трябва да обърнат внимание на мащабируемостта на този тръбопровод извън стандартизирания Oncotype DX формат. Авторите отбелязват, че докладите за соматично секвениране от следващо поколение, които показват по-голяма хетерогенност между доставчиците, представляват по-сложно предизвикателство за автоматизирано извличане. Освен това, докато проучването валидира тръбопровода спрямо ретроспективен набор от данни, е необходимо проспективно тестване в рамките на живи работни потоци на клиничния регистър, за да се потвърди неговата надеждност в реални настройки с голям обем.

Изследователите изрично идентифицираха необходимостта от тестване на тръбопровода върху по-разнородни типове документи, като например соматични доклади за последователност от следващо поколение, които се различават значително в зависимост от доставчика и формата.

Проучването е проведено в една здравна система; Бъдещата работа трябва да оцени ефективността на тръбопровода в множество институции, за да се гарантира, че той остава стабилен срещу вариации в качеството на сканиране, резолюция на факса и различни конфигурации на EHR.

Проспективната интеграция в работните потоци на регистъра на живо е следващата логична стъпка, за да се определи дали системата поддържа своята точност и ефективност при обработка на входящи клинични данни в реално време.

Свързани ръководства и викторини

Обяснени модели на AIAI обучениеБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?