Co się stało
Zespół badawczy kierowany przez Uniwersytet w Minnesocie wykazał, że hybrydowy proces optycznego rozpoznawania znaków (OCR) typu open source może dokładnie wyodrębnić wyniki genomowego nawrotu choroby ze zeskanowanych raportów dotyczących raka piersi Oncotype DX. W badaniu opublikowanym w czasopiśmie Cancer Causes & Control wykorzystano kombinację silników Tesseract i EasyOCR do przetworzenia 675 raportów, osiągając współczynnik zgodności na poziomie 97% przy ręcznym pobieraniu danych przez człowieka. Zautomatyzowany system znacznie przewyższał szybkość tradycyjnego ręcznego wprowadzania danych do rejestru, w przypadku którego często występują opóźnienia wynoszące od 12 do 18 miesięcy.
Zespół badawczy, w skład którego wchodzili Qianyun Luo i Schelomo Marmor, opracował proces „hybrydowego OCR” (H-OCR), aby wyeliminować opóźnienia w rejestrach nowotworów. Wyniki badań genomu, takie jak wynik nawrotów Oncotype DX, są często przechowywane w elektronicznej dokumentacji medycznej (EHR) w postaci zeskanowanych obrazów bez struktury, a nie danych do odczytu maszynowego, co wymaga ręcznej transkrypcji.
Potok H-OCR wykorzystuje EasyOCR do wykrywania tekstu w oparciu o głębokie uczenie się oraz Tesseract jako silnik awaryjny do rozpoznawania znaków. To hybrydowe podejście zostało zaprojektowane, aby wykorzystać zdolność EasyOCR do lokalizowania adnotacji w kółkach w raportach, przy jednoczesnym wykorzystaniu szybkości i możliwości Tesseract rozpoznawania znaków.
W zestawie walidacyjnym obejmującym 675 raportów, potok H-OCR osiągnął 97% zgodności z ręcznymi standardami referencyjnymi, przewyższając współczynnik dokładności wynoszący 91% w przypadku konwencjonalnej abstrakcji rejestru. Zautomatyzowany proces wykonał zadanie w około 4,9 godziny, w porównaniu z wielomiesięcznymi opóźnieniami typowymi dla obecnych ręcznych przepływów pracy.
Badanie wykazało, że wskaźniki zaufania rurociągu skutecznie identyfikują potencjalne błędy, co sugeruje, że przyszłe wdrożenia mogłyby wykorzystać te wyniki do oznaczania niepewnych ekstrakcji do przeglądu przez człowieka, minimalizując w ten sposób ryzyko klinicznie istotnej błędnej klasyfikacji.
Szczegóły źródła: bioengineer.org ↗
Dlaczego to ma znaczenie
Obecne poleganie na ręcznej transkrypcji danych genomowych stwarza znaczące wąskie gardło w badaniach nad nowotworami i onkologii precyzyjnej. Automatyzując wyodrębnianie ustrukturyzowanych danych z nieustrukturyzowanych plików PDF, to podejście oparte na otwartym kodzie źródłowym umożliwia systemom opieki zdrowotnej uzupełnianie rejestrów nowotworów w czasie zbliżonym do rzeczywistego. Ta zmiana ma kluczowe znaczenie dla poprawy jakości dowodów pochodzących ze świata rzeczywistego, umożliwienia szybszych badań porównawczych nad skutecznością i dostarczenia ustrukturyzowanych danych niezbędnych do szkolenia przyszłych modeli sztucznej inteligencji w onkologii. Ponieważ narzędzia te są typu open source i mogą działać w środowiskach zgodnych z ustawą HIPAA, metoda ta oferuje niedrogie, powtarzalne rozwiązanie dla instytucji o ograniczonych zasobach, umożliwiające modernizację infrastruktury danych bez zastrzeżonego oprogramowania.
Biomarkery genomowe są niezbędne w onkologii precyzyjnej i pomiarach jakości, jednak ich użyteczność jest obecnie ograniczona czasem potrzebnym na udostępnienie ich w badawczych bazach danych. Zmniejszenie tego opóźnienia pozwala na szybsze generowanie dowodów.
Zastosowanie narzędzi typu open source, takich jak Tesseract i EasyOCR, gwarantuje, że rozwiązanie będzie dostępne dla mniejszych ośrodków onkologicznych lub o ograniczonych zasobach, którym może brakować budżetu na drogie, zastrzeżone oprogramowanie do ekstrakcji danych medycznych.
Badanie wykazało, że korzyści płynące z automatycznego przechwytywania mają szerokie zastosowanie w różnych populacjach pacjentów, ponieważ naukowcy odkryli, że dane demograficzne pacjentów i czynniki kliniczne nie pozwoliły w znaczący sposób przewidzieć błędów ekstrakcji.
Konwertując nieustrukturyzowane obiekty binarne na ustrukturyzowane dane, potok ten zapewnia wysokiej jakości dane podłużne niezbędne do szkolenia i udoskonalania przyszłych modeli sztucznej inteligencji i uczenia maszynowego w przestrzeni onkologicznej.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
Which component of an AI application is the machine-learning model itself?
Co obejrzeć dalej
Przyszłe badania będą musiały zająć się skalowalnością tego potoku poza standardowym formatem Oncotype DX. Autorzy zauważyli, że raporty sekwencjonowania somatycznego nowej generacji, które wykazują większą różnorodność wśród dostawców, stanowią bardziej złożone wyzwanie w przypadku automatycznej ekstrakcji. Ponadto, chociaż w badaniu zweryfikowano potok danych na podstawie retrospektywnego zbioru danych, wymagane są prospektywne testy w ramach bieżących przepływów pracy w rejestrze klinicznym, aby potwierdzić jego niezawodność w rzeczywistych, masowych warunkach.
Naukowcy wyraźnie zidentyfikowali potrzebę przetestowania potoku na bardziej heterogenicznych typach dokumentów, takich jak somatyczne raporty sekwencjonowania nowej generacji, które znacznie różnią się w zależności od dostawcy i formatu.
Badanie przeprowadzono w jednym systemie opieki zdrowotnej; przyszłe prace muszą ocenić wydajność rurociągu w wielu instytucjach, aby upewnić się, że pozostaje on odporny na różnice w jakości skanowania, rozdzielczości faksu i różnych konfiguracjach EHR.
Prospektywna integracja z przepływami pracy w rejestrze na żywo to kolejny logiczny krok w celu ustalenia, czy system zachowuje swoją dokładność i wydajność podczas przetwarzania przychodzących danych klinicznych w czasie rzeczywistym.