Chuyện gì đã xảy ra
Một nhóm nghiên cứu do Đại học Minnesota dẫn đầu đã chứng minh rằng quy trình nhận dạng ký tự quang học nguồn mở (OCR) lai có thể trích xuất chính xác điểm tái phát gen từ các báo cáo ung thư vú Oncotype DX được quét. Nghiên cứu được công bố trên tạp chí Nguyên nhân & Kiểm soát Ung thư, đã sử dụng kết hợp các công cụ Tesseract và EasyOCR để xử lý 675 báo cáo, đạt tỷ lệ đồng ý 97% với sự trừu tượng hóa thủ công của con người. Hệ thống tự động vượt trội đáng kể so với tốc độ nhập sổ đăng ký thủ công truyền thống, vốn thường phải đối mặt với độ trễ từ 12 đến 18 tháng.
Nhóm nghiên cứu, bao gồm Qianyun Luo và Schelomo Marmor, đã phát triển một quy trình 'OCR lai' (H-OCR) để giải quyết độ trễ trong cơ quan đăng ký ung thư. Các kết quả xét nghiệm bộ gen, chẳng hạn như điểm tái phát Oncotype DX, thường được lưu trữ trong hồ sơ sức khỏe điện tử (EHR) dưới dạng hình ảnh được quét không có cấu trúc thay vì dữ liệu có thể đọc được bằng máy, yêu cầu sao chép thủ công.
Quy trình H-OCR sử dụng EasyOCR để phát hiện văn bản dựa trên học sâu và Tesseract làm công cụ dự phòng để nhận dạng ký tự. Phương pháp kết hợp này được thiết kế để tận dụng khả năng của EasyOCR trong việc bản địa hóa các chú thích được khoanh tròn trên các báo cáo trong khi sử dụng tốc độ và khả năng nhận dạng ký tự của Tesseract.
Trong một bộ xác thực gồm 675 báo cáo, quy trình H-OCR đã đạt được sự đồng tình 97% với các tiêu chuẩn tham chiếu thủ công, vượt trội so với tỷ lệ chính xác 91% của việc trừu tượng hóa đăng ký thông thường. Quy trình tự động đã hoàn thành nhiệm vụ trong khoảng 4,9 giờ, so với độ trễ kéo dài hàng tháng điển hình của quy trình làm việc thủ công hiện tại.
Nghiên cứu phát hiện ra rằng điểm số tin cậy của quy trình đã xác định một cách hiệu quả các lỗi tiềm ẩn, cho thấy rằng việc triển khai trong tương lai có thể sử dụng các điểm số này để gắn cờ các trích xuất không chắc chắn để con người xem xét, từ đó giảm thiểu nguy cơ phân loại sai đáng kể về mặt lâm sàng.
Chi tiết nguồn: bioengineer.org ↗
Tại sao nó quan trọng
Sự phụ thuộc hiện nay vào việc sao chép thủ công dữ liệu gen tạo ra một trở ngại đáng kể trong nghiên cứu ung thư và ung thư chính xác. Bằng cách tự động trích xuất dữ liệu có cấu trúc từ các tệp PDF không có cấu trúc, phương pháp tiếp cận nguồn mở này cho phép các hệ thống y tế đưa vào cơ quan đăng ký ung thư trong thời gian gần như thời gian thực. Sự thay đổi này rất quan trọng để cải thiện chất lượng bằng chứng thực tế, cho phép nghiên cứu hiệu quả so sánh nhanh hơn và cung cấp dữ liệu có cấu trúc cần thiết để đào tạo các mô hình AI trong tương lai về ung thư. Vì các công cụ này là nguồn mở và có thể hoạt động trong môi trường tuân thủ HIPAA nên phương pháp này cung cấp giải pháp chi phí thấp, có thể tái tạo cho các tổ chức có nguồn lực hạn chế để hiện đại hóa cơ sở hạ tầng dữ liệu của họ mà không cần phần mềm độc quyền.
Các dấu ấn sinh học bộ gen rất cần thiết cho việc đo lường chất lượng và ung thư chính xác, tuy nhiên tiện ích của chúng hiện bị hạn chế do thời gian đưa chúng vào cơ sở dữ liệu nghiên cứu. Giảm độ trễ này cho phép tạo ra bằng chứng kịp thời hơn.
Việc sử dụng các công cụ nguồn mở như Tesseract và EasyOCR đảm bảo rằng giải pháp này có thể tiếp cận được với các trung tâm ung thư nhỏ hơn hoặc có nguồn lực hạn chế, có thể thiếu ngân sách cho phần mềm trích xuất dữ liệu y tế độc quyền, đắt tiền.
Nghiên cứu đã chứng minh rằng lợi ích của việc thu thập tự động này có thể được áp dụng rộng rãi trên nhiều nhóm bệnh nhân khác nhau, vì các nhà nghiên cứu nhận thấy rằng nhân khẩu học của bệnh nhân và các yếu tố lâm sàng không dự đoán đáng kể các lỗi trích xuất.
Bằng cách chuyển đổi các đối tượng nhị phân không có cấu trúc thành dữ liệu có cấu trúc, quy trình này cung cấp dữ liệu theo chiều dọc, chất lượng cao cần thiết để đào tạo và tinh chỉnh các mô hình AI và máy học trong tương lai trong không gian ung thư.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Nghiên cứu trong tương lai sẽ cần giải quyết khả năng mở rộng của quy trình này ngoài định dạng Oncotype DX được tiêu chuẩn hóa. Các tác giả lưu ý rằng các báo cáo giải trình tự soma thế hệ tiếp theo thể hiện tính không đồng nhất lớn hơn giữa các nhà cung cấp, đặt ra thách thức phức tạp hơn cho việc trích xuất tự động. Ngoài ra, mặc dù nghiên cứu đã xác thực quy trình dựa trên tập dữ liệu hồi cứu, nhưng cần phải thử nghiệm tiềm năng trong quy trình đăng ký lâm sàng trực tiếp để xác nhận độ tin cậy của quy trình trong cài đặt khối lượng lớn, trong thế giới thực.
Các nhà nghiên cứu đã xác định rõ ràng nhu cầu thử nghiệm quy trình trên các loại tài liệu không đồng nhất hơn, chẳng hạn như các báo cáo giải trình tự soma thế hệ tiếp theo, có sự khác biệt đáng kể tùy theo nhà cung cấp và định dạng.
Nghiên cứu được thực hiện tại một hệ thống y tế duy nhất; Công việc trong tương lai phải đánh giá hiệu suất của quy trình trên nhiều tổ chức để đảm bảo nó vẫn hoạt động mạnh mẽ trước những thay đổi về chất lượng quét, độ phân giải fax và các cấu hình EHR khác nhau.
Tích hợp triển vọng vào quy trình đăng ký trực tiếp là bước hợp lý tiếp theo để xác định xem hệ thống có duy trì được độ chính xác và hiệu quả khi xử lý dữ liệu lâm sàng đến trong thời gian thực hay không.