Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Đường dẫn OCR nguồn mở làm giảm độ trễ dữ liệu đăng ký ung thư

Các nhà nghiên cứu tại Đại học Minnesota đã phát triển một quy trình OCR nguồn mở lai giúp trích xuất điểm kiểm tra bộ gen từ các báo cáo lâm sàng với độ chính xác 97%, có khả năng thay thế việc nhập dữ liệu thủ công chậm chạp.

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
Nguồn tham khảoNguồn đã ghi
Nhà xuất bản
bioengineer.org
Liên kết nguồn
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
Loại nguồn
Nguồn được liên kết - trạng thái nguồn chính chưa được thiết lập.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

OCR (Nhận dạng ký tự quang học)
Công nghệ chuyển đổi văn bản trong hình ảnh hoặc quét thành văn bản có thể đọc được bằng máy.
Đường ống
Một quy trình công việc được sắp xếp gồm các bước tiền xử lý, các bước mô hình và các giai đoạn hậu xử lý.
Độ trễ
Khoảng thời gian từ khi gửi yêu cầu đến khi nhận được đầu ra của mô hình.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Một nhóm nghiên cứu do Đại học Minnesota dẫn đầu đã chứng minh rằng quy trình nhận dạng ký tự quang học nguồn mở (OCR) lai có thể trích xuất chính xác điểm tái phát gen từ các báo cáo ung thư vú Oncotype DX được quét. Nghiên cứu được công bố trên tạp chí Nguyên nhân & Kiểm soát Ung thư, đã sử dụng kết hợp các công cụ Tesseract và EasyOCR để xử lý 675 báo cáo, đạt tỷ lệ đồng ý 97% với sự trừu tượng hóa thủ công của con người. Hệ thống tự động vượt trội đáng kể so với tốc độ nhập sổ đăng ký thủ công truyền thống, vốn thường phải đối mặt với độ trễ từ 12 đến 18 tháng.

Nhóm nghiên cứu, bao gồm Qianyun Luo và Schelomo Marmor, đã phát triển một quy trình 'OCR lai' (H-OCR) để giải quyết độ trễ trong cơ quan đăng ký ung thư. Các kết quả xét nghiệm bộ gen, chẳng hạn như điểm tái phát Oncotype DX, thường được lưu trữ trong hồ sơ sức khỏe điện tử (EHR) dưới dạng hình ảnh được quét không có cấu trúc thay vì dữ liệu có thể đọc được bằng máy, yêu cầu sao chép thủ công.

Quy trình H-OCR sử dụng EasyOCR để phát hiện văn bản dựa trên học sâu và Tesseract làm công cụ dự phòng để nhận dạng ký tự. Phương pháp kết hợp này được thiết kế để tận dụng khả năng của EasyOCR trong việc bản địa hóa các chú thích được khoanh tròn trên các báo cáo trong khi sử dụng tốc độ và khả năng nhận dạng ký tự của Tesseract.

Trong một bộ xác thực gồm 675 báo cáo, quy trình H-OCR đã đạt được sự đồng tình 97% với các tiêu chuẩn tham chiếu thủ công, vượt trội so với tỷ lệ chính xác 91% của việc trừu tượng hóa đăng ký thông thường. Quy trình tự động đã hoàn thành nhiệm vụ trong khoảng 4,9 giờ, so với độ trễ kéo dài hàng tháng điển hình của quy trình làm việc thủ công hiện tại.

Nghiên cứu phát hiện ra rằng điểm số tin cậy của quy trình đã xác định một cách hiệu quả các lỗi tiềm ẩn, cho thấy rằng việc triển khai trong tương lai có thể sử dụng các điểm số này để gắn cờ các trích xuất không chắc chắn để con người xem xét, từ đó giảm thiểu nguy cơ phân loại sai đáng kể về mặt lâm sàng.

Chi tiết nguồn: bioengineer.org ↗

Tại sao nó quan trọng

Sự phụ thuộc hiện nay vào việc sao chép thủ công dữ liệu gen tạo ra một trở ngại đáng kể trong nghiên cứu ung thư và ung thư chính xác. Bằng cách tự động trích xuất dữ liệu có cấu trúc từ các tệp PDF không có cấu trúc, phương pháp tiếp cận nguồn mở này cho phép các hệ thống y tế đưa vào cơ quan đăng ký ung thư trong thời gian gần như thời gian thực. Sự thay đổi này rất quan trọng để cải thiện chất lượng bằng chứng thực tế, cho phép nghiên cứu hiệu quả so sánh nhanh hơn và cung cấp dữ liệu có cấu trúc cần thiết để đào tạo các mô hình AI trong tương lai về ung thư. Vì các công cụ này là nguồn mở và có thể hoạt động trong môi trường tuân thủ HIPAA nên phương pháp này cung cấp giải pháp chi phí thấp, có thể tái tạo cho các tổ chức có nguồn lực hạn chế để hiện đại hóa cơ sở hạ tầng dữ liệu của họ mà không cần phần mềm độc quyền.

Các dấu ấn sinh học bộ gen rất cần thiết cho việc đo lường chất lượng và ung thư chính xác, tuy nhiên tiện ích của chúng hiện bị hạn chế do thời gian đưa chúng vào cơ sở dữ liệu nghiên cứu. Giảm độ trễ này cho phép tạo ra bằng chứng kịp thời hơn.

Việc sử dụng các công cụ nguồn mở như Tesseract và EasyOCR đảm bảo rằng giải pháp này có thể tiếp cận được với các trung tâm ung thư nhỏ hơn hoặc có nguồn lực hạn chế, có thể thiếu ngân sách cho phần mềm trích xuất dữ liệu y tế độc quyền, đắt tiền.

Nghiên cứu đã chứng minh rằng lợi ích của việc thu thập tự động này có thể được áp dụng rộng rãi trên nhiều nhóm bệnh nhân khác nhau, vì các nhà nghiên cứu nhận thấy rằng nhân khẩu học của bệnh nhân và các yếu tố lâm sàng không dự đoán đáng kể các lỗi trích xuất.

Bằng cách chuyển đổi các đối tượng nhị phân không có cấu trúc thành dữ liệu có cấu trúc, quy trình này cung cấp dữ liệu theo chiều dọc, chất lượng cao cần thiết để đào tạo và tinh chỉnh các mô hình AI và máy học trong tương lai trong không gian ung thư.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Nghiên cứu trong tương lai sẽ cần giải quyết khả năng mở rộng của quy trình này ngoài định dạng Oncotype DX được tiêu chuẩn hóa. Các tác giả lưu ý rằng các báo cáo giải trình tự soma thế hệ tiếp theo thể hiện tính không đồng nhất lớn hơn giữa các nhà cung cấp, đặt ra thách thức phức tạp hơn cho việc trích xuất tự động. Ngoài ra, mặc dù nghiên cứu đã xác thực quy trình dựa trên tập dữ liệu hồi cứu, nhưng cần phải thử nghiệm tiềm năng trong quy trình đăng ký lâm sàng trực tiếp để xác nhận độ tin cậy của quy trình trong cài đặt khối lượng lớn, trong thế giới thực.

Các nhà nghiên cứu đã xác định rõ ràng nhu cầu thử nghiệm quy trình trên các loại tài liệu không đồng nhất hơn, chẳng hạn như các báo cáo giải trình tự soma thế hệ tiếp theo, có sự khác biệt đáng kể tùy theo nhà cung cấp và định dạng.

Nghiên cứu được thực hiện tại một hệ thống y tế duy nhất; Công việc trong tương lai phải đánh giá hiệu suất của quy trình trên nhiều tổ chức để đảm bảo nó vẫn hoạt động mạnh mẽ trước những thay đổi về chất lượng quét, độ phân giải fax và các cấu hình EHR khác nhau.

Tích hợp triển vọng vào quy trình đăng ký trực tiếp là bước hợp lý tiếp theo để xác định xem hệ thống có duy trì được độ chính xác và hiệu quả khi xử lý dữ liệu lâm sàng đến trong thời gian thực hay không.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIĐào tạo AITương lai của AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?