Chuyện gì đã xảy ra
Microsoft Research đã công bố hai mô hình nền tảng bệnh lý có trọng lượng mở là GigaPath-Flash và GigaTIME-Flash, được thiết kế để giúp nghiên cứu ung thư quy mô lớn trở nên thực tế hơn về mặt tính toán. Các mô hình này là các bản nghiên cứu được phát triển cùng với Đại học Washington và Providence.
Nghiên cứu Microsoft cho biết GigaPath-Flash và GigaTIME-Flash mở rộng các mô hình bệnh lý trước đó có tên là GigaPath và GigaTIME. GigaPath phân tích các hình ảnh bệnh lý toàn bộ slide, trong khi GigaTIME lập mô hình môi trường vi mô của khối u và chuyển các hình ảnh hematoxylin-and-eosin hoặc H&E thông thường thành bản đồ proteomics không gian ảo. Các mô hình Flash mới nhằm giải quyết chi phí tính toán khi áp dụng nhiều lần các hệ thống như vậy cho các nhóm lớn, thay vì giới thiệu một sản phẩm lâm sàng. Do đó, trọng tâm của họ là hiệu quả của quy trình nghiên cứu và khả năng tiếp cận phân tích trên quy mô lớn. Các bản phát hành vẫn duy trì kết nối với dòng mô hình trước đó trong khi thay đổi mức độ tính toán cần thiết để sử dụng nhiều lần.
GigaPath-Flash kết hợp bộ mã hóa lát ViT-S 22 triệu tham số với bộ mã hóa slide LongNet 21 triệu tham số. Microsoft cho biết bộ mã hóa ô nhỏ gọn được chắt lọc từ bộ mã hóa GigaPath hàng tỷ thông số ban đầu, trong khi bộ mã hóa trang trình bày sử dụng chú ý giãn nở tỷ lệ tuyến tính theo số lượng ô hình ảnh. Trên các điểm chuẩn phân loại tuyến tiền liệt PANDA và phân nhóm khối u não EBRAINS được trích dẫn của nguồn, Microsoft báo cáo rằng GigaPath-Flash chỉ đạt 3% so với GigaPath ban đầu trong khi sử dụng khả năng tính toán ít hơn khoảng 50 lần. Nói cách khác, kết quả được báo cáo kết hợp một mô hình nhỏ hơn nhiều với hiệu suất vẫn gần bằng hệ thống trước đó trong các thử nghiệm được trích dẫn đó. Sự so sánh được trình bày dưới dạng kết quả hiệu quả từ đánh giá của Microsoft, chứ không phải là một phát hiện rộng hơn về mọi nhiệm vụ bệnh lý.
GigaTIME-Flash thay thế đường trục tích chập GigaTIME ban đầu bằng bộ mã hóa GigaPath-Flash ViT-S và sử dụng bộ giải mã tích chập hạng nhẹ để dịch huỳnh quang miễn dịch H&E sang ghép kênh. Microsoft báo cáo rằng nó phù hợp hoặc cải tiến trên mô hình ban đầu trong bộ thử nghiệm của nó và bốn nhóm thuần tập ngoài phân phối bao gồm ung thư não, vú, ruột kết và phổi. Theo nguồn tin, cả hai mô hình đều được phát hành theo giấy phép Apache 2.0, với trọng lượng và mã được cung cấp thông qua Hugging Face. Điều này cung cấp cho các nhà nghiên cứu các thành phần cần thiết để kiểm tra và đánh giá các bản phát hành trong môi trường riêng của họ. Thử nghiệm ngoài phân phối được báo cáo mở rộng so sánh ra ngoài bộ thử nghiệm ban đầu, nhưng nó không loại bỏ nhu cầu đánh giá thêm.
Chi tiết nguồn: microsoft.com ↗
Tại sao nó quan trọng
Các mô hình này có thể cho phép các nhà nghiên cứu phân tích các nhóm bệnh nhân lớn hơn và lặp lại nhiều thí nghiệm hơn bằng cách sử dụng dữ liệu bệnh lý hiện có. Điều đó có thể mở rộng các nghiên cứu về sinh học bệnh tật, dấu ấn sinh học, môi trường vi mô khối u và kết quả lâm sàng, mặc dù các mô hình này chưa được xác nhận để chăm sóc bệnh nhân.
Hình ảnh bệnh lý toàn bộ slide có thể vượt quá gigapixel và có thể yêu cầu xử lý hàng nghìn ô trên mỗi slide. Nguồn tin lập luận rằng chi phí trở nên đặc biệt hạn chế khi các nhà nghiên cứu nghiên cứu hàng chục nghìn bệnh nhân và lặp lại việc trích xuất đặc điểm, phân tích thống kê, kiểm tra giả thuyết và xác nhận nhóm phụ. Do đó, yêu cầu về bộ nhớ và tính toán thấp hơn có thể ảnh hưởng đến những câu hỏi nghiên cứu nào khả thi, chứ không chỉ ảnh hưởng đến tốc độ chạy của một phân tích hiện có. Một quy trình làm việc có thể được lặp lại một cách tiết kiệm hơn có thể giúp các nhóm nghiên cứu có những so sánh lớn hơn và các kiểm tra bổ sung mang tính thực tế hơn. Do đó, lợi ích tiềm năng được mô tả bởi nguồn gắn liền với quy mô, sự lặp lại và khả năng làm việc với dữ liệu bệnh lý đã tồn tại.
Microsoft ước tính rằng việc tạo dữ liệu miễn dịch huỳnh quang ghép kênh ảo cho 1.000 trang trình bày sẽ mất khoảng hai giờ GPU với GigaTIME-Flash so với bảy giờ GPU với GigaTIME trên một NVIDIA A100, theo giả định bao gồm khoảng 10.000 ô trên mỗi trang trình bày. Đối với 100.000 slide, ước tính là khoảng bảy ngày GPU so với 30 ngày GPU; cho một triệu slide, khoảng 70 ngày GPU so với 300 ngày GPU. Đây là những ước tính được mô hình hóa, không phải các phép đo độc lập và nguồn cho biết thời gian chạy thực tế phụ thuộc vào kích thước trang chiếu, độ phân giải xếp lớp và phần cứng. Các ước tính minh họa sự khác biệt trong quá trình xử lý mỗi slide có thể tăng lên như thế nào khi nhóm thuần tập trở nên lớn hơn nhiều. Chúng vẫn nên được hiểu là các tính toán kịch bản gắn liền với các giả định đã nêu, thay vì là kết quả được đảm bảo cho mỗi lần triển khai.
Tầm quan trọng thực tiễn cũng gắn liền với sự cởi mở. Bản phát hành Apache 2.0 có thể cho phép các nhóm nghiên cứu và học thuật khác kiểm tra, điều chỉnh và đánh giá các mô hình mà không chỉ dựa vào dịch vụ được lưu trữ, tùy thuộc vào nguồn lực kỹ thuật và quản trị của riêng họ. Nhưng tính hiệu quả không tạo nên giá trị khoa học. Nguồn tin cho biết rõ ràng rằng các mô hình này là những nghiên cứu ban đầu được phát hành, đã được thử nghiệm trên một số tiêu chuẩn và đoàn hệ hạn chế, đồng thời không nhằm mục đích hoặc xác nhận để chẩn đoán, tiên lượng, lựa chọn phương pháp điều trị hoặc các quyết định chăm sóc bệnh nhân khác. Truy cập mở có thể mở rộng sự xem xét kỹ lưỡng và thử nghiệm, nhưng nó không thay thế bằng chứng về độ tin cậy hoặc tính hữu ích trong lâm sàng. Ý nghĩa được hỗ trợ mạnh mẽ nhất là nhiều nhóm hơn có thể kiểm tra các công cụ nghiên cứu và giới hạn của chúng.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Các câu hỏi chính là liệu hiệu quả và hiệu suất được báo cáo có áp dụng được ở nhiều tổ chức, máy quét, loại mô, quần thể và nhiệm vụ nghiên cứu hơn hay không. Đánh giá độc lập và xác nhận lâm sàng vẫn cần thiết và nguồn không chứng minh rằng các mô hình cải thiện chẩn đoán, tiên lượng hoặc quyết định điều trị.
Việc sao chép độc lập nên kiểm tra sự cân bằng giữa hiệu suất và hiệu suất được báo cáo dưới các phần cứng, kích thước slide, quy trình tiền xử lý và kích cỡ lô khác nhau. Nó cũng nên kiểm tra xem các mô hình có còn đáng tin cậy trên các máy quét, tổ chức, phương pháp nhuộm màu, chất lượng mô, loại ung thư và nhóm bệnh nhân hay không. Bản thân Microsoft cho biết vẫn cần phải xác thực rộng rãi hơn, do đó, kết quả điểm chuẩn được báo cáo phải được coi là tuyên bố từ các nhà phát triển mô hình hơn là bằng chứng đã được giải quyết. Thử nghiệm như vậy sẽ giúp tách biệt các kết quả phụ thuộc vào thiết lập được báo cáo khỏi các kết quả khái quát trên các môi trường nghiên cứu. Nó cũng sẽ cho biết liệu các yêu cầu về tài nguyên thấp hơn có còn hữu ích hay không khi quy trình xử lý dữ liệu xung quanh thay đổi.
Các nhà nghiên cứu cũng sẽ cần xác định xem liệu việc học cách trình bày tốt hơn có chuyển thành những phát hiện sinh học hữu ích hay không. Nguồn tin chỉ ra phân tích trước đó của GigaTIME trên hơn 14.000 bệnh nhân ung thư và hơn 1.200 mối liên hệ có ý nghĩa thống kê giữa trạng thái tế bào miễn dịch và dấu ấn sinh học lâm sàng, nhưng nó không cho thấy rằng các mô hình Flash tái tạo một cách độc lập các mối liên hệ đó hoặc tạo ra những khám phá đã được xác thực. Tương tự, các hiệp hội thống kê cũng không tự mình chứng minh mối quan hệ nhân quả hoặc lợi ích lâm sàng. Câu hỏi liên quan là liệu các mô hình mới hơn có hỗ trợ những phát hiện vẫn có ý nghĩa sau khi phân tích độc lập và xác nhận bổ sung hay không. Hiệu quả có thể làm cho các cuộc điều tra đó dễ lặp lại hơn, nhưng nó không giải quyết được các câu hỏi về bằng chứng xung quanh các phát hiện.
Điều chưa biết có hậu quả lớn nhất là hiệu quả lâm sàng ở hạ lưu. Nguồn này không cung cấp thử nghiệm lâm sàng tiềm năng, dữ liệu triển khai, phân tích chẩn đoán chính xác, bằng chứng về kết quả điều trị hoặc đánh giá tác hại của nhóm phụ đối với các mô hình Flash. Trước khi có thể xem xét sử dụng lâm sàng, nguồn tin cho biết sẽ cần phải có sự xác nhận bổ sung của nhiều tổ chức và trong tương lai. Cho đến lúc đó, tác động được hỗ trợ rõ ràng nhất là tính toán: làm cho một số quy trình nghiên cứu bệnh lý quy mô lớn ít tốn kém hơn và có thể lặp lại nhiều hơn. Bất kỳ chuyển động nào từ công cụ nghiên cứu sang chăm sóc bệnh nhân sẽ cần có bằng chứng vượt quá hiệu quả và so sánh tiêu chuẩn được mô tả ở đây. Do đó, sự khác biệt giữa công bố nghiên cứu thực tế và hệ thống lâm sàng đã được xác nhận vẫn là trọng tâm trong việc diễn giải thông báo.