Что случилось
Microsoft Research анонсировала две базовые модели патологии с открытым весом, GigaPath-Flash и GigaTIME-Flash, предназначенные для того, чтобы сделать крупномасштабные исследования рака более практичными с точки зрения вычислений. Модели представляют собой исследовательские выпуски, разработанные совместно с Университетом Вашингтона и Провиденса.
Microsoft Исследования говорят, что GigaPath-Flash и GigaTIME-Flash расширяют более ранние модели патологии, называемые GigaPath и GigaTIME. GigaPath анализирует изображения патологии целиком, в то время как GigaTIME моделирует микроокружение опухоли и переводит обычные изображения гематоксилина и эозина (H&E) в виртуальные пространственные протеомные карты. Новые Flash-модели предназначены для устранения вычислительных затрат, связанных с повторным применением таких систем к большим когортам, а не для внедрения клинического продукта. Поэтому их внимание сосредоточено на эффективности исследовательского процесса и доступе к анализу в больших масштабах. В новых версиях сохраняется связь с предыдущим семейством моделей, но при этом изменяется объем вычислений, необходимый для многократного использования.
GigaPath-Flash сочетает в себе кодировщик фрагментов ViT-S на 22 миллиона параметров и кодировщик слайдов LongNet на 21 миллион параметров. Microsoft утверждает, что компактный кодировщик фрагментов был создан на основе оригинального кодировщика GigaPath с миллиардом параметров, в то время как кодировщик слайдов использует расширенное внимание, которое линейно масштабируется в зависимости от количества фрагментов изображения. В цитируемых источником тестах PANDA по оценке простаты и EBRAINS по подтипированию опухолей головного мозга Microsoft сообщает, что GigaPath-Flash оказался в пределах 3% от исходного GigaPath, используя при этом примерно в 50 раз меньше вычислительных ресурсов. Другими словами, заявленный результат сочетает в себе модель гораздо меньшего размера с производительностью, которая оставалась близкой к предыдущей системе в упомянутых тестах. Сравнение представлено как результат эффективности оценки Microsoft, а не как более широкий вывод по каждой патологоанатомической задаче.
GigaTIME-Flash заменяет исходную сверточную магистраль GigaTIME кодером GigaPath-Flash ViT-S и использует легкий сверточный декодер для трансляции H&E в мультиплексную иммунофлуоресценцию. Microsoft сообщает, что он совпал или улучшил исходную модель в своем тестовом наборе и четырех внераспределенных когортах, охватывающих рак мозга, молочной железы, толстой кишки и легких. По словам источника, обе модели выпущены под лицензией Apache 2.0, а вес и код доступны через Hugging Face. Это дает исследователям заявленные компоненты, необходимые для проверки и оценки выбросов в их собственных условиях. Сообщаемое тестирование вне дистрибутива расширяет возможности сравнения за пределы исходного набора тестов, но не устраняет необходимости в дальнейшей оценке.
Подробности об источнике: microsoft.com ↗
Почему это важно
Модели могут позволить исследователям анализировать более крупные группы пациентов и повторять больше экспериментов, используя существующие данные о патологии. Это может расширить исследования биологии заболеваний, биомаркеров, микроокружения опухолей и клинических результатов, хотя эти модели не проверены для ухода за пациентами.
Изображения патологии всего слайда могут превышать гигапиксель и могут потребовать обработки тысяч плиток на слайд. Источник утверждает, что стоимость становится особенно ограничительной, когда исследователи изучают десятки тысяч пациентов и повторяют извлечение признаков, статистический анализ, проверку гипотез и проверку подгрупп. Таким образом, более низкие требования к вычислительным ресурсам и памяти могут повлиять на то, какие исследовательские вопросы будут осуществимы, а не только на то, насколько быстро выполняется существующий анализ. Рабочий процесс, который можно повторить более экономично, может сделать более масштабные сравнения и дополнительные проверки более практичными для исследовательских групп. Таким образом, потенциальная польза, описанная источником, связана с масштабом, повторением и способностью работать с уже существующими данными о патологии.
По оценкам Microsoft, генерация данных виртуальной мультиплексной иммунофлуоресценции для 1000 слайдов займет около двух часов графического процессора с помощью GigaTIME-Flash против семи часов графического процессора с GigaTIME на одном NVIDIA A100 при допущениях, включающих примерно 10 000 плиток на слайд. Для 100 000 слайдов оценка составляет около семи графо-дней против 30 графо-дней; для миллиона слайдов — около 70 GPU-дней против 300 GPU-дней. Это смоделированные оценки, а не независимые измерения, и источник утверждает, что фактическое время работы зависит от размера слайда, разрешения мозаики и аппаратного обеспечения. Оценки показывают, как разница в обработке каждого слайда может увеличиться, когда когорта станет намного больше. Их по-прежнему следует рассматривать как расчеты сценариев, привязанные к заявленным предположениям, а не как гарантированные результаты для каждой реализации.
Практическая значимость также связана с открытостью. Версия Apache 2.0 может позволить академическим и другим исследовательским группам проверять, адаптировать и оценивать модели, не полагаясь исключительно на размещенный сервис, при условии использования собственных технических ресурсов и управления. Но эффективность не обеспечивает научную обоснованность. Источник прямо заявляет, что эти модели являются ранними исследовательскими выпусками, были протестированы на ограниченном наборе критериев и когорт и не предназначены и не проверяются для диагностики, прогноза, выбора лечения или других решений по уходу за пациентами. Открытый доступ может расширить изучение и экспериментирование, но он не заменяет доказательств надежности или клинической полезности. Самый убедительный вывод заключается в том, что больше групп смогут изучить инструменты исследования и их ограничения.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Главный вопрос заключается в том, сохранятся ли заявленные эффективность и результативность при большем количестве учреждений, сканеров, типов тканей, групп населения и исследовательских задач. Независимая оценка и клиническая проверка по-прежнему необходимы, и источник не устанавливает, что модели улучшают диагностику, прогноз или решения о лечении.
Независимая репликация должна проверить соотношение эффективности и производительности, о котором сообщается, при различном оборудовании, размерах слайдов, конвейерах предварительной обработки и размерах пакетов. Следует также изучить, остаются ли модели надежными для различных сканеров, учреждений, методов окрашивания, качества тканей, типов рака и групп пациентов. Сам Microsoft заявляет, что по-прежнему необходима более широкая проверка, поэтому представленные результаты тестов следует рассматривать как заявления разработчиков модели, а не как убедительные доказательства. Такое тестирование поможет отделить результаты, которые зависят от заявленной настройки, от результатов, которые обобщаются в исследовательских средах. Это также покажет, останутся ли более низкие требования к ресурсам полезными, когда окружающий рабочий процесс обработки данных изменится.
Исследователям также необходимо будет определить, приведет ли обучение к лучшему представлению к полезным биологическим открытиям. Источник указывает на более ранний анализ GigaTIME более 14 000 больных раком и более 1200 статистически значимых связей между состояниями иммунных клеток и клиническими биомаркерами, но он не показывает, что модели Flash независимо воспроизводят эти ассоциации или генерируют подтвержденные открытия. Статистические связи сами по себе также не демонстрируют причинно-следственной связи или клинической пользы. Актуальный вопрос заключается в том, поддерживают ли новые модели выводы, которые остаются значимыми после независимого анализа и дополнительной проверки. Эффективность может облегчить повторение этих расследований, но она не решает доказательные вопросы, связанные с полученными результатами.
Наиболее важным неизвестным является последующая клиническая эффективность. Источник не предоставляет никаких проспективных клинических испытаний, данных о развертывании, анализа точности диагностики, данных о результатах лечения или оценки вреда подгрупп для моделей Flash. По словам источника, прежде чем можно будет рассмотреть вопрос о клиническом использовании, потребуются дополнительные межинституциональные и проспективные проверки. До тех пор наиболее очевидным поддерживаемым воздействием является вычислительное: сделать некоторые крупномасштабные рабочие процессы исследования патологии менее дорогостоящими и более повторяемыми. Любой переход от исследовательских инструментов к уходу за пациентами потребует доказательств, выходящих за рамки эффективности и сравнений показателей, описанных здесь. Таким образом, различие между публикацией практического исследования и проверенной клинической системой остается центральным при интерпретации объявления.