O que aconteceu
A Microsoft Research anunciou dois modelos de base de patologia de peso aberto, GigaPath-Flash e GigaTIME-Flash, projetados para tornar a pesquisa do câncer em larga escala mais prática computacionalmente. Os modelos são lançamentos de pesquisas desenvolvidas com a Universidade de Washington e Providence.
A pesquisa Microsoft diz que GigaPath-Flash e GigaTIME-Flash estendem modelos de patologia anteriores chamados GigaPath e GigaTIME. O GigaPath analisa imagens patológicas de lâmina inteira, enquanto o GigaTIME modela microambientes tumorais e traduz imagens de rotina de hematoxilina e eosina, ou H&E, em mapas proteômicos espaciais virtuais. Os novos modelos Flash destinam-se a abordar o custo computacional da aplicação repetida de tais sistemas a grandes coortes, em vez de introduzir um produto clínico. Seu foco está, portanto, na eficiência do fluxo de trabalho de pesquisa e no acesso à análise em escala. Os lançamentos mantêm uma conexão com a família de modelos anteriores, ao mesmo tempo que alteram a quantidade de computação necessária para uso repetido.
GigaPath-Flash combina um codificador de bloco ViT-S de 22 milhões de parâmetros com um codificador de slide LongNet de 21 milhões de parâmetros. Microsoft diz que o codificador de bloco compacto foi destilado do codificador GigaPath original de bilhões de parâmetros, enquanto o codificador de slide usa atenção dilatada que é dimensionada linearmente com o número de blocos de imagem. Nos benchmarks de classificação de próstata PANDA e EBRAINS de subtipagem de tumores cerebrais citados pela fonte, Microsoft relata que o GigaPath-Flash ficou dentro de 3% do GigaPath original, usando cerca de 50 vezes menos computação. Em outras palavras, o resultado relatado combina um modelo muito menor com um desempenho que permaneceu próximo ao sistema anterior nos testes citados. A comparação é apresentada como um resultado de eficiência da avaliação de Microsoft, e não como uma descoberta mais ampla sobre cada tarefa patológica.
GigaTIME-Flash substitui o backbone convolucional GigaTIME original pelo codificador GigaPath-Flash ViT-S e usa um decodificador convolucional leve para tradução de H&E para imunofluorescência multiplex. Microsoft relata que combinou ou melhorou o modelo original em todo o seu conjunto de testes e quatro coortes fora de distribuição cobrindo câncer de cérebro, mama, cólon e pulmão. Ambos os modelos são lançados sob a licença Apache 2.0, com pesos e códigos disponibilizados através do Hugging Face, segundo a fonte. Isso dá aos pesquisadores os componentes declarados necessários para inspecionar e avaliar as liberações em seus próprios ambientes. Os testes fora de distribuição relatados ampliam a comparação para além do conjunto de testes original, mas não eliminam a necessidade de avaliações adicionais.
Detalhes da fonte: microsoft.com ↗
Por que isso importa
Os modelos poderiam permitir aos pesquisadores analisar coortes maiores de pacientes e repetir mais experimentos usando dados patológicos existentes. Isso pode expandir os estudos de biologia de doenças, biomarcadores, microambientes tumorais e resultados clínicos, embora os modelos não sejam validados para o atendimento ao paciente.
Imagens patológicas de slides inteiros podem exceder um gigapixel e exigir o processamento de milhares de blocos por slide. A fonte argumenta que o custo se torna especialmente restritivo quando os pesquisadores estudam dezenas de milhares de pacientes e repetem a extração de características, análises estatísticas, testes de hipóteses e validação de subgrupos. Requisitos mais baixos de computação e memória poderiam, portanto, afetar quais questões de pesquisa são viáveis, e não apenas a rapidez com que uma análise existente é executada. Um fluxo de trabalho que pode ser repetido de forma mais econômica pode tornar comparações maiores e verificações adicionais mais práticas para grupos de pesquisa. O benefício potencial descrito pela fonte está, portanto, vinculado à escala, à repetição e à capacidade de trabalhar com dados patológicos já existentes.
Microsoft estima que a geração de dados virtuais de imunofluorescência multiplex para 1.000 slides levaria cerca de duas horas de GPU com GigaTIME-Flash versus sete horas de GPU com GigaTIME em um único NVIDIA A100, sob suposições que incluem aproximadamente 10.000 blocos por slide. Para 100.000 slides, a estimativa é de cerca de sete dias de GPU versus 30 dias de GPU; para um milhão de slides, cerca de 70 dias de GPU contra 300 dias de GPU. Estas são estimativas modeladas, não medições independentes, e a fonte diz que os tempos de execução reais dependem do tamanho do slide, da resolução dos blocos e do hardware. As estimativas ilustram como a diferença no processamento por lâmina pode aumentar quando o grupo se tornar muito maior. Devem ainda ser lidos como cálculos de cenários ligados aos pressupostos declarados, e não como resultados garantidos para cada implementação.
A importância prática também está ligada à abertura. Uma versão Apache 2.0 pode permitir que grupos acadêmicos e outros grupos de pesquisa inspecionem, adaptem e avaliem os modelos sem depender apenas de um serviço hospedado, sujeito aos seus próprios recursos técnicos e governança. Mas a eficiência não estabelece validade científica. A fonte diz explicitamente que os modelos são lançamentos iniciais de pesquisa, foram testados em um conjunto limitado de parâmetros de referência e coortes e não se destinam ou são validados para diagnóstico, prognóstico, seleção de tratamento ou outras decisões de atendimento ao paciente. O acesso aberto pode ampliar o escrutínio e a experimentação, mas não substitui evidências sobre confiabilidade ou utilidade clínica. A implicação mais forte apoiada é que mais grupos poderão examinar as ferramentas de investigação e os seus limites.
Mecanismo interativo: como realmente funciona
Explore a tecnologia subjacente a este desenvolvimento de forma interativa.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
O que assistir a seguir
As principais questões são se a eficiência e o desempenho relatados se mantêm em mais instituições, scanners, tipos de tecidos, populações e tarefas de investigação. A avaliação independente e a validação clínica continuam a ser necessárias, e a fonte não estabelece que os modelos melhoram o diagnóstico, o prognóstico ou as decisões de tratamento.
A replicação independente deve testar a compensação relatada entre eficiência e desempenho em diferentes hardwares, tamanhos de slides, pipelines de pré-processamento e tamanhos de lote. Deve também examinar se os modelos permanecem fiáveis em scanners, instituições, práticas de coloração, qualidade dos tecidos, tipos de cancro e populações de pacientes. O próprio Microsoft diz que ainda é necessária uma validação mais ampla, portanto, os resultados de relatados devem ser tratados como afirmações dos desenvolvedores do modelo, em vez de evidências consolidadas. Esses testes ajudariam a separar os resultados que dependem da configuração relatada dos resultados que se generalizam nos ambientes de pesquisa. Também mostraria se os requisitos mais baixos de recursos permanecem úteis quando o fluxo de trabalho de processamento de dados circundante muda.
Os pesquisadores também precisarão determinar se uma melhor aprendizagem de representação se traduz em descobertas biológicas úteis. A fonte aponta para a análise anterior da GigaTIME de mais de 14.000 pacientes com câncer e mais de 1.200 associações estatisticamente significativas entre estados de células imunológicas e biomarcadores clínicos, mas não mostra que os modelos Flash reproduzam independentemente essas associações ou gerem descobertas validadas. Da mesma forma, as associações estatísticas não demonstram, por si só, causalidade ou benefício clínico. A questão relevante é se os modelos mais recentes apoiam conclusões que permanecem significativas após análise independente e validação adicional. A eficiência pode facilitar a repetição dessas investigações, mas não resolve as questões probatórias que rodeiam as conclusões.
A incógnita mais importante é o desempenho clínico posterior. A fonte não fornece nenhum ensaio clínico prospectivo, dados de implantação, análise de precisão de diagnóstico, evidências de resultados de tratamento ou avaliação de danos de subgrupos para os modelos Flash. Antes que o uso clínico possa ser considerado, a fonte diz que seria necessária uma validação multi-institucional e prospectiva adicional. Até então, o impacto mais claro suportado é computacional: tornar alguns fluxos de trabalho de investigação patológica em grande escala menos dispendiosos e mais repetíveis. Qualquer movimento de ferramentas de pesquisa em direção ao atendimento ao paciente exigiria evidências além da eficiência e das comparações de referência descritas aqui. A distinção entre uma divulgação prática de investigação e um sistema clínico validado permanece, portanto, central para a interpretação do anúncio.