Hva skjedde
Microsoft Research annonserte to åpne-vekt-patologifundamentmodeller, GigaPath-Flash og GigaTIME-Flash, designet for å gjøre storskala kreftforskning mer beregningsmessig praktisk. Modellene er forskningsutgivelser utviklet med University of Washington og Providence.
Microsoft Research sier at GigaPath-Flash og GigaTIME-Flash utvider tidligere patologimodeller kalt GigaPath og GigaTIME. GigaPath analyserer hel-slide patologibilder, mens GigaTIME modellerer tumormikromiljøer og oversetter rutinemessige hematoxylin-og-eosin, eller H&E, bilder til virtuelle romlige proteomikkkart. De nye Flash-modellene er ment å dekke de beregningsmessige kostnadene ved gjentatte bruk av slike systemer på store kohorter, i stedet for å introdusere et klinisk produkt. Deres fokus er derfor på forskningsarbeidsflyteffektivitet og tilgang til analyser i stor skala. Utgivelsene beholder en kobling til den tidligere modellfamilien mens de endrer hvor mye databehandling som trengs for gjentatt bruk.
GigaPath-Flash kombinerer en 22-millioner-parameter ViT-S-flisekoder med en 21-million-parameter LongNet-slide-koder. Microsoft sier at den kompakte flisekoderen ble destillert fra den originale milliardparameter GigaPath-koderen, mens lysbildekoderen bruker utvidet oppmerksomhet som skaleres lineært med antall bildebrikker. På kildens siterte PANDA prostata-gradering og EBRAINS hjerne-tumor-subtyping benchmarks, rapporterer Microsoft at GigaPath-Flash kom innenfor 3 % av den originale GigaPath mens den brukte omtrent 50 ganger mindre beregning. Med andre ord, det rapporterte resultatet parer en mye mindre modell med ytelse som forble nær det tidligere systemet på de siterte testene. Sammenligningen presenteres som et effektivitetsresultat fra Microsofts evaluering, ikke som et bredere funn om hver patologioppgave.
GigaTIME-Flash erstatter den originale GigaTIME-konvolusjonsryggraden med GigaPath-Flash ViT-S-koderen og bruker en lett konvolusjonsdekoder for H&E-til-multipleks-immunofluorescens-oversettelse. Microsoft rapporterer at den matchet eller forbedret den originale modellen på tvers av testsettet og fire kohorter utenfor distribusjon som dekker hjerne-, bryst-, tykktarms- og lungekreft. Begge modellene er utgitt under Apache 2.0-lisensen, med vekter og kode gjort tilgjengelig gjennom Hugging Face, ifølge kilden. Dette gir forskerne de angitte komponentene som trengs for å inspisere og evaluere utgivelsene i sine egne innstillinger. Den rapporterte testingen utenfor distribusjon utvider sammenligningen utover det opprinnelige testsettet, men det fjerner ikke behovet for ytterligere evaluering.
Kildedetaljer: microsoft.com ↗
Hvorfor det betyr noe
Modellene kan tillate forskere å analysere større pasientkohorter og gjenta flere eksperimenter ved å bruke eksisterende patologidata. Det kan utvide studier av sykdomsbiologi, biomarkører, tumormikromiljøer og kliniske utfall, selv om modellene ikke er validert for pasientbehandling.
Hele lysbildepatologibilder kan overstige en gigapiksel og kan kreve behandling av tusenvis av fliser per lysbilde. Kilden hevder at kostnadene blir spesielt restriktive når forskere studerer titusenvis av pasienter og gjentar funksjonsekstraksjon, statistisk analyse, hypotesetesting og undergruppevalidering. Lavere data- og minnekrav kan derfor påvirke hvilke forskningsspørsmål som er gjennomførbare, ikke bare hvor raskt en eksisterende analyse kjører. En arbeidsflyt som kan gjentas mer økonomisk kan gjøre større sammenligninger og tilleggskontroller mer praktiske for forskningsgrupper. Den potensielle fordelen beskrevet av kilden er dermed knyttet til skala, repetisjon og evnen til å arbeide med patologidata som allerede eksisterer.
Microsoft anslår at generering av virtuelle multipleks-immunofluorescensdata for 1000 lysbilder vil ta omtrent to GPU-timer med GigaTIME-Flash versus syv GPU-timer med GigaTIME på en enkelt NVIDIA A100, under forutsetninger inkludert omtrent 10 000 brikker per lysbilde. For 100 000 lysbilder er estimatet omtrent syv GPU-dager mot 30 GPU-dager; for én million lysbilder, omtrent 70 GPU-dager mot 300 GPU-dager. Dette er modellerte estimater, ikke uavhengige målinger, og kilden sier at faktiske kjøretider avhenger av lysbildestørrelse, flisoppløsning og maskinvare. Estimatene illustrerer hvordan en forskjell i per-slide-behandling kan vokse når kohorten blir mye større. De bør fortsatt leses som scenarioberegninger knyttet til de angitte forutsetningene, snarere enn som garanterte resultater for hver implementering.
Den praktiske betydningen er også knyttet til åpenhet. En Apache 2.0-utgivelse kan la akademiske og andre forskningsgrupper inspisere, tilpasse og evaluere modellene uten å stole utelukkende på en vertsbasert tjeneste, underlagt deres egne tekniske ressurser og styring. Men effektivitet fastslår ikke vitenskapelig gyldighet. Kilden sier eksplisitt at modellene er tidlige forskningsutgivelser, har blitt testet på et begrenset sett med benchmarks og kohorter, og er ikke ment eller validert for diagnose, prognose, behandlingsvalg eller andre beslutninger om pasientbehandling. Åpen tilgang kan utvide gransking og eksperimentering, men den erstatter ikke bevis om pålitelighet eller klinisk nytte. Den sterkeste støttede implikasjonen er at flere grupper kan være i stand til å undersøke forskningsverktøyene og deres grenser.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Hva du skal se neste
Hovedspørsmålene er om den rapporterte effektiviteten og ytelsen holder på tvers av flere institusjoner, skannere, vevstyper, populasjoner og forskningsoppgaver. Uavhengig evaluering og klinisk validering er fortsatt nødvendig, og kilden fastslår ikke at modellene forbedrer diagnose, prognose eller behandlingsbeslutninger.
Uavhengig replikering bør teste den rapporterte effektivitet-ytelse-avveiningen under forskjellig maskinvare, lysbildestørrelser, forbehandlingsrørledninger og batchstørrelser. Den bør også undersøke om modellene forblir pålitelige på tvers av skannere, institusjoner, fargingspraksis, vevskvalitet, krefttyper og pasientpopulasjoner. Microsoft selv sier at det fortsatt er behov for bredere validering, så de rapporterte referanseresultatene bør behandles som påstander fra modellutviklerne i stedet for avgjort bevis. Slik testing vil bidra til å skille resultater som avhenger av det rapporterte oppsettet fra resultater som generaliserer på tvers av forskningsmiljøer. Det vil også vise om lavere ressurskrav fortsatt er nyttig når den omkringliggende arbeidsflyten for databehandling endres.
Forskere må også finne ut om bedre representasjonslæring kan føre til nyttige biologiske funn. Kilden peker på GigaTIMEs tidligere analyse av mer enn 14 000 kreftpasienter og mer enn 1200 statistisk signifikante assosiasjoner mellom immuncelletilstander og kliniske biomarkører, men den viser ikke at Flash-modellene uavhengig reproduserer disse assosiasjonene eller genererer validerte funn. Statistiske assosiasjoner viser heller ikke i seg selv årsakssammenheng eller klinisk fordel. Det relevante spørsmålet er om de nyere modellene støtter funn som forblir meningsfulle etter uavhengig analyse og ytterligere validering. Effektivitet kan gjøre disse undersøkelsene lettere å gjenta, men den løser ikke bevisspørsmålene rundt funnene.
Den mest ukjente konsekvensen er nedstrøms klinisk ytelse. Kilden gir ingen prospektive kliniske studier, distribusjonsdata, diagnostisk nøyaktighetsanalyse, behandlingsresultatbevis eller vurdering av undergruppeskader for Flash-modellene. Før klinisk bruk kan vurderes, sier kilden at ytterligere multi-institusjonell og prospektiv validering vil være nødvendig. Inntil da er den klareste støttede effekten beregningsmessig: å gjøre noen store arbeidsflyter for patologiforskning billigere og mer repeterbare. Enhver bevegelse fra forskningsverktøy mot pasientbehandling vil kreve bevis utover effektiviteten og -sammenligningene beskrevet her. Skillet mellom en praktisk forskningsutgivelse og et validert klinisk system forblir derfor sentralt for å tolke kunngjøringen.