Was ist passiert?
Microsoft Research kündigte zwei Pathologie-Grundlagenmodelle mit offenem Gewicht an: GigaPath-Flash und GigaTIME-Flash, die darauf ausgelegt sind, groß angelegte Krebsforschung rechnerisch praktischer zu machen. Bei den Modellen handelt es sich um Forschungsveröffentlichungen, die gemeinsam mit der University of Washington und Providence entwickelt wurden.
Laut Microsoft Research erweitern GigaPath-Flash und GigaTIME-Flash frühere Pathologiemodelle namens GigaPath und GigaTIME. GigaPath analysiert Pathologiebilder ganzer Objektträger, während GigaTIME Tumormikroumgebungen modelliert und routinemäßige Hämatoxylin-und-Eosin- oder H&E-Bilder in virtuelle räumliche Proteomikkarten übersetzt. Die neuen Flash-Modelle zielen darauf ab, den Rechenaufwand für die wiederholte Anwendung solcher Systeme auf große Kohorten zu reduzieren, anstatt ein klinisches Produkt einzuführen. Ihr Fokus liegt daher auf der Effizienz der Forschungsabläufe und dem Zugang zu Analysen im großen Maßstab. Die Versionen behalten die Verbindung zur früheren Modellfamilie bei, ändern jedoch den Rechenaufwand für die wiederholte Verwendung.
GigaPath-Flash kombiniert einen 22-Millionen-Parameter-ViT-S-Kachel-Encoder mit einem 21-Millionen-Parameter-LongNet-Slide-Encoder. Laut Microsoft wurde der kompakte Kachel-Encoder aus dem ursprünglichen GigaPath-Encoder mit Milliardenparametern destilliert, während der Folien-Encoder eine erweiterte Aufmerksamkeit verwendet, die linear mit der Anzahl der Bildkacheln skaliert. Zu den von der Quelle zitierten PANDA-Prostata-Grading- und EBRAINS-Hirntumor-Subtypisierungs-Benchmarks berichtet Microsoft, dass GigaPath-Flash innerhalb von 3 % des ursprünglichen GigaPath lag und dabei etwa 50-mal weniger Rechenleistung verbrauchte. Mit anderen Worten: Das gemeldete Ergebnis verbindet ein viel kleineres Modell mit einer Leistung, die bei den genannten Tests nahe an der des früheren Systems blieb. Der Vergleich wird als Effizienzergebnis der Bewertung von Microsoft dargestellt und nicht als umfassendere Erkenntnis zu jeder Pathologieaufgabe.
GigaTIME-Flash ersetzt das ursprüngliche GigaTIME-Faltungsrückgrat durch den GigaPath-Flash ViT-S-Encoder und verwendet einen leichten Faltungsdecoder für die Übersetzung von H&E in Multiplex-Immunfluoreszenz. Microsoft berichtet, dass es im gesamten Testsatz und in vier Kohorten außerhalb der Verteilung, die Gehirn-, Brust-, Dickdarm- und Lungenkrebs abdecken, mit dem ursprünglichen Modell übereinstimmte oder sich verbesserte. Beide Modelle werden unter der Apache 2.0-Lizenz veröffentlicht, wobei Gewichtungen und Code laut Quelle über Hugging Face verfügbar gemacht werden. Dies gibt den Forschern die erforderlichen Komponenten an die Hand, um die Veröffentlichungen in ihrem eigenen Umfeld zu untersuchen und zu bewerten. Die gemeldeten Out-of-Distribution-Tests erweitern den Vergleich über den ursprünglichen Testsatz hinaus, machen aber eine weitere Bewertung nicht überflüssig.
Quellenangaben: microsoft.com ↗
Warum es wichtig ist
Die Modelle könnten es Forschern ermöglichen, größere Patientenkohorten zu analysieren und mehr Experimente unter Verwendung vorhandener Pathologiedaten zu wiederholen. Dies könnte Studien zur Krankheitsbiologie, Biomarkern, Tumormikroumgebungen und klinischen Ergebnissen erweitern, obwohl die Modelle nicht für die Patientenversorgung validiert sind.
Pathologiebilder ganzer Objektträger können ein Gigapixel überschreiten und erfordern möglicherweise die Verarbeitung von Tausenden von Kacheln pro Objektträger. Die Quelle argumentiert, dass die Kosten besonders restriktiv werden, wenn Forscher Zehntausende von Patienten untersuchen und Merkmalsextraktion, statistische Analyse, Hypothesentests und Untergruppenvalidierung wiederholen. Geringere Rechen- und Speicheranforderungen könnten sich daher darauf auswirken, welche Forschungsfragen durchführbar sind, und nicht nur darauf, wie schnell eine bestehende Analyse ausgeführt wird. Ein wirtschaftlicher wiederholbarer Arbeitsablauf kann größere Vergleiche und zusätzliche Prüfungen für Forschungsgruppen praktischer machen. Der von der Quelle beschriebene potenzielle Nutzen hängt daher vom Umfang, der Wiederholung und der Fähigkeit ab, mit bereits vorhandenen Pathologiedaten zu arbeiten.
Microsoft schätzt, dass die Generierung virtueller Multiplex-Immunfluoreszenzdaten für 1.000 Objektträger etwa zwei GPU-Stunden mit GigaTIME-Flash im Vergleich zu sieben GPU-Stunden mit GigaTIME auf einem einzelnen NVIDIA A100 dauern würde, unter Annahmen von etwa 10.000 Kacheln pro Objektträger. Für 100.000 Folien liegt die Schätzung bei etwa sieben GPU-Tagen gegenüber 30 GPU-Tagen; für eine Million Folien etwa 70 GPU-Tage gegenüber 300 GPU-Tagen. Hierbei handelt es sich um modellierte Schätzungen und nicht um unabhängige Messungen. Die Quelle gibt an, dass die tatsächlichen Laufzeiten von der Foliengröße, der Kachelauflösung und der Hardware abhängen. Die Schätzungen veranschaulichen, wie der Unterschied in der Verarbeitung pro Folie zunehmen könnte, wenn die Kohorte viel größer wird. Sie sollten immer noch als Szenarioberechnungen gelesen werden, die an die genannten Annahmen gebunden sind, und nicht als garantierte Ergebnisse für jede Implementierung.
Mit der Offenheit ist auch die praktische Bedeutung verbunden. Eine Apache 2.0-Version kann es akademischen und anderen Forschungsgruppen ermöglichen, die Modelle zu prüfen, anzupassen und zu bewerten, ohne sich ausschließlich auf einen gehosteten Dienst verlassen zu müssen, vorbehaltlich ihrer eigenen technischen Ressourcen und Governance. Aber Effizienz begründet keine wissenschaftliche Gültigkeit. Die Quelle gibt ausdrücklich an, dass es sich bei den Modellen um frühe Forschungsveröffentlichungen handelt, die anhand einer begrenzten Anzahl von Benchmarks und Kohorten getestet wurden und nicht für Diagnose, Prognose, Behandlungsauswahl oder andere Entscheidungen zur Patientenversorgung vorgesehen oder validiert sind. Open Access kann die Untersuchung und das Experimentieren erweitern, ersetzt jedoch nicht den Nachweis von Zuverlässigkeit oder klinischem Nutzen. Die am stärksten unterstützte Schlussfolgerung ist, dass möglicherweise mehr Gruppen in der Lage sein könnten, die Forschungsinstrumente und ihre Grenzen zu untersuchen.
Interaktiver Mechanismus: Wie es tatsächlich funktioniert
Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Was Sie als nächstes sehen sollten
Die Hauptfragen sind, ob die gemeldete Effizienz und Leistung für mehrere Institutionen, Scanner, Gewebearten, Populationen und Forschungsaufgaben gilt. Eine unabhängige Bewertung und klinische Validierung sind weiterhin erforderlich, und die Quelle belegt nicht, dass die Modelle Diagnose, Prognose oder Behandlungsentscheidungen verbessern.
Die unabhängige Replikation sollte den gemeldeten Effizienz-Leistungs-Kompromiss unter unterschiedlicher Hardware, Objektträgergrößen, Vorverarbeitungspipelines und Stapelgrößen testen. Es sollte auch untersucht werden, ob die Modelle über alle Scanner, Institutionen, Färbepraktiken, Gewebequalitäten, Krebsarten und Patientenpopulationen hinweg zuverlässig bleiben. Microsoft selbst sagt, dass noch eine umfassendere Validierung erforderlich ist, daher sollten die gemeldeten -Ergebnisse als Behauptungen der Modellentwickler und nicht als eindeutige Beweise behandelt werden. Solche Tests würden dazu beitragen, Ergebnisse, die vom gemeldeten Aufbau abhängen, von Ergebnissen zu trennen, die sich über Forschungsumgebungen hinweg verallgemeinern lassen. Es würde auch zeigen, ob geringere Ressourcenanforderungen weiterhin sinnvoll sind, wenn sich der umgebende Datenverarbeitungsablauf ändert.
Forscher müssen auch feststellen, ob ein besseres Repräsentationslernen zu nützlichen biologischen Erkenntnissen führt. Die Quelle verweist auf GigaTIMEs frühere Analyse von mehr als 14.000 Krebspatienten und mehr als 1.200 statistisch signifikanten Zusammenhängen zwischen Immunzellzuständen und klinischen Biomarkern, zeigt jedoch nicht, dass die Flash-Modelle diese Zusammenhänge unabhängig reproduzieren oder validierte Entdeckungen generieren. Statistische Zusammenhänge allein belegen ebenfalls keinen Kausalzusammenhang oder klinischen Nutzen. Die relevante Frage ist, ob die neueren Modelle Erkenntnisse unterstützen, die auch nach unabhängiger Analyse und zusätzlicher Validierung aussagekräftig bleiben. Effizienz erleichtert möglicherweise die Wiederholung dieser Untersuchungen, löst jedoch nicht die Beweisfragen im Zusammenhang mit den Ergebnissen.
Die folgenreichste Unbekannte ist die nachgelagerte klinische Leistung. Die Quelle liefert keine prospektiven klinischen Studien, Einsatzdaten, diagnostischen Genauigkeitsanalysen, Belege für Behandlungsergebnisse oder eine Bewertung von Untergruppenschäden für die Flash-Modelle. Bevor eine klinische Anwendung in Betracht gezogen werden könnte, sei laut der Quelle eine zusätzliche multiinstitutionelle und prospektive Validierung erforderlich. Bis dahin ist die deutlichste unterstützte Auswirkung rechnerischer Natur: Einige groß angelegte Arbeitsabläufe in der Pathologieforschung werden kostengünstiger und wiederholbarer. Für jede Entwicklung von Forschungsinstrumenten hin zur Patientenversorgung wären Beweise erforderlich, die über die hier beschriebenen Effizienz- und -Vergleiche hinausgehen. Die Unterscheidung zwischen einer praktischen Forschungsfreigabe und einem validierten klinischen System bleibt daher von zentraler Bedeutung für die Interpretation der Ankündigung.