Co se stalo
Společnost Microsoft Research oznámila dva modely nadace patologie s otevřenou váhou, GigaPath-Flash a GigaTIME-Flash, navržené tak, aby byl rozsáhlý výzkum rakoviny počítačově praktičtější. Modely jsou výzkumné zprávy vyvinuté s University of Washington a Providence.
Výzkum Microsoft uvádí, že GigaPath-Flash a GigaTIME-Flash rozšiřují dřívější modely patologie zvané GigaPath a GigaTIME. GigaPath analyzuje patologické snímky na celém snímku, zatímco GigaTIME modeluje mikroprostředí nádoru a převádí rutinní snímky hematoxylin-a-eosin neboli H&E do virtuálních prostorových proteomických map. Nové modely Flash jsou určeny k řešení nákladů na výpočetní techniku při opakované aplikaci takových systémů na velké kohorty, spíše než k zavedení klinického produktu. Zaměřují se proto na efektivitu pracovního postupu výzkumu a přístup k analýze ve velkém měřítku. Vydání si zachovávají spojení s předchozí rodinou modelů a zároveň mění, kolik výpočetní techniky je potřeba pro opakované použití.
GigaPath-Flash kombinuje kodér dlaždic ViT-S s 22 miliony parametrů a posuvný kodér LongNet s 21 miliony parametrů. Microsoft říká, že kompaktní kodér dlaždic byl destilován z původního kodéru GigaPath s miliardou parametrů, zatímco kodér snímků používá rozšířenou pozornost, která se lineárně mění s počtem dlaždic obrazu. Na zdroji citovaných srovnávacích testech pro klasifikaci prostaty PANDA a EBRAINS podtypování mozkových nádorů Microsoft uvádí, že GigaPath-Flash se přiblížil 3 % původní GigaPath, přičemž spotřeboval zhruba 50krát méně výpočtů. Jinými slovy, hlášený výsledek spojuje mnohem menší model s výkonem, který se v uvedených testech blížil dřívějšímu systému. Srovnání je prezentováno jako výsledek účinnosti z hodnocení Microsoft, nikoli jako širší zjištění o každém patologickém úkolu.
GigaTIME-Flash nahrazuje původní konvoluční páteř GigaTIME kodérem GigaPath-Flash ViT-S a používá lehký konvoluční dekodér pro H&E-k-multiplexní imunofluorescenční převod. Microsoft uvádí, že se ve své testovací sadě a ve čtyřech kohortách mimo distribuci, které pokrývají rakovinu mozku, prsu, tlustého střeva a plic, shodoval nebo zlepšil s původním modelem. Oba modely jsou vydány pod licencí Apache 2.0, s váhami a kódem zpřístupněným prostřednictvím Hugging Face, podle zdroje. To poskytuje výzkumníkům uvedené komponenty potřebné ke kontrole a vyhodnocení úniků v jejich vlastních nastaveních. Hlášené testování out-of-distribution rozšiřuje srovnání nad rámec původní sady testů, ale neodstraňuje potřebu dalšího hodnocení.
Podrobnosti o zdroji: microsoft.com ↗
Proč na tom záleží
Modely by mohly výzkumníkům umožnit analyzovat větší kohorty pacientů a opakovat více experimentů s využitím existujících patologických dat. To může rozšířit studie biologie onemocnění, biomarkerů, mikroprostředí nádorů a klinických výsledků, ačkoli modely nejsou validovány pro péči o pacienty.
Patologické snímky na celém snímku mohou přesáhnout gigapixel a mohou vyžadovat zpracování tisíců dlaždic na jedno sklíčko. Zdroj tvrdí, že náklady se stávají obzvláště omezujícími, když výzkumníci studují desítky tisíc pacientů a opakují extrakci funkcí, statistickou analýzu, testování hypotéz a ověřování podskupin. Nižší výpočetní a paměťové požadavky by proto mohly ovlivnit, které výzkumné otázky jsou proveditelné, nejen to, jak rychle běží jedna existující analýza. Pracovní postup, který lze ekonomičtěji opakovat, může pro výzkumné skupiny učinit větší srovnání a dodatečné kontroly praktičtější. Potenciální přínos popsaný zdrojem je tedy vázán na měřítko, opakování a schopnost pracovat s již existujícími patologickými daty.
Microsoft odhaduje, že generování virtuálních multiplexních imunofluorescenčních dat pro 1000 diapozitivů by zabralo asi dvě GPU-hodiny s GigaTIME-Flash oproti sedmi GPU-hodinám s GigaTIME na jednom NVIDIA A100, za předpokladu zahrnujících přibližně 10 000 dlaždic na sklíčko. Pro 100 000 snímků je odhad přibližně sedm dní GPU oproti 30 dnům GPU; pro jeden milion snímků, asi 70 dnů GPU oproti 300 dnům GPU. Jedná se o modelované odhady, nikoli nezávislá měření, a zdroj říká, že skutečné doby běhu závisí na velikosti snímku, rozlišení dlaždic a hardwaru. Odhady ilustrují, jak by mohl růst rozdíl ve zpracování jednotlivých snímků, když se kohorta stane mnohem větší. Stále by se měly chápat jako výpočty scénářů vázané na uvedené předpoklady, spíše než jako zaručené výsledky pro každou implementaci.
S otevřeností souvisí i praktický význam. Vydání Apache 2.0 může umožnit akademickým a dalším výzkumným skupinám kontrolovat, přizpůsobovat a hodnotit modely, aniž by se spoléhaly pouze na hostovanou službu, v závislosti na jejich vlastních technických zdrojích a správě. Účinnost však nezakládá vědeckou platnost. Zdroj výslovně uvádí, že modely jsou rané výzkumné zprávy, byly testovány na omezeném souboru srovnávacích kritérií a kohort a nejsou určeny ani ověřeny pro diagnostiku, prognózu, výběr léčby nebo jiná rozhodnutí o péči o pacienta. Otevřený přístup může rozšířit zkoumání a experimentování, ale nenahrazuje důkazy o spolehlivosti nebo klinické užitečnosti. Nejsilněji podporovaným důsledkem je, že více skupin může být schopno zkoumat výzkumné nástroje a jejich limity.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Na co se dále dívat
Hlavními otázkami je, zda uváděná účinnost a výkon platí pro více institucí, skenerů, typů tkání, populací a výzkumných úkolů. Nezávislé hodnocení a klinické ověření zůstává nezbytné a zdroj neuvádí, že modely zlepšují diagnózu, prognózu nebo rozhodnutí o léčbě.
Nezávislá replikace by měla otestovat uváděný kompromis mezi účinností a výkonem při různém hardwaru, velikostech snímků, kanálech předběžného zpracování a velikostech dávek. Měl by také prověřit, zda modely zůstávají spolehlivé napříč skenery, institucemi, postupy barvení, kvalitou tkání, typy rakoviny a populacemi pacientů. Samotný Microsoft říká, že je stále zapotřebí širší validace, takže oznámené výsledky ů by měly být považovány za tvrzení vývojářů modelu spíše než za ustálené důkazy. Takové testování by pomohlo oddělit výsledky, které závisí na hlášeném nastavení, od výsledků, které se zobecňují napříč výzkumnými prostředími. Také by to ukázalo, zda nižší požadavky na zdroje zůstanou užitečné, když se změní okolní pracovní tok zpracování dat.
Výzkumníci budou také muset určit, zda se lepší učení reprezentace promítne do užitečných biologických zjištění. Zdroj poukazuje na dřívější analýzu více než 14 000 pacientů s rakovinou od GigaTIME a více než 1 200 statisticky významných souvislostí mezi stavy imunitních buněk a klinickými biomarkery, ale neukazuje, že Flash modely nezávisle reprodukují tato sdružení nebo generují ověřené objevy. Statistické asociace rovněž samy o sobě neprokazují kauzalitu nebo klinický přínos. Relevantní otázkou je, zda novější modely podporují zjištění, která zůstávají smysluplná po nezávislé analýze a dodatečné validaci. Efektivita může usnadnit opakování těchto vyšetřování, ale neřeší důkazní otázky související se zjištěními.
Nejzávažnější neznámou je následná klinická výkonnost. Zdroj neposkytuje žádnou prospektivní klinickou studii, data o nasazení, analýzu přesnosti diagnostiky, důkazy o výsledcích léčby nebo hodnocení škod podskupin pro modely Flash. Než bude možné zvážit klinické použití, zdroj uvádí, že by bylo zapotřebí další multiinstitucionální a prospektivní ověření. Do té doby je nejjasněji podporovaný dopad výpočetní: zlevnění některých pracovních postupů pro výzkum patologie ve velkém měřítku a jejich opakovatelnost. Jakýkoli posun od výzkumných nástrojů k péči o pacienty by vyžadoval důkazy nad rámec zde popsaných srovnání účinnosti a srovnávacích standardů. Rozlišení mezi vydáním z praktického výzkumu a ověřeným klinickým systémem proto zůstává zásadní pro interpretaci oznámení.