Hva skjedde
Forskere evaluerte en stor språkmodell på abstraksjon i klinisk register ved å bruke ubehandlede elektroniske journaldata fra to American College of Cardiology National Cardiovascular Data Registry-innstillinger. Studien organiserte registerspørsmål i seks kategorier basert på tvetydighet og det kliniske resonnementet som trengs for å besvare dem.
Artikkelen, revidert på arXiv 25. august, rapporterer en pilot- og en valideringsstudie som involverer spørsmål om kliniske register fra American College of Cardiologys National Cardiovascular Data Registry. I piloten ved et akademisk medisinsk senter identifiserte modellen kandidatdatakilder for hvert registerspørsmål. Erfarne abstraktører brukte deretter disse resultatene til å definere spørsmålsspesifikke dokumentsett. I valideringsstudien ved et annet senter, ved bruk av et andre ACC NCDR-register, svarte modellen på spørsmål fra disse settene. Dette designet fokuserte evalueringen på å trekke ut og tolke informasjon fra eksisterende medisinsk journalmateriale i stedet for på en forenklet, forhåndsvalgt datatabell.
Før gjennomgang av modellutdata, etablerte to abstraktorer uavhengig grunnsannheten og tildelte hvert spørsmål til en av seks kategorier: Medisinering/hendelsesflagg, binær klinisk tilstedeværelse, Administrativ, kvantitativ laboratorium/fysiologisk, klinisk tolkning og hendelsestiming. Kategoriene ble sortert etter tvetydigheten og den kliniske begrunnelsen som kreves for å løse hvert spørsmål. Oppgaven rapporterer 9 430 abstraktorsvar som er forenet til 4 715 konsensussvar, inkludert 501 pilotsvar og 4 214 valideringssvar. I piloten varierte gjennomsnittlig antall kandidatdatakilder fra 14,6 for demografi til 89,2 for historie og risikofaktorer, med betydelig variasjon reflektert i de rapporterte standardavvikene.
I validering var menneskelig interrater-avtale omtrent 98 %, ifølge studien. LLMs svar samsvarte nøyaktig med konsensus i 87 % av tilfellene, ble klassifisert som delvise treff i 2 %, og samsvarte ikke i 9 %. Oppgaven rapporterer en gjennomsnittlig nøyaktighet på spørsmålsnivå på 91,5 %, med et standardavvik på 13,4 %, over 157 spørsmål som hver hadde minst 20 svar. Nøyaktigheten varierte etter tvetydighetskategori, og gikk ned fra 96 % for spørsmål om medisin/hendelseflagg til 62 % for spørsmål om hendelsestid. Kilden identifiserer studien som et forhåndstrykk og navngir ikke modellen som er vurdert i abstraktet.
Hvorfor det betyr noe
Resultatene tyder på at gjennomsnittlig nøyaktighet kan skjule viktige svakheter i helsevesenets AI. Modellen presterte best på relativt direkte medisinering og hendelsesflagg-spørsmål og dårligst når den måtte tolke klinisk kontekst eller bestemme når en hendelse inntraff.
Det sentrale funnet er ikke bare at en LLM gjorde feil. Det er at ytelsen falt på en strukturert måte ettersom spørsmålene ble mer tvetydige og krevde mer klinisk resonnement. Et enkelt samlet nøyaktighetstall på 91,5 % kan derfor gi et ufullstendig bilde av operasjonell risiko. En registerarbeidsflyt som inneholder mange enkle felt kan virke pålitelig mens de fortsatt gir dårlige resultater på et mindre sett med spørsmål som krever rekonstruering av kontekst, tolking av klinisk bevis eller plassering av en hendelse i tide.
Kliniske registre støtter forskning, kvalitetsmåling, benchmarking og andre former for helserapportering. Abstraksjonsfeil kan påvirke kvaliteten på disse nedstrømspostene selv når systemet ikke foretar en diagnose eller behandlingsanbefaling. Det rapporterte gapet mellom omtrent 98 % menneskelig enighet og modellens lavere eksakte samsvarsrate indikerer at menneskelig vurdering fortsatt er viktig for denne oppgaven, spesielt der svaret avhenger av flere dokumenter eller av å tolke hendelsesforløpet.
Studien tilbyr også en praktisk måte å evaluere helsevesenets språkmodeller: del spørsmål i henhold til typen tvetydighet de inneholder, i stedet for å behandle alle utvinningsoppgaver som likeverdige. Denne tilnærmingen kan hjelpe organisasjoner med å identifisere hvilke felt som er egnet for bistand og som krever nærmere vurdering. Kilden viser ikke at modellen forårsaket pasientskade, forbedret registerdrift, reduserte kostnader eller ble utplassert i rutinemessig behandling. Disse resultatene forblir uetablerte.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
Which component of an AI application is the machine-learning model itself?
Hva du skal se neste
Studien fastslår ikke om funnene generaliserer til andre modeller, sykehus, medisinske spesialiteter, registre eller klinisk beslutningstaking. Videre arbeid bør teste bredere innstillinger, sammenligne modellversjoner, undersøke konsekvensene av delvise feil, og vurdere om menneskelig vurdering på en pålitelig måte kan fange opp de vanskeligste feilene.
En nøkkel ukjent er hvor bredt resultatene gjelder. Kilden beskriver en pilot ved ett akademisk medisinsk senter og validering ved et annet senter ved å bruke et annet ACC NCDR-register, men den gir ikke bevis i abstrakt om samfunnssykehus, andre spesialiteter, forskjellige journalsystemer eller andre registerdesign. Den evaluerte modellen er heller ikke identifisert i abstraktet. Sammenligninger på tvers av modeller og modellversjoner vil være nødvendig før man trekker konklusjoner om LLM-ytelse generelt.
Fremtidige evalueringer bør rapportere mer enn aggregert nøyaktig samsvar. Viktige spørsmål inkluderer om delvise svar er klinisk brukbare, hvilke typer feil som er vanligst, hvor ofte feil involverer datoer eller motstridende registreringer, og om anmeldere kan oppdage modellfeil konsekvent. Studiens resultater på kategorinivå gjør Event Timing til et spesielt viktig område for oppfølging, men kilden spesifiserer ikke de individuelle spørsmålene, feileksemplene eller alvorlighetsgraden av de uriktige svarene.
Det er også ukjent om modellens kandidat-kildevalg i piloten påvirket den senere valideringsarbeidsflyten eller om lignende ytelse ville oppstå når dokumentsett ikke er kurert av erfarne abstraktører. Ytterligere studier kan teste fullstendig ubehandlede poster, ulike nivåer av menneskelig assistanse og potensiell overvåking i reelle registeroperasjoner. Inntil slike bevis er tilgjengelige, støtter funnene målrettet menneskelig tilsyn for tvetydige abstraksjonsoppgaver i stedet for en konklusjon om at LLM-er er klare til å erstatte kliniske abstraktorer. Kilden lar derfor være åpen hvordan den samme tilnærmingen vil fungere når dokumentvalg ikke er styrt av erfarne abstraktorer, når poster inneholder ulike nivåer av struktur, eller når anmeldere går inn i prosessen på forskjellige punkter.