Tilbake til Nyheter
InnovasjonAI Understanding orientering

Prospektiv studie finner at LLM-nøyaktigheten faller kraftig på tvetydige kliniske registerspørsmål

En prospektiv studie på flere steder rapporterer at en stor språkmodell samsvarte med 87 % av menneskelige konsensussvar når man henter informasjon fra ubehandlede medisinske journaler, men nøyaktigheten falt til 62 % på spørsmål som krever hendelsestiming og større klinisk resonnement.

5 min readRead the primary source
Source-page capture accompanying Prospective study finds LLM accuracy falls sharply on ambiguous clinical registry questions
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.20373
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Grunnsannhet
Pålitelige referanseetiketter som brukes til å trene eller evaluere modellutdata.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Forskere evaluerte en stor språkmodell på abstraksjon i klinisk register ved å bruke ubehandlede elektroniske journaldata fra to American College of Cardiology National Cardiovascular Data Registry-innstillinger. Studien organiserte registerspørsmål i seks kategorier basert på tvetydighet og det kliniske resonnementet som trengs for å besvare dem.

Artikkelen, revidert på arXiv 25. august, rapporterer en pilot- og en valideringsstudie som involverer spørsmål om kliniske register fra American College of Cardiologys National Cardiovascular Data Registry. I piloten ved et akademisk medisinsk senter identifiserte modellen kandidatdatakilder for hvert registerspørsmål. Erfarne abstraktører brukte deretter disse resultatene til å definere spørsmålsspesifikke dokumentsett. I valideringsstudien ved et annet senter, ved bruk av et andre ACC NCDR-register, svarte modellen på spørsmål fra disse settene. Dette designet fokuserte evalueringen på å trekke ut og tolke informasjon fra eksisterende medisinsk journalmateriale i stedet for på en forenklet, forhåndsvalgt datatabell.

Før gjennomgang av modellutdata, etablerte to abstraktorer uavhengig grunnsannheten og tildelte hvert spørsmål til en av seks kategorier: Medisinering/hendelsesflagg, binær klinisk tilstedeværelse, Administrativ, kvantitativ laboratorium/fysiologisk, klinisk tolkning og hendelsestiming. Kategoriene ble sortert etter tvetydigheten og den kliniske begrunnelsen som kreves for å løse hvert spørsmål. Oppgaven rapporterer 9 430 abstraktorsvar som er forenet til 4 715 konsensussvar, inkludert 501 pilotsvar og 4 214 valideringssvar. I piloten varierte gjennomsnittlig antall kandidatdatakilder fra 14,6 for demografi til 89,2 for historie og risikofaktorer, med betydelig variasjon reflektert i de rapporterte standardavvikene.

I validering var menneskelig interrater-avtale omtrent 98 %, ifølge studien. LLMs svar samsvarte nøyaktig med konsensus i 87 % av tilfellene, ble klassifisert som delvise treff i 2 %, og samsvarte ikke i 9 %. Oppgaven rapporterer en gjennomsnittlig nøyaktighet på spørsmålsnivå på 91,5 %, med et standardavvik på 13,4 %, over 157 spørsmål som hver hadde minst 20 svar. Nøyaktigheten varierte etter tvetydighetskategori, og gikk ned fra 96 ​​% for spørsmål om medisin/hendelseflagg til 62 % for spørsmål om hendelsestid. Kilden identifiserer studien som et forhåndstrykk og navngir ikke modellen som er vurdert i abstraktet.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Resultatene tyder på at gjennomsnittlig nøyaktighet kan skjule viktige svakheter i helsevesenets AI. Modellen presterte best på relativt direkte medisinering og hendelsesflagg-spørsmål og dårligst når den måtte tolke klinisk kontekst eller bestemme når en hendelse inntraff.

Det sentrale funnet er ikke bare at en LLM gjorde feil. Det er at ytelsen falt på en strukturert måte ettersom spørsmålene ble mer tvetydige og krevde mer klinisk resonnement. Et enkelt samlet nøyaktighetstall på 91,5 % kan derfor gi et ufullstendig bilde av operasjonell risiko. En registerarbeidsflyt som inneholder mange enkle felt kan virke pålitelig mens de fortsatt gir dårlige resultater på et mindre sett med spørsmål som krever rekonstruering av kontekst, tolking av klinisk bevis eller plassering av en hendelse i tide.

Kliniske registre støtter forskning, kvalitetsmåling, benchmarking og andre former for helserapportering. Abstraksjonsfeil kan påvirke kvaliteten på disse nedstrømspostene selv når systemet ikke foretar en diagnose eller behandlingsanbefaling. Det rapporterte gapet mellom omtrent 98 % menneskelig enighet og modellens lavere eksakte samsvarsrate indikerer at menneskelig vurdering fortsatt er viktig for denne oppgaven, spesielt der svaret avhenger av flere dokumenter eller av å tolke hendelsesforløpet.

Studien tilbyr også en praktisk måte å evaluere helsevesenets språkmodeller: del spørsmål i henhold til typen tvetydighet de inneholder, i stedet for å behandle alle utvinningsoppgaver som likeverdige. Denne tilnærmingen kan hjelpe organisasjoner med å identifisere hvilke felt som er egnet for bistand og som krever nærmere vurdering. Kilden viser ikke at modellen forårsaket pasientskade, forbedret registerdrift, reduserte kostnader eller ble utplassert i rutinemessig behandling. Disse resultatene forblir uetablerte.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Studien fastslår ikke om funnene generaliserer til andre modeller, sykehus, medisinske spesialiteter, registre eller klinisk beslutningstaking. Videre arbeid bør teste bredere innstillinger, sammenligne modellversjoner, undersøke konsekvensene av delvise feil, og vurdere om menneskelig vurdering på en pålitelig måte kan fange opp de vanskeligste feilene.

En nøkkel ukjent er hvor bredt resultatene gjelder. Kilden beskriver en pilot ved ett akademisk medisinsk senter og validering ved et annet senter ved å bruke et annet ACC NCDR-register, men den gir ikke bevis i abstrakt om samfunnssykehus, andre spesialiteter, forskjellige journalsystemer eller andre registerdesign. Den evaluerte modellen er heller ikke identifisert i abstraktet. Sammenligninger på tvers av modeller og modellversjoner vil være nødvendig før man trekker konklusjoner om LLM-ytelse generelt.

Fremtidige evalueringer bør rapportere mer enn aggregert nøyaktig samsvar. Viktige spørsmål inkluderer om delvise svar er klinisk brukbare, hvilke typer feil som er vanligst, hvor ofte feil involverer datoer eller motstridende registreringer, og om anmeldere kan oppdage modellfeil konsekvent. Studiens resultater på kategorinivå gjør Event Timing til et spesielt viktig område for oppfølging, men kilden spesifiserer ikke de individuelle spørsmålene, feileksemplene eller alvorlighetsgraden av de uriktige svarene.

Det er også ukjent om modellens kandidat-kildevalg i piloten påvirket den senere valideringsarbeidsflyten eller om lignende ytelse ville oppstå når dokumentsett ikke er kurert av erfarne abstraktører. Ytterligere studier kan teste fullstendig ubehandlede poster, ulike nivåer av menneskelig assistanse og potensiell overvåking i reelle registeroperasjoner. Inntil slike bevis er tilgjengelige, støtter funnene målrettet menneskelig tilsyn for tvetydige abstraksjonsoppgaver i stedet for en konklusjon om at LLM-er er klare til å erstatte kliniske abstraktorer. Kilden lar derfor være åpen hvordan den samme tilnærmingen vil fungere når dokumentvalg ikke er styrt av erfarne abstraktorer, når poster inneholder ulike nivåer av struktur, eller når anmeldere går inn i prosessen på forskjellige punkter.

Relaterte guider og quizer

AI-modeller forklartKI-etikkAI treningChatGPT og LLM-erTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?