Tillbaka till Nyheter
InnovationAI Understanding genomgång

TrustDABench finner att LLM:er ofta producerar strukturerade dataanalyser som inte stöds

Ett nytt riktmärke rapporterar att åtta stora språkmodeller ofta misslyckas med att upptäcka motstridiga bevis eller bevara korrekta analyser när kalkylblad och tabeller ändras.

5 min readRead the primary source
Primary-source image accompanying TrustDABench finds LLMs often produce unsupported structured-data analyses
Primärt källdokumentKälla inspelad
Förläggare
arxiv.org
Källlänk
arxiv.orghttps://arxiv.org/abs/2608.24145
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Stor språkmodell (LLM)
En språkmodell tränad på massiva textkorpus för att generera och analysera text.
Robusthet
En modells förmåga att bibehålla prestanda under buller, skift eller motstridiga ingångar.
Referenspunkt
Ett standardiserat test eller datauppsättning som används för att mäta och jämföra modellprestanda.
Testa dig självChatGPT & LLMs Quiz

Vad hände

En arXiv artikel introducerar TrustDABench, ett riktmärke för att testa om stora språkmodeller på ett tillförlitligt sätt kan analysera strukturerad data som kalkylblad och CSV-filer. Författarna skapade 2 340 mänskligt verifierade störda instanser från 19 typer av förändringar och utvärderade åtta LLM. Tidningen rapporterar att modellerna ofta gav rimliga men ostödda svar, missade motstridiga bevis och ändrade sina slutsatser när tabellstrukturen eller korstabellsrelationer ändrades.

Tidningens centrala påstående är att korrekt utseende strukturerad dataanalys kräver mer än att utföra en sekvens av operationer. Den definierar tillförlitlighet kring en giltig väg från en användares fråga till relevant databevis. Den inramningen leder till två test: om en LLM vägrar att svara eller ber om förtydligande när ingen giltig bevisväg finns, och om den bevarar den korrekta analysen när samma bevis uttrycks i en annan tabellform. Källan presenterar dessa tester som riktmärkets mått på tillförlitlighet och robusthet.

TrustDABench byggdes genom att börja med en evidensvägvy och använda 19 störningsoperatörer. Författarna säger att dessa operatörer instansierades genom ett Agentic-LLM-baserat generationsramverk, vilket producerade 2 340 fall som människor verifierade. Sammanfattningen listar inte alla 19 operatörer eller förklarar verifieringsprotokollet i detalj. Det fastställer att riktmärket utformades för att införa kontrollerade ändringar av strukturerade datauppgifter snarare än att bara samla in vanliga frågor och svar. Författarna utvärderade åtta representativa LLM:er, men sammanfattningen identifierar inte alla åtta system eller beskriver deras uppmaningar, verktygsåtkomst eller exekveringsmiljöer.

Rubrikfynden är svaga resultat på båda dimensionerna. Det bästa rapporterade tillförlitlighetsresultatet var en genomsnittlig MRS på 24,21 %, uppnådd av GPT-5.5. Det bästa rapporterade robusthetsresultatet var en genomsnittlig ASR på 9,10 %, uppnådd av Claude-Sonnet-5. Källan definierar inte akronymerna i abstraktet, så deras exakta beräkning och riktning bör bekräftas i hela artikeln innan siffrorna jämförs med andra riktmärken. Författarna karakteriserar misslyckandena som systematiska: modeller upptäcker sällan motstridiga bevis, fortsätter ofta genom körbara men ostödda analysvägar och förblir känsliga för förändringar som involverar observationsgränser eller korstabellsrelationer.

Källinformation: arxiv.org ↗

Varför det spelar roll

LLM:er används alltmer för att tolka affärsdata, vetenskapliga och administrativa data, där ett flytande svar kan dölja en ogiltig analytisk väg. TrustDABench fokuserar på om en modell vet när bevis är otillräckliga och om den når samma slutsats när likvärdig information representeras på olika sätt. De rapporterade resultaten tyder på att godkända konventionella dataanalysuppgifter kanske inte visar tillförlitliga resonemang över tabeller.

Den praktiska frågan är gapet mellan ett svar som kan genereras och ett svar som stöds av data. En modell kanske kan följa en sekvens av kalkylblads- eller tabelloperationer samtidigt som den startar från fel rader, ignorerar en motsägelse eller korsar en relation som bevisen inte motiverar. I dessa fall garanterar inte ett framgångsrikt utförande en giltig slutsats. TrustDABench är konsekvent eftersom det riktar sig till den distinktionen direkt snarare än att behandla något läsbart eller numeriskt formaterat svar som bevis på tillförlitlighet.

Detta spelar roll varhelst människor använder LLM:er för att sammanfatta eller analysera strukturerad information. Källan namnger specifikt kalkylblad, CSV-filer och annan strukturerad data, men den dokumenterar inte implementeringar i vissa branscher eller rapporterar verkliga skador. Riktmärkets rapporterade svagheter identifierar ändå ett praktiskt granskningsproblem: användare kan behöva kontrollera inte bara det slutliga numret eller förklaringen, utan också vilka poster, tabellgränser och relationer som modellen använde. Uppsatsens resultat stöder denna försiktighet som en forskningsslutsats, inte som en oberoende verifierad mätning av varje utplacerat system.

Resultaten utmanar också enkla modellantaganden. GPT-5.5 uppnådde den starkaste rapporterade tillförlitlighetspoängen, medan Claude-Sonnet-5 uppnådde den starkaste rapporterade robusthetspoängen; abstraktet säger inte att något av systemen var bäst på varje uppgift eller att måtten mäter samma beteende. En modell kan därför framstå som starkare på en dimension samtidigt som den förblir sårbar på en annan. Den bredare innebörden, enligt artikeln, är att tillförlitlig analys av strukturerad data kräver både bevis-gränsigenkänning och representations-invariant resonemang, inte bara större förmåga på standarduppgifter.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Vad du ska titta på härnäst

Dokumentet pekar på två prioriteringar: bättre erkännande av bevisgränser och resonemang som förblir stabila över olika tabellrepresentationer. Källan säger att kod och data är tillgängliga, men det fastställer inte om riktmärket återspeglar verkliga datauppsättningar, hur de åtta modellerna jämförs mellan enskilda uppgifter eller om de rapporterade svagheterna kvarstår efter riktade förbättringar. Uppföljningsarbete bör testa externa datamängder, operativa arbetsflöden och modellbeteende efter begränsning.

Det första du bör titta på är om riktmärkets kod och data möjliggör oberoende reproduktion. Källan säger att "Code&Data" är tillgängliga, men den medföljande texten inkluderar inte arkivlänken, benchmarklicensen, uppgiftsformaten eller poängdefinitionerna. Dessa detaljer kommer att avgöra hur lätt forskare kan inspektera störningarna, verifiera de mänskliga kontrollerna och förstå vad MRS- och ASR-värdena mäter. Tills den informationen har undersökts bör de rapporterade procentsatserna behandlas som påståenden från detta enda förtryck snarare än fastställda prestandauppskattningar.

En andra fråga är extern validitet. TrustDABench innehåller mänskligt verifierade störda instanser, men sammanfattningen säger inte hur mycket dessa instanser liknar röriga organisatoriska kalkylblad, utvecklande datapipelines eller analyser utförda med externa verktyg. Den rapporterar inte heller om resultaten skiljer sig åt efter datastorlek, domän, oklarhetsnivå eller typ av tabellrelation. Uppföljningsutvärderingar av oberoende datauppsättningar och realistiska arbetsflöden skulle hjälpa till att fastställa om de rapporterade felmönstren är specifika för riktmärket eller vanliga i praktisk användning.

Slutligen bör forskare och driftsättare testa begränsningar i stället för att bara lägga till fler riktmärken. Uppsatsen identifierar förtydligande, vägran, konfliktdetektering och stabilitet över tabellformer som viktiga beteenden, men källan rapporterar inte en intervention som förbättrar dem. Användbara nästa steg skulle inkludera utvärdering av explicit spårning av bevis, strukturerade mellankontroller, uppmaningar om motsägelse och mänsklig granskning mot samma störningar. Källan lämnar också öppet hur modeller beter sig när data verkligen inte har något svar, när flera tolkningar är rimliga eller när en användare pressar systemet att fortsätta trots att stöd saknas.

Relaterade guider och frågesporter

ChatGPT och LLM:erAI-modeller förklarasAI utbildningAI-etikTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?