Înapoi la Știri
InovațieAI Understanding briefing

TrustDABench constată că LLM-urile produc adesea analize de date structurate neacceptate

Un nou punct de referință raportează că opt modele mari de limbaj nu reușesc frecvent să detecteze dovezi contradictorii sau să păstreze analizele corecte atunci când foile de calcul și tabelele sunt modificate.

5 min readRead the primary source
Primary-source image accompanying TrustDABench finds LLMs often produce unsupported structured-data analyses
Document sursă primarăSursa înregistrată
Editor
arxiv.org
Link sursă
arxiv.orghttps://arxiv.org/abs/2608.24145
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Model de limbă mare (LLM)
Un model de limbaj instruit pe corpuri de text masive pentru a genera și analiza text.
Robustitate
Capacitatea unui model de a menține performanța în condiții de zgomot, schimbări sau intrări adverse.
Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Testează-teTest ChatGPT și LLMs

Ce sa întâmplat

O lucrare arXiv prezintă TrustDABench, un etalon pentru testarea dacă modelele mari de limbă pot analiza în mod fiabil datele structurate, cum ar fi foile de calcul și fișierele CSV. Autorii au creat 2.340 de instanțe perturbate verificate de om din 19 tipuri de modificări și au evaluat opt ​​LLM. Lucrarea raportează că modelele au produs adesea răspunsuri plauzibile, dar nesusținute, au ratat dovezi contradictorii și și-au schimbat concluziile atunci când structura tabelului sau relațiile încrucișate au fost modificate.

Afirmația centrală a lucrării este că analiza corectă a datelor structurate necesită mai mult decât executarea unei secvențe de operații. Definește încrederea în jurul unei căi valide de la întrebarea unui utilizator la dovezile relevante ale datelor. Această încadrare conduce la două teste: dacă un LLM refuză să răspundă sau solicită clarificări atunci când nu există o cale de dovezi valide și dacă păstrează analiza corectă atunci când aceleași dovezi sunt exprimate într-o formă diferită de tabel. Sursa prezintă aceste teste ca fiind măsurile de referință de fiabilitate și robustețe.

TrustDABench a fost construit pornind cu o vizualizare a căii dovezi și aplicând 19 operatori de perturbare. Autorii spun că acești operatori au fost instanțiați printr-un cadru de generare bazat pe Agentic-LLM, producând 2.340 de instanțe pe care oamenii le-au verificat. Rezumatul nu listează toți cei 19 operatori și nu explică în detaliu protocolul de verificare. Acesta stabilește că -ul a fost conceput pentru a introduce modificări controlate în sarcinile de date structurate, mai degrabă decât pentru a colecta pur și simplu întrebări și răspunsuri obișnuite. Autorii au evaluat opt ​​LLM-uri reprezentative, dar rezumatul nu identifică toate cele opt sisteme și nu descrie solicitările acestora, accesul la instrumente sau mediile de execuție.

Concluziile principale sunt performanțe slabe pe ambele dimensiuni. Cel mai bun rezultat de fiabilitate raportat a fost un MRS mediu de 24,21%, realizat de GPT-5.5. Cel mai bun rezultat de robustețe raportat a fost un ASR mediu de 9,10%, realizat de Claude-Sonnet-5. Sursa nu definește acronimele în rezumat, așa că calculul și direcția exactă a acestora ar trebui confirmate în lucrarea completă înainte de a compara numerele cu alte repere. Autorii caracterizează eșecurile ca fiind sistematice: modelele detectează rareori dovezi conflictuale, continuă adesea prin căi de analiză executabile, dar nesuportate și rămân sensibile la schimbările care implică limite de observație sau relații încrucișate.

Detalii sursa: arxiv.org ↗

De ce contează

LLM-urile sunt din ce în ce mai folosite pentru a interpreta date comerciale, științifice și administrative, unde un răspuns fluent poate ascunde o cale analitică nevalidă. TrustDABench se concentrează pe dacă un model știe când dovezile sunt insuficiente și dacă ajunge la aceeași concluzie atunci când informațiile echivalente sunt reprezentate diferit. Rezultatele raportate sugerează că trecerea sarcinilor convenționale de analiză a datelor poate să nu demonstreze un raționament de încredere peste tabele.

Problema practică este decalajul dintre un răspuns care poate fi generat și un răspuns susținut de date. Un model poate fi capabil să urmeze o secvență de operații cu foi de calcul sau tabel în timp ce pornește de la rândurile greșite, ignorând o contradicție sau traversând o relație pe care dovezile nu o justifică. În aceste cazuri, executarea cu succes nu garantează o concluzie validă. TrustDABench are consecințe, deoarece vizează acea distincție în mod direct, mai degrabă decât să trateze orice răspuns lizibil sau formatat numeric ca dovadă de fiabilitate.

Acest lucru contează oriunde oamenii folosesc LLM-uri pentru a rezuma sau analiza informații structurate. Sursa denumește în mod specific foi de calcul, fișiere CSV și alte date structurate, dar nu documentează implementările în anumite industrii și nu raportează daune din lumea reală. Punctele slabe raportate ale -ului identifică totuși o problemă practică de revizuire: utilizatorii ar putea fi nevoiți să verifice nu numai numărul sau explicația finală, ci și ce înregistrări, limitele tabelului și relațiile utilizate de modelul. Descoperirile lucrării susțin această precauție ca o concluzie a cercetării, nu ca o măsurare verificată independent a fiecărui sistem implementat.

Rezultatele provoacă, de asemenea, ipotezele simple de clasificare a modelelor. GPT-5.5 a obținut cel mai puternic scor de fiabilitate raportat, în timp ce Claude-Sonnet-5 a obținut cel mai puternic scor de robustețe raportat; rezumatul nu spune că niciunul dintre sisteme a fost cel mai bun pentru fiecare sarcină sau că metricile măsoară același comportament. Prin urmare, un model poate părea mai puternic pe o dimensiune, rămânând vulnerabil pe alta. Implicația mai largă, conform lucrării, este că o analiză fiabilă a datelor structurate necesită atât recunoașterea limitelor dovezilor, cât și raționamentul invariant de reprezentare, nu numai o capacitate mai mare în sarcinile standard.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Ce să urmărești în continuare

Lucrarea indică două priorități: o mai bună recunoaștere a limitelor dovezilor și raționamentul care rămâne stabil în diferite reprezentări de tabele. Sursa spune că codul și datele sunt disponibile, dar nu stabilește dacă -ul reflectă seturi de date din lumea reală, modul în care cele opt modele se compară între sarcini individuale sau dacă punctele slabe raportate persistă după îmbunătățirile vizate. Lucrările ulterioare ar trebui să testeze seturi de date externe, fluxurile de lucru operaționale și comportamentul modelului după atenuare.

Primul lucru de urmărit este dacă codul și datele -ului permit reproducerea independentă. Sursa spune că „Cod și date” sunt disponibile, dar textul furnizat nu include linkul de depozit, licența de referință, formatele sarcinilor sau definițiile de scor. Aceste detalii vor determina cât de ușor pot cercetatorii să inspecteze perturbațiile, să verifice verificările umane și să înțeleagă ce măsoară valorile MRS și ASR. Până când aceste informații sunt examinate, procentele raportate ar trebui tratate ca revendicări din această singură pretipărire, mai degrabă decât estimări de performanță stabilite.

O a doua întrebare este validitatea externă. TrustDABench conține instanțe perturbate verificate de oameni, dar rezumatul nu spune cât de mult seamănă acele instanțe cu foile de calcul organizaționale dezordonate, conductele de date în evoluție sau analizele efectuate cu instrumente externe. De asemenea, nu raportează dacă rezultatele diferă în funcție de dimensiunea datelor, domeniu, nivel de ambiguitate sau tip de relație de tabel. Evaluările ulterioare privind seturile de date independente și fluxurile de lucru realiste ar ajuta la stabilirea dacă modelele de eșec raportate sunt specifice pentru etalonul de referință sau comune în utilizare practică.

În cele din urmă, cercetătorii și implementatorii ar trebui să testeze atenuări, mai degrabă decât să adauge doar mai multe scoruri de referință. Lucrarea identifică clarificarea, refuzul, detectarea conflictelor și stabilitatea între formele de tabel ca fiind comportamente importante, dar sursa nu raportează o intervenție care să le îmbunătățească. Următorii pași utili ar include evaluarea urmăririi dovezilor explicite, verificări intermediare structurate, solicitări de contradicție și revizuire umană împotriva acelorași perturbări. Sursa lasă deschis, de asemenea, modul în care modelele se comportă atunci când datele cu adevărat nu au răspuns, când mai multe interpretări sunt plauzibile sau când un utilizator presează sistemul să continue, în ciuda lipsei suportului.

Ghiduri și chestionare conexe

ChatGPT și LLMModelele AI explicateAntrenament AIEtica IATestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?