Terug naar Nieuws
InnovatieAI Understanding-briefing

Preprint stelt geloofstaalmodellen voor om onzekerheid bloot te leggen en hallucinaties op te sporen

Een nieuwe preprint stelt een op ensembles gebaseerde aanpak voor die meet hoe sterk taalmodellen zich inzetten voor antwoorden, waarbij competitieve kalibratie- en hallucinatiedetectieresultaten worden gerapporteerd over drie open modellen en vier vraagbeantwoordende datasets.

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2608.23244
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

LoRA (aanpassing op lage rang)
Een parameter-efficiënte fijnafstemmingsmethode die adaptermatrices van lage rang toevoegt.
Geheugen (agentgeheugen)
Opgeslagen context die een AI-agent in stappen of sessies gebruikt om de continuïteit te verbeteren.
Hallucinatie
Wanneer een model vloeiende maar valse of niet-ondersteunde informatie genereert.
Test jezelfChatGPT & LLM's Quiz

Wat is er gebeurd

Een preprint die op 24 augustus bij arXiv is ingediend, introduceert Credal Large Language Models, of CLLM's, die een ensemble van LoRA-adapters gebruiken om een ​​reeks plausibele voorspellingen weer te geven in plaats van een enkele waarschijnlijkheidsverdeling. De auteurs leiden commitmentscores op token- en semantisch niveau af en evalueren deze op het beantwoorden van vragen, kalibratie, selectieve voorspelling, detectie van hallucinaties en redeneren.

Het artikel beschrijft een beperking in de gebruikelijke manier waarop taalmodellen onzekerheid representeren: een standaardmodel produceert een enkele voorspellende verdeling, die volgens de auteurs onwetendheid kan verwarren met echte dubbelzinnigheid. Hun voorgestelde CLLM gebruikt in plaats daarvan een ensemble van LoRA-adapters om te vormen wat de krant een credal-set noemt. In praktische termen is de methode bedoeld om onenigheid of verspreiding over plausibele voorspellende verdelingen te behouden, in plaats van alle onzekerheid in één softmax-uitvoer te comprimeren. De bron beweert niet dat deze representatie een model correct maakt; het beweert dat het de mate van betrokkenheid van het model informatiever kan maken.

De auteurs introduceren twee gerelateerde maatregelen. Credal Token Commitment, of CTC, opereert in tokenruimte en combineert ondergrensondersteuning, credalbreedte en intersectie-entropie. De samenvatting zegt dat CTC kan worden berekend zonder extra generatie, wat potentieel belangrijk is voor systemen waarbij herhaalde bemonstering latentie of kosten zou veroorzaken. Semantic Commitment Consistency, of SCC, breidt het idee uit naar de semantische ruimte met behulp van bemonsterde voltooiingen. Het artikel definieert ook SCC-Gap om een ​​mismatch te meten tussen ondersteuning op tokenniveau en ondersteuning op semantisch niveau. Deze scores worden gepresenteerd als hulpmiddelen om te identificeren wanneer het oppervlakkige vertrouwen van een model mogelijk niet overeenkomt met de reeks betekenissen die door de mogelijke antwoorden wordt uitgedrukt.

De evaluatie omvat Gemma-2-9B, Llama-3.1-8B en Qwen2.5-7B op OpenBookQA, CoQA, TriviaQA en ARC-Challenge. Volgens de samenvatting is CLLM de best presterende methode op het gebied van de nauwkeurigheid van het beantwoorden van vragen, terwijl de verwachte concurrerende kalibratiefout behouden blijft. De auteurs melden ook dat CTC in de meeste omgevingen binnen 1,5 procentpunt van het beste hallucinatiedetectiegebied onder de werkingskarakteristiek van de ontvanger ligt, zonder extra generatie. Bij selectieve voorspelling bij een dekking van 80% rapporteert de samenvatting een nauwkeurigheid van 99,0% op OpenBookQA voor CLLM met SCC. Het begint met het vertrouwen van Csem een ​​ARC-Challenge-resultaat voor CLLM te vermelden, maar wordt ingekort voordat het resultaat wordt gegeven, zodat die claim niet kan worden beoordeeld op basis van de geleverde bron.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

Taalmodellen kunnen vloeiende antwoorden opleveren met ongegrond vertrouwen. Als de gerapporteerde resultaten standhouden, kan het meten van de onzekerheid over meerdere plausibele voorspellende verdelingen systemen helpen antwoorden te identificeren die verificatie, onthouding of menselijke beoordeling behoeven, zonder dat in veel gevallen extra generatie nodig is.

De centrale praktische vraag is niet simpelweg of een taalmodel een vraag kan beantwoorden, maar of het kennis van onzekerheid kan onderscheiden. Een vloeiend maar onjuist antwoord kan gevaarlijker zijn dan een expliciete weigering wanneer gebruikers vertrouwen als bewijs beschouwen. De in het artikel voorgestelde geloofsrepresentatie lost dat probleem op door onenigheid tussen op adapters gebaseerde voorspellingen te behouden. Als de methode generaliseert, kan het ontwikkelaars een signaal aan de modelzijde bieden om te beslissen wanneer ze direct moeten antwoorden, om verificatie moeten vragen, een vraag naar een ander systeem moeten doorsturen of een persoon erbij moeten betrekken.

Het gerapporteerde selectieve voorspellingsresultaat is vooral relevant voor de implementatie, omdat selectieve systemen niet elke vraag hoeven te beantwoorden. Een systeem dat een hoge nauwkeurigheid kan handhaven en tegelijkertijd alleen de gevallen bestrijkt die het voldoende ondersteund acht, kan nuttiger zijn in omgevingen waar fouten aanzienlijke kosten met zich meebrengen. De gerapporteerde nauwkeurigheid van 99,0% bij een dekking van 80% op OpenBookQA is bemoedigend binnen die dataset en configuratie, maar moet worden opgevat als een papieren resultaat en niet als bewijs dat een ingezet systeem dezelfde prestaties zou leveren. De samenvatting specificeert niet het aantal voorbeelden, de vergelijkingsmethoden of de operationele definitie van dekking.

De claim dat er geen extra generatie is voor CTC kan ook van belang zijn voor het ontwerp van gevolgtrekkingen. Veel onzekerheidstechnieken zijn afhankelijk van het produceren van meerdere voltooiingen, wat de berekeningen en vertragingen kan vergroten. De bron zegt dat CTC verschillende onzekerheidsgerelateerde grootheden combineert zonder extra opwekking, terwijl SCC expliciet gebruikmaakt van bemonsterde voltooiingen. Dat onderscheid geeft het artikel een concrete technische invalshoek: de ene score kan goedkoper zijn om toe te passen, terwijl de andere semantische meningsverschillen directer kan weergeven. De samenvatting kwantificeert de kosten van het LoRA-ensemble zelf echter niet, dus de totale afweging blijft onbekend.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Wat je nu moet bekijken

Het resultaat is momenteel een door de auteur gerapporteerde preprint-evaluatie, en geen onafhankelijk vastgestelde prestatiebevinding. Belangrijke details blijven niet beschikbaar in het meegeleverde abstract, inclusief het volledige ARC-Challenge-resultaat, exacte basislijnen, computationele overhead en hoe goed de methode overgaat buiten de geteste modellen en datasets.

De eerste vraag is of de gerapporteerde winsten onafhankelijke replicatie overleven. De bron is een arXiv-voordruk, ingediend op 24 augustus 2026, en het aangeleverde materiaal bevat alleen de samenvatting. De resultaten zijn daarom beweringen van de auteurs, en geen onafhankelijk geverifieerde feiten. Bij vervolgonderzoek moeten de volledige tabellen, basislijnen, betrouwbaarheidsdefinities, statistische variatie en de vraag of de gerapporteerde voordelen consistent zijn in alle vier de datasets en alle drie de modelfamilies worden onderzocht.

De ARC-Challenge-zin in de samenvatting is onvolledig: er staat dat CLLM met Csem-vertrouwen een resultaat behaalt, maar niet de waarde biedt. Die ontbrekende informatie beperkt de vergelijking met de volledige OpenBookQA-claim en verhindert een volledige beoordeling van de redeneerprestaties van de methode. Het artikel rapporteert ook een resultaat van de hallucinatiedetectie in termen van binnen 1,5 procentpunten van de beste AUROC in de meeste omgevingen, maar de aangeleverde bron identificeert niet de absolute scores, de beste concurrerende methoden of de uitzonderingen.

Implementatievragen zijn net zo belangrijk. Het artikel maakt gebruik van een ensemble van LoRA-adapters, en de samenvatting vermeldt niet hoeveel adapters er nodig zijn, hoe ze worden getraind, of hoeveel geheugen en inferentietijd ze toevoegen. Het evalueert ook slechts drie benoemde taalmodellen en vier vraagbeantwoordende datasets. Het blijft onbekend of de scores werken voor langere gesprekken, generatie met een open einde, meertalige invoer, domeinspecifieke taken of modellen buiten het geteste bereik van grootte en architectuur. Totdat deze vragen zijn beantwoord, kan CLLM het beste worden behandeld als een veelbelovende onderzoeksmethode voor het meten van onzekerheid in plaats van als een gevalideerde waarborg voor gebruik met hoge inzet.

Gerelateerde gidsen en quizzen

ChatGPT & LLM'sAI-modellen uitgelegdAI-ethiekAI-trainingTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?