Tillbaka till Nyheter
InnovationAI Understanding genomgång

Preprint föreslår språkmodeller för att avslöja osäkerhet och upptäcka hallucinationer

Ett nytt preprint föreslår ett ensemblebaserat tillvägagångssätt som mäter hur starkt språkmodeller förbinder sig att svara, och rapporterar konkurrenskraftiga kalibrerings- och hallucinationsdetekteringsresultat över tre öppna modeller och fyra frågesvarsdatauppsättningar.

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
Primärt källdokumentKälla inspelad
Förläggare
arxiv.org
Källlänk
arxiv.orghttps://arxiv.org/abs/2608.23244
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

LoRA (lågrankad anpassning)
En parametereffektiv finjusteringsmetod som lägger till lågrankade adaptermatriser.
Minne (agentminne)
Lagrat sammanhang som en AI-agent använder över steg eller sessioner för att förbättra kontinuiteten.
Hallucination
När en modell genererar flytande men falsk eller ostödd information.
Testa dig självChatGPT & LLMs Quiz

Vad hände

Ett förtryck som skickades till arXiv den 24 augusti introducerar Credal Large Language Models, eller CLLMs, som använder en ensemble av LoRA-adaptrar för att representera en rad rimliga förutsägelser istället för en enda sannolikhetsfördelning. Författarna härleder engagemangspoäng på tokennivå och semantisk nivå och utvärderar dem för besvarande av frågor, kalibrering, selektiv förutsägelse, hallucinationsdetektering och resonemang.

Uppsatsen beskriver en begränsning på det vanliga sättet som språkmodeller representerar osäkerhet: en standardmodell producerar en enda prediktiv fördelning, som författarna säger kan blanda okunnighet med äkta tvetydighet. Deras föreslagna CLLM använder istället en ensemble av LoRA-adaptrar för att bilda vad tidningen kallar en credal-set. I praktiska termer är metoden avsedd att bevara oenighet eller spridning bland rimliga prediktiva distributioner snarare än att komprimera all osäkerhet till en softmax-utgång. Källan hävdar inte att denna framställning gör en modell korrekt; den hävdar att den kan göra modellens grad av engagemang mer informativ.

Författarna introducerar två relaterade åtgärder. Credal Token Commitment, eller CTC, fungerar i token-utrymme och kombinerar stöd för nedre gränser, credal-bredd och entropi av korsning. Sammanfattningen säger att CTC kan beräknas utan ytterligare generering, vilket är potentiellt viktigt för system där upprepad sampling skulle lägga till latens eller kostnad. Semantic Commitment Consistency, eller SCC, utökar idén till semantiskt utrymme med hjälp av samplade kompletteringar. Papperet definierar också SCC-Gap för att mäta en oöverensstämmelse mellan stöd på tokennivå och stöd på semantisk nivå. Dessa poäng presenteras som verktyg för att identifiera när en modells förtroende på ytan kanske inte överensstämmer med de betydelser som uttrycks av dess möjliga svar.

Utvärderingen omfattar Gemma-2-9B, Llama-3.1-8B och Qwen2.5-7B på OpenBookQA, CoQA, TriviaQA och ARC-Challenge. Enligt sammanfattningen är CLLM den bäst presterande metoden när det gäller noggrannhet av frågor och svar samtidigt som konkurrenskraftigt förväntat kalibreringsfel bibehålls. Författarna rapporterar också att CTC kommer inom 1,5 procentenheter från det bästa hallucinationsdetekteringsområdet under mottagarens funktionskurva i de flesta inställningar, utan ytterligare generering. Vid selektiv förutsägelse med 80 % täckning rapporterar sammanfattningen 99,0 % noggrannhet på OpenBookQA för CLLM med SCC. Den börjar ange ett ARC-Challenge-resultat för CLLM med Csem-förtroende men trunkeras innan resultatet ges, så det påståendet kan inte bedömas från den angivna källan.

Källinformation: arxiv.org ↗

Varför det spelar roll

Språkmodeller kan ge flytande svar med obefogat självförtroende. Om de rapporterade resultaten håller i sig, kan mätning av osäkerhet över flera trovärdiga prediktiva distributioner hjälpa systemen att identifiera svar som behöver verifieras, avstå från eller mänsklig granskning utan att kräva ytterligare generering i många fall.

Den centrala praktiska frågan är inte bara om en språkmodell kan svara på en fråga, utan om den kan skilja kunskap från osäkerhet. Ett flytande men felaktigt svar kan vara farligare än ett uttryckligt avslag när användare behandlar förtroende som bevis. Tidningens föreslagna credal representation adresserar det problemet genom att behålla oenighet bland adapterbaserade förutsägelser. Om metoden generaliserar kan den ge utvecklare en signal på modellsidan för att bestämma när de ska svara direkt, begära verifiering, dirigera en fråga till ett annat system eller involvera en person.

Det rapporterade selektiva förutsägelseresultatet är särskilt relevant för driftsättning eftersom selektiva system inte behöver svara på alla frågor. Ett system som kan bibehålla hög noggrannhet samtidigt som det bara täcker de fall som det anser ha tillräckligt stöd kan vara mer användbart i inställningar där fel medför betydande kostnader. Den rapporterade 99,0 % noggrannheten vid 80 % täckning på OpenBookQA är uppmuntrande inom den datamängden och konfigurationen, men det bör förstås som ett pappersresultat snarare än som bevis på att ett utrullat system skulle uppnå samma prestanda. Sammanfattningen specificerar inte antalet exempel, jämförelsemetoderna eller den operativa definitionen av täckning.

Påståendet om ingen ytterligare generation för CTC kan också ha betydelse för slutledningsdesign. Många osäkerhetstekniker är beroende av att producera flera kompletteringar, vilket kan öka beräkningen och fördröjningen. Källan säger att CTC kombinerar flera osäkerhetsrelaterade kvantiteter utan ytterligare generering, medan SCC uttryckligen använder samplade kompletteringar. Den distinktionen ger uppsatsen en konkret teknisk vinkel: en poäng kan vara billigare att tillämpa, medan den andra kan fånga semantisk oenighet mer direkt. Sammanfattningen kvantifierar inte kostnaden för själva LoRA-ensemblen, så den totala avvägningen för servering är fortfarande okänd.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Vad du ska titta på härnäst

Resultatet är för närvarande en författarerapporterad preprint-utvärdering, inte ett oberoende fastställt resultat. Viktiga detaljer förblir otillgängliga i det medföljande sammandraget, inklusive det fullständiga ARC-Challenge-resultatet, exakta baslinjer, beräkningsoverhead och hur väl metoden överförs bortom de testade modellerna och datamängderna.

Den första frågan är om de rapporterade vinsterna överlever oberoende replikering. Källan är ett arXiv-förtryck som skickades in den 24 augusti 2026, och det medföljande materialet innehåller endast abstraktet. Resultaten är därför påståenden från författarna, inte oberoende verifierade fakta. Uppföljande granskning bör undersöka de fullständiga tabellerna, baslinjerna, konfidensdefinitionerna, statistisk variation och om de rapporterade fördelarna är konsekventa över alla fyra datamängder och alla tre modellfamiljerna.

Sammanfattningens ARC-Challenge-sats är ofullständig: den säger att CLLM med Csem-förtroende uppnår ett resultat men ger inte värdet. Den saknade informationen begränsar jämförelsen med det fullständiga OpenBookQA-påståendet och förhindrar en fullständig bedömning av metodens resonemangsprestanda. Tidningen rapporterar också ett hallucinationsdetekteringsresultat i form av att vara inom 1,5 procentenheter från den bästa AUROC i de flesta inställningar, men den medföljande källan identifierar inte de absoluta poängen, de bästa konkurrerande metoderna eller undantagen.

Implementeringsfrågor är lika viktiga. Tidningen använder en ensemble av LoRA-adaptrar, och sammandraget anger inte hur många adaptrar som krävs, hur de tränas eller hur mycket minne och slutledningstid de lägger till. Den utvärderar också endast tre namngivna språkmodeller och fyra uppsättningar av frågesvar. Det är fortfarande okänt om poängen fungerar för längre konversationer, öppen generation, flerspråkiga indata, domänspecifika uppgifter eller modeller utanför den testade storleken och arkitekturen. Tills dessa frågor är besvarade, behandlas CLLM bäst som en lovande forskningsmetod för osäkerhetsmätning snarare än ett validerat skydd för användning med hög insats.

Relaterade guider och frågesporter

ChatGPT och LLM:erAI-modeller förklarasAI-etikAI utbildningTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?