Retour aux Actualités
InnovationBriefing AI Understanding

La prépublication propose des modèles de langage de crédibilité pour exposer l'incertitude et détecter les hallucinations

Une nouvelle prépublication propose une approche basée sur un ensemble qui mesure la force avec laquelle les modèles de langage s'engagent dans les réponses, en rapportant des résultats d'étalonnage compétitif et de détection d'hallucinations sur trois modèles ouverts et quatre ensembles de données de questions-réponses.

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
Document de source principaleSource enregistrée
Éditeur
arxiv.org
Lien source
arxiv.orghttps://arxiv.org/abs/2608.23244
Type de source
Document principal : une annonce officielle, un document, un dépôt ou une page de première partie que nous lisons directement.
ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

LoRA (Adaptation de bas rang)
Une méthode de réglage fin efficace en termes de paramètres qui ajoute des matrices d'adaptateurs de bas rang.
Mémoire (mémoire de l'agent)
Contexte stocké qu'un agent IA utilise au fil des étapes ou des sessions pour améliorer la continuité.
Hallucinations
Lorsqu'un modèle génère des informations fluides mais fausses ou non prises en charge.
Testez-vousChatGPT et Quiz LLM

Que s'est-il passé

Une prépublication soumise à arXiv le 24 août présente les Credal Large Language Models, ou CLLM, qui utilisent un ensemble d'adaptateurs LoRA pour représenter une gamme de prédictions plausibles au lieu d'une distribution de probabilité unique. Les auteurs dérivent des scores d’engagement au niveau symbolique et au niveau sémantique et les évaluent pour la réponse aux questions, l’étalonnage, la prédiction sélective, la détection des hallucinations et le raisonnement.

L'article décrit une limitation dans la manière habituelle dont les modèles linguistiques représentent l'incertitude : un modèle standard produit une distribution prédictive unique, qui, selon les auteurs, peut confondre l'ignorance avec une véritable ambiguïté. Leur CLLM proposé utilise à la place un ensemble d'adaptateurs LoRA pour former ce que le document appelle un ensemble de crédits. En termes pratiques, la méthode vise à préserver les désaccords ou la propagation entre des distributions prédictives plausibles plutôt que de compresser toute l'incertitude en une seule sortie softmax. La source ne prétend pas que cette représentation rende un modèle correct ; il prétend que cela peut rendre le degré d’engagement du modèle plus informatif.

Les auteurs présentent deux mesures liées. Credal Token Commitment, ou CTC, fonctionne dans l'espace des jetons et combine le support de la limite inférieure, la largeur du credal et l'entropie d'intersection. Le résumé indique que le CTC peut être calculé sans génération supplémentaire, ce qui est potentiellement important pour les systèmes où un échantillonnage répété ajouterait de la latence ou des coûts. La cohérence des engagements sémantiques, ou SCC, étend l'idée à l'espace sémantique à l'aide de complétions échantillonnées. Le document définit également SCC-Gap pour mesurer une inadéquation entre la prise en charge au niveau des jetons et la prise en charge au niveau sémantique. Ces scores sont présentés comme des outils permettant d’identifier les cas où la confiance superficielle d’un modèle peut ne pas correspondre à l’éventail de significations exprimées par ses réponses possibles.

L'évaluation couvre Gemma-2-9B, Llama-3.1-8B et Qwen2.5-7B sur OpenBookQA, CoQA, TriviaQA et ARC-Challenge. Selon le résumé, CLLM est la méthode la plus performante en termes de précision des réponses aux questions tout en maintenant une erreur d’étalonnage attendue compétitive. Les auteurs rapportent également que le CTC se situe à 1,5 point de pourcentage de la meilleure zone de détection des hallucinations sous la courbe caractéristique de fonctionnement du récepteur dans la plupart des contextes, sans génération supplémentaire. Concernant la prédiction sélective avec une couverture de 80 %, le résumé rapporte une précision de 99,0 % sur OpenBookQA pour CLLM avec SCC. Il commence par énoncer un résultat ARC-Challenge pour CLLM avec la confiance du Csem mais est tronqué avant de donner le résultat, de sorte que cette affirmation ne peut pas être évaluée à partir de la source fournie.

Détails de la source: arxiv.org ↗

Pourquoi c'est important

Les modèles linguistiques peuvent produire des réponses fluides avec une confiance injustifiée. Si les résultats rapportés tiennent le coup, mesurer l’incertitude sur plusieurs distributions prédictives plausibles pourrait aider les systèmes à identifier les réponses qui nécessitent une vérification, une abstention ou un examen humain sans nécessiter de génération supplémentaire dans de nombreux cas.

La question pratique centrale n’est pas simplement de savoir si un modèle linguistique peut répondre à une question, mais s’il peut distinguer la connaissance de l’incertitude. Une réponse fluide mais incorrecte peut être plus dangereuse qu'un refus explicite lorsque les utilisateurs considèrent la confiance comme une preuve. La représentation de crédibilité proposée dans l’article résout ce problème en conservant les désaccords entre les prédictions basées sur l’adaptateur. Si la méthode se généralise, elle pourrait fournir aux développeurs un signal côté modèle pour décider quand répondre directement, demander une vérification, acheminer une question vers un autre système ou impliquer une personne.

Le résultat de la prédiction sélective rapporté est particulièrement pertinent pour le déploiement car les systèmes sélectifs n'ont pas besoin de répondre à toutes les questions. Un système capable de maintenir une grande précision tout en couvrant uniquement les cas qu’il considère comme suffisamment étayés peut être plus utile dans les contextes où les erreurs entraînent des coûts importants. La précision rapportée de 99,0 % avec une couverture de 80 % sur OpenBookQA est encourageante au sein de cet ensemble de données et de cette configuration, mais elle doit être comprise comme un résultat papier plutôt que comme une preuve qu'un système déployé atteindrait les mêmes performances. Le résumé ne précise pas le nombre d'exemples, les méthodes de comparaison ou la définition opérationnelle de la couverture.

L’affirmation de l’absence de génération supplémentaire pour le CTC pourrait également être importante pour la conception de l’inférence. De nombreuses techniques d'incertitude reposent sur la production de plusieurs complétions, ce qui peut augmenter les calculs et les retards. La source indique que CTC combine plusieurs quantités liées à l'incertitude sans génération supplémentaire, tandis que SCC utilise explicitement des complétions échantillonnées. Cette distinction donne à l’article un angle d’ingénierie concret : une note peut être moins coûteuse à appliquer, tandis que l’autre peut capturer plus directement les désaccords sémantiques. Cependant, le résumé ne quantifie pas le coût de l'ensemble LoRA lui-même, de sorte que le compromis total en matière de service reste inconnu.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Vérification de concept interactive+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Que regarder ensuite

Le résultat est actuellement une évaluation de prépublication rapportée par l’auteur, et non un résultat de performance établi de manière indépendante. Des détails importants ne sont pas disponibles dans le résumé fourni, notamment le résultat complet de l'ARC-Challenge, les lignes de base exactes, la charge de calcul et la manière dont la méthode est transférée au-delà des modèles et des ensembles de données testés.

La première question est de savoir si les gains rapportés survivent à une réplication indépendante. La source est une préimpression arXiv soumise le 24 août 2026 et le matériel fourni ne contient que le résumé. Les résultats sont donc des affirmations des auteurs et non des faits vérifiés de manière indépendante. Un examen de suivi doit examiner les tableaux complets, les lignes de base, les définitions de confiance, la variation statistique et déterminer si les avantages signalés sont cohérents dans les quatre ensembles de données et dans les trois familles de modèles.

La phrase ARC-Challenge du résumé est incomplète : elle indique que CLLM avec la confiance Csem obtient un résultat mais ne fournit pas de valeur. Ces informations manquantes limitent la comparaison avec l’affirmation complète d’OpenBookQA et empêchent une évaluation complète des performances de raisonnement de la méthode. L'article rapporte également un résultat de détection des hallucinations se situant à 1,5 point de pourcentage du meilleur AUROC dans la plupart des contextes, mais la source fournie n'identifie pas les scores absolus, les meilleures méthodes concurrentes ou les exceptions.

Les questions de déploiement sont tout aussi importantes. L'article utilise un ensemble d'adaptateurs LoRA, et le résumé n'indique pas combien d'adaptateurs sont nécessaires, comment ils sont formés ou combien de mémoire et de temps d'inférence ils ajoutent. Il évalue également uniquement trois modèles de langage nommés et quatre ensembles de données de questions-réponses. On ne sait pas si les scores fonctionnent pour des conversations plus longues, une génération ouverte, des entrées multilingues, des tâches spécifiques à un domaine ou des modèles en dehors de la plage de taille et d'architecture testée. En attendant que ces questions soient résolues, il est préférable de considérer le CLLM comme une méthode de recherche prometteuse pour la mesure de l’incertitude plutôt que comme une garantie validée pour une utilisation à enjeux élevés.

Guides et quiz associés

ChatGPT et LLMModèles d'IA expliquésÉthique de l'IAFormation IATestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi des versions du modèle AI
Vous avez trouvé cela utile ?