Retour aux Actualités
InnovationBriefing AI Understanding

Le benchmark Werewolf révèle que les LLM peuvent surévaluer les accusateurs de confiance

Un benchmark de 40 configurations LLM à poids ouvert a révélé que les accusations peuvent modifier les convictions des modèles même lorsque l’accusateur est aligné sur le camp adverse.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Document de source principaleSource enregistrée
Éditeur
arxiv.org
Lien source
arxiv.orghttps://arxiv.org/abs/2609.12446
Type de source
Document principal : une annonce officielle, un document, un dépôt ou une page de première partie que nous lisons directement.
ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

Référence
Un test ou un ensemble de données standardisé utilisé pour mesurer et comparer les performances du modèle.
Grand modèle linguistique (LLM)
Un modèle de langage formé sur des corpus de textes massifs pour générer et analyser du texte.
Annotations
Étiquettes ou métadonnées ajoutées par l’homme utilisées pour entraîner ou évaluer des modèles d’apprentissage automatique.
Testez-vousQuiz sur les modèles d'IA expliqués

Que s'est-il passé

Les chercheurs ont introduit un Werewolf qui mesure la manière dont les LLM observateurs mettent à jour leurs croyances après avoir reçu des messages de suspicion et d'accusation. À travers 1 224 messages annotés et 40 configurations de modèles à poids ouvert, les modèles plus grands identifiaient plus souvent les vrais loups de l'histoire du jeu, mais restaient fortement influencés par les accusations et la fiabilité perçue de l'accusateur.

L'article propose d'évaluer les changements de croyance plutôt que de se fier uniquement au résultat final d'un jeu de déduction sociale. Dans sa configuration, un modèle d'observation du village reçoit des messages de jeu, notamment des soupçons et des accusations, et les chercheurs mesurent l'évolution de ses croyances après chaque message.

Le résumé rend compte des résultats de 40 configurations LLM à poids ouvert et de 1 224 messages annotés. Les modèles plus grands ont mieux réussi à distinguer les loups des villageois en utilisant l'historique complet du jeu. Cependant, les accusations accroissent encore la suspicion à l’égard de l’accusé et diminuent la suspicion à l’égard de l’accusateur, en particulier lorsque l’on fait déjà confiance à l’accusateur.

Le schéma signalé persistait même lorsque l’accusateur de confiance était aligné sur le loup. Les modèles plus grands étaient mieux à même de résister aux accusations d’accusateurs dont ils se méfiaient déjà, mais les modèles comportant jusqu’à 120 milliards de paramètres avaient encore du mal à intégrer le contenu de l’accusation avec la fiabilité de sa source. La source ne fournit aucun score détaillé par modèle, aucune incertitude statistique ou réplication indépendante dans le texte fourni.

Détails de la source: arxiv.org ↗

Pourquoi c'est important

L’étude identifie une faiblesse spécifique dans la communication stratégique : les modèles peuvent ne pas séparer de manière adéquate la crédibilité d’un locuteur des preuves contenues dans ses affirmations. Cela est important pour les agents LLM opérant dans des contextes où les messages peuvent être sélectifs, trompeurs ou contradictoires. Le résultat est une référence et un résultat de recherche, et non une preuve que tous les systèmes d’IA déployés se comportent de cette façon ou que l’évaluation se généralise au-delà de Werewolf.

Pour les chercheurs évaluant les agents LLM, le résultat suggère que le succès final du jeu peut cacher d’importantes faiblesses dans le raisonnement intermédiaire et la mise à jour des croyances. Un modèle peut parvenir à une décision plausible tout en surpondérant qui a déposé une réclamation plutôt que d’évaluer la réclamation en fonction des preuves disponibles.

L'implication pratique est limitée mais utile : les évaluations d'agents qui communiquent ou prennent des décisions à partir de plusieurs rapports peuvent nécessiter de mesurer les changements de croyance après des messages individuels, y compris dans les cas où un locuteur crédible induit en erreur. L’étude n’établit pas que le même comportement se produit dans les produits déployés ou dans des environnements hors jeu.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Que regarder ensuite

Le et le code sont disponibles sur le site Web du projet, mais la source n'indique pas la licence, les détails d'hébergement ou si les modèles évalués sont disponibles pour un usage public. Des travaux supplémentaires devraient tester si les résultats sont transférés à d'autres tâches de communication, si la formation améliore le raisonnement sur le contenu source et dans quelle mesure les résultats dépendent de la conception du jeu et des choix d'.

Les auteurs affirment que le et le code sont disponibles sur la page du projet lié. La source fournie ne documente pas les exigences d'accès, les licences, les prix, les cadres pris en charge ou si l'évaluation inclut les résultats du modèle au-delà des messages annotés.

Les inconnues importantes incluent la manière dont les messages ont été générés et annotés, la manière dont la confiance a été établie, la robustesse statistique des résultats dans les modèles individuels et la question de savoir si le raisonnement amélioré de l’historique des jeux des modèles plus grands se traduit par une meilleure résistance à la manipulation.

La réplication sur d’autres tâches de communication stratégique aiderait à déterminer s’il s’agit d’un effet spécifique au loup-garou ou d’une limitation plus large dans la manière dont les agents LLM combinent la crédibilité de la source avec le contenu de l’accusation.

Guides et quiz associés

Modèles d'IA expliquésAgents IAÉthique de l'IATestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi des versions du modèle AI
Vous avez trouvé cela utile ?