Назад към Новини
ИновацияAI Understanding брифинг

Werewolf бенчмарк открива, че LLM могат да надценят доверените обвинители

Бенчмарк от 40 отворени LLM конфигурации установи, че обвиненията могат да променят убежденията на моделите, дори когато обвинителят е на страната на противника.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2609.12446
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Анотация
Добавени от човека етикети или метаданни, използвани за обучение или оценка на модели за машинно обучение.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Изследователите въведоха бенчмарк Werewolf, който измерва как наблюдаващите LLM актуализират своите вярвания след получаване на съобщения за подозрения и обвинения. В 1224 анотирани съобщения и 40 конфигурации на модели с отворено тегло, по-големите модели по-често идентифицираха истински вълци от историята на играта, но останаха силно повлияни от обвиненията и възприеманата надеждност на обвинителя.

Документът предлага да се оценят промените във вярванията, вместо да се разчита само на крайния резултат от игра на социално приспадане. В своята настройка, наблюдаващ модел от страната на селото получава съобщения от играта, включително подозрения и обвинения, и изследователите измерват как неговите вярвания се променят след всяко съобщение.

Абстрактните доклади са резултат от 40 отворени LLM конфигурации и 1224 анотирани съобщения. По-големите модели се представиха по-добре при разграничаване на вълци от селяни, използвайки пълната история на играта. Обвиненията обаче все още увеличават подозрението към обвиняемия и намаляват подозрението към обвинителя, особено когато на обвинителя вече се вярва.

Докладваният модел се запази дори когато довереният обвинител беше настроен на вълци. По-големите модели бяха по-способни да устоят на обвинения от обвинители, на които вече не вярваха, но моделите с до 120 милиарда параметри все още се бореха да интегрират съдържанието на обвинението с надеждността на неговия източник. Източникът не предоставя подробни резултати за всеки модел, статистическа несигурност или независимо възпроизвеждане в предоставения текст.

Детайли за източника: arxiv.org ↗

Защо има значение

Проучването идентифицира специфична слабост в стратегическата комуникация: моделите може да не отделят адекватно достоверността на говорещия от доказателствата, съдържащи се в твърдението на този говорещ. Това има значение за LLM агентите, работещи в настройки, където съобщенията могат да бъдат избирателни, измамни или състезателни. Резултатът е бенчмарк и изследователска констатация, а не доказателство, че всички внедрени AI системи се държат по този начин или че оценката се обобщава отвъд Werewolf.

За изследователите, оценяващи LLM агенти, резултатът предполага, че крайният успех на играта може да прикрие важни слабости в междинните разсъждения и актуализирането на вярванията. Един модел може да достигне до правдоподобно решение, докато все още преценява кой е предал иск, вместо да оценява твърдението заедно с наличните доказателства.

Практическото значение е ограничено, но полезно: оценките на агенти, които комуникират или вземат решения от множество доклади, може да се наложи да измерват промените в убежденията след отделни съобщения, включително случаи, когато достоверен говорител подвежда. Проучването не установява, че същото поведение се среща при внедрени продукти или в настройки извън игри.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Бенчмаркът и кодът са достъпни чрез уебсайта на проекта, но източникът не посочва подробности за лицензирането, хостинга или дали оценените модели са достъпни за обществено ползване. По-нататъшната работа трябва да провери дали констатацията се прехвърля към други комуникационни задачи, дали обучението подобрява разсъжденията на съдържанието на източника и доколко резултатите зависят от дизайна на играта и избора на анотации.

Авторите казват, че бенчмаркът и кодът са достъпни на свързаната страница на проекта. Предоставеният източник не документира изискванията за достъп, лицензирането, ценообразуването, поддържаните рамки или дали бенчмаркът включва изходни данни на модела извън анотираните съобщения.

Важните неизвестни включват как са генерирани и анотирани съобщенията, как е установено доверие, дали резултатите са статистически стабилни в отделните модели и дали подобреното разсъждение на историята на играта на по-големите модели се превръща в по-добра устойчивост на манипулация.

Репликацията в други стратегически комуникационни задачи би помогнала да се определи дали това е специфичен за Werewolf ефект или по-широко ограничение в начина, по който LLM агентите съчетават достоверността на източника със съдържанието на обвиненията.

Свързани ръководства и викторини

Обяснени модели на AIAI агентиЕтика на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?