Назад до новин
ІнноваціяAI Understanding брифінг

Тест Werewolf показує, що магістри права можуть переоцінювати надійних обвинувачів

Тест 40 відкритих конфігурацій LLM виявив, що звинувачення можуть змінити переконання моделей, навіть якщо обвинувач перебуває на стороні протилежної сторони.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2609.12446
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Велика мовна модель (LLM)
Мовна модель, навчена на масивних текстових корпусах для створення та аналізу тексту.
Анотація
Мітки або метадані, додані людиною, використовуються для навчання або оцінки моделей машинного навчання.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Дослідники представили контрольний показник Werewolf, який вимірює, як LLM-спостерігачі оновлюють свої переконання після отримання повідомлень про підозри та звинувачення. Серед 1224 анотованих повідомлень і 40 відкритих конфігурацій моделей більші моделі частіше ідентифікували справжніх вовків з історії гри, але залишалися під сильним впливом звинувачень і сприйманої надійності обвинувача.

У статті пропонується оцінити зміни переконань, а не покладатися лише на кінцевий результат гри соціального відрахування. У своїй установці модель із села, яка спостерігає, отримує ігрові повідомлення, включаючи підозри та звинувачення, і дослідники вимірюють, як її переконання змінюються після кожного повідомлення.

Анотація звітує про результати 40 відкритих конфігурацій LLM і 1224 анотованих повідомлень. Більші моделі краще відрізняли вовків від сільських жителів, використовуючи повну історію гри. Проте звинувачення все одно збільшували підозру щодо обвинуваченого та зменшували підозру щодо обвинувача, особливо коли обвинувачу вже довіряли.

Повідомлена закономірність зберігалася навіть тоді, коли надійний обвинувач був налаштований на вовків. Великі моделі краще протистояли звинуваченням з боку обвинувачів, яким вони вже не довіряли, але моделям до 120 мільярдів параметрів все ще було важко поєднати зміст звинувачення з надійністю його джерела. У наданому тексті джерело не надає детальних балів для кожної моделі, статистичної невизначеності чи незалежного повторення.

Деталі джерела: arxiv.org ↗

Чому це важливо

Дослідження визначає конкретну слабкість стратегічної комунікації: моделі можуть невідокремити довіру до оратора від доказів, що містяться в заяві цього оратора. Це важливо для агентів LLM, які працюють у середовищах, де повідомлення можуть бути вибірковими, оманливими чи змагальними. Результатом є еталон і результати дослідження, а не докази того, що всі розгорнуті системи ШІ поводяться таким чином або що оцінка узагальнюється за межами Werewolf.

Для дослідників, які оцінюють агентів LLM, результат свідчить про те, що кінцевий успіх гри може приховувати важливі слабкі місця в проміжних міркуваннях і оновленні переконань. Модель може прийняти правдоподібне рішення, все ще переважуючи, хто подав претензію, а не оцінювати претензію разом із наявними доказами.

Практичний наслідок обмежений, але корисний: оцінювання агентів, які спілкуються або приймають рішення на основі кількох звітів, може потребувати вимірювання змін переконань після окремих повідомлень, включаючи випадки, коли довірливий оратор вводить в оману. Дослідження не встановило, що така ж поведінка відбувається в розгорнутих продуктах або в неігрових налаштуваннях.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Що дивитися далі

Тест і код доступні на веб-сайті проекту, але джерело не вказує ліцензії, деталі хостингу чи доступність оцінюваних моделей для загального використання. Подальша робота має перевірити, чи знахідка переноситься на інші комунікаційні завдання, чи покращує навчання міркування щодо джерельного вмісту та наскільки результати залежать від дизайну гри та вибору анотацій.

Автори кажуть, що тест і код доступні на сторінці проекту, на яку посилається. У наданому джерелі не задокументовано вимоги доступу, ліцензування, ціни, підтримувані фреймворки, а також те, чи тест включає результати моделі, окрім анотованих повідомлень.

До важливих невідомих відомостей належать те, як генерувалися та анотувалися повідомлення, як було встановлено довіру, чи є результати статистично надійними для окремих моделей і чи покращене обґрунтування історії гри більших моделей перетворюється на кращу стійкість до маніпуляцій.

Реплікація в інших стратегічних комунікаційних завданнях допоможе визначити, чи є це специфічним ефектом Werewolf, чи ширшим обмеженням у тому, як LLM-агенти поєднують достовірність джерела зі змістом звинувачень.

Пов’язані посібники та вікторини

Пояснення моделей AIАгенти ШІЕтика ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?