Що сталося
Дослідники представили контрольний показник Werewolf, який вимірює, як LLM-спостерігачі оновлюють свої переконання після отримання повідомлень про підозри та звинувачення. Серед 1224 анотованих повідомлень і 40 відкритих конфігурацій моделей більші моделі частіше ідентифікували справжніх вовків з історії гри, але залишалися під сильним впливом звинувачень і сприйманої надійності обвинувача.
У статті пропонується оцінити зміни переконань, а не покладатися лише на кінцевий результат гри соціального відрахування. У своїй установці модель із села, яка спостерігає, отримує ігрові повідомлення, включаючи підозри та звинувачення, і дослідники вимірюють, як її переконання змінюються після кожного повідомлення.
Анотація звітує про результати 40 відкритих конфігурацій LLM і 1224 анотованих повідомлень. Більші моделі краще відрізняли вовків від сільських жителів, використовуючи повну історію гри. Проте звинувачення все одно збільшували підозру щодо обвинуваченого та зменшували підозру щодо обвинувача, особливо коли обвинувачу вже довіряли.
Повідомлена закономірність зберігалася навіть тоді, коли надійний обвинувач був налаштований на вовків. Великі моделі краще протистояли звинуваченням з боку обвинувачів, яким вони вже не довіряли, але моделям до 120 мільярдів параметрів все ще було важко поєднати зміст звинувачення з надійністю його джерела. У наданому тексті джерело не надає детальних балів для кожної моделі, статистичної невизначеності чи незалежного повторення.
Чому це важливо
Дослідження визначає конкретну слабкість стратегічної комунікації: моделі можуть невідокремити довіру до оратора від доказів, що містяться в заяві цього оратора. Це важливо для агентів LLM, які працюють у середовищах, де повідомлення можуть бути вибірковими, оманливими чи змагальними. Результатом є еталон і результати дослідження, а не докази того, що всі розгорнуті системи ШІ поводяться таким чином або що оцінка узагальнюється за межами Werewolf.
Для дослідників, які оцінюють агентів LLM, результат свідчить про те, що кінцевий успіх гри може приховувати важливі слабкі місця в проміжних міркуваннях і оновленні переконань. Модель може прийняти правдоподібне рішення, все ще переважуючи, хто подав претензію, а не оцінювати претензію разом із наявними доказами.
Практичний наслідок обмежений, але корисний: оцінювання агентів, які спілкуються або приймають рішення на основі кількох звітів, може потребувати вимірювання змін переконань після окремих повідомлень, включаючи випадки, коли довірливий оратор вводить в оману. Дослідження не встановило, що така ж поведінка відбувається в розгорнутих продуктах або в неігрових налаштуваннях.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Which component of an AI application is the machine-learning model itself?
Що дивитися далі
Тест і код доступні на веб-сайті проекту, але джерело не вказує ліцензії, деталі хостингу чи доступність оцінюваних моделей для загального використання. Подальша робота має перевірити, чи знахідка переноситься на інші комунікаційні завдання, чи покращує навчання міркування щодо джерельного вмісту та наскільки результати залежать від дизайну гри та вибору анотацій.
Автори кажуть, що тест і код доступні на сторінці проекту, на яку посилається. У наданому джерелі не задокументовано вимоги доступу, ліцензування, ціни, підтримувані фреймворки, а також те, чи тест включає результати моделі, окрім анотованих повідомлень.
До важливих невідомих відомостей належать те, як генерувалися та анотувалися повідомлення, як було встановлено довіру, чи є результати статистично надійними для окремих моделей і чи покращене обґрунтування історії гри більших моделей перетворюється на кращу стійкість до маніпуляцій.
Реплікація в інших стратегічних комунікаційних завданнях допоможе визначити, чи є це специфічним ефектом Werewolf, чи ширшим обмеженням у тому, як LLM-агенти поєднують достовірність джерела зі змістом звинувачень.