Що сталося
Дослідницька група Карнегі-Меллона, Массачусетського технологічного інституту та Корнелла 6 серпня опублікувала два рандомізованих тематичних дослідження, щоб перевірити, чи можуть короткі розмови зі штучним інтелектом протистояти конспірологічним переконанням, поки факти про важливі події все ще з’являються.
Дослідники проаналізували 472 дорослих американців, які висловили конспірологічні погляди після спроби вбити Дональда Трампа в липні 2024 року, і 1035 після вбивства Чарлі Кірка у вересні 2025 року. Учасники були випадковим чином розподілені на індивідуальний розвінчувальний діалог, непов’язану розмову з ШІ або статичний список тогочасних фактів.
Діалогові групи завершили щонайменше п’ять обмінів із Gemini 1.5 Pro у першому експерименті та Gemini 2.5 Pro у другому. Обидві моделі отримали підібрану базу фактів, яка розділила підтверджену інформацію, спростовані твердження та невирішені питання; друга модель також могла шукати в Інтернеті лише для перевірки фактичної інформації.
За мірою віри у власну висловлену теорію кожного учасника від 0 до 100 індивідуальні діалоги дали зниження на 6,95 балів порівняно з контрольним чатом без зв’язку в першому експерименті та на 7,56 балів у другому. Відмінності від статичного інформаційного листа склали 5,60 та 6,56 балів. У документі повідомляється про стандартизовані ефекти приблизно від 0,32 до 0,38 для цих порівнянь.
Два тематичні дослідження були розроблені навколо моментів, коли фактичні записи ще розвивалися. Перший стався після спроби вбити Дональда Трампа в липні 2024 року; другий стався після вбивства Чарлі Кірка у вересні 2025 року. Учасників перевіряли на наявність конспірологічних або невизначених інтерпретацій, а потім призначили для розмови, яка стосувалася їхньої власної висловленої теорії, непов’язаного чату штучного інтелекту або статичного аркуша фактів того часу. Друге дослідження було попередньо зареєстровано, а перше – ні, тому реплікація є інформативною, але не еквівалентною двом незалежним підтверджуючим дослідженням.
Деталі джерела: Costello and colleagues' research paper on arXiv ↗
Чому це важливо
Результат свідчить про те, що розмовна система може зробити більше, ніж повторити виправлення: вона може адаптувати факти, запитання та невизначеність до конкретної причини, яку людина наводить для свого переконання.
Це розрізнення корисно під час подій, що швидко розвиваються, коли підтверджені докази є неповними, а загальний інформаційний бюлетень може не відповідати твердженню, яке людина справді вважає переконливим. Стратегічний аналіз у статті виявив, що модель більше спиралася на надійні джерела, відкриті запитання та обережність, коли було мало відомо, а потім використовувала більше прямих доказів, коли друга подія мала більший фактичний запис.
Автори також повідомляють про обмежені докази пізнішого поширення. Через два місяці після першого експерименту учасники, призначені для діалогу, мали меншу ймовірність, ніж об’єднані контрольні, схвалити дві конспірологічні інтерпретації наступної події. У другому спостереженні безпосереднє призначення лікування суттєво не зменшило вірогідність пізнішої стрілянини, хоча окремий попередньо зареєстрований аналіз стійкості та ширший конспірологічний захід свідчили про менші ефекти перенесення.
Дизайн показує, чому взаємодія може перевершити статичну корекцію, не доводячи, що переконання завжди бажане. Gemini 1.5 Pro у першому дослідженні та Gemini 2.5 Pro у другому отримали підготовлені дослідниками бази фактів, які розділяли підтверджену інформацію, спростовані твердження та невирішені запитання. Модель може запитати про конкретні міркування учасника та вибрати, чи відповісти прямо, навести достовірні докази чи зберегти невизначеність. Ця адаптивність корисна для освіти, але вона також дає системі право вирішувати, які твердження оскаржувати та які джерела виводити на передній план.
Дослідження не виправдовує автоматичного використання переконливих ботів у публічних бесідах. Система, призначена для зміни переконань, має надзвичайну силу, і автори відзначають, що подібні методи можуть також збільшити віру в неправдиві твердження. Будь-яка справжня служба потребує прозорого авторства, надійного обґрунтування подій, захисту від політичного націлювання та незалежних тестів на точність і ненавмисні ефекти.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
Що дивитися далі
Слідкуйте за експертною оцінкою, реплікацією після двох політичних криз у США та польовими доказами того, чи люди вирішують використовувати такий інструмент, не залучаючись до дослідження.
Це новий препринт, створений навколо двох тематичних досліджень. Перший експеримент не був попередньо зареєстрований, другий був, і в обох вимірювалися переконання, які висловлювали самі користувачі відразу після короткої онлайн-взаємодії, а не реальна поведінка обміну даними, голосування чи довгострокова довіра.
Проаналізовані зразки включали лише учасників, чиї відкриті відповіді були класифіковані GPT-4o як конспірологічні або невизначені, хоча автори повідомляють про подібні моделі за іншими правилами класифікації. В обох дослідженнях брали участь дорослі американці через CloudResearch, тому результати можуть не передаватись на інші країни, мови, події чи населення.
Моделі не покладалися на власні знання: дослідники надали ретельно зібрану базу фактів і чіткі інструкції щодо переконання. Майбутня робота повинна перевірити, хто зберігає ці факти під тиском термінів, як виправляються помилки, чи послідовно розглядаються протилежні точки зору, і коли система повинна зберігати невизначеність замість того, щоб намагатися переконати.
Існує також вимірювальна різниця між зміною висловленого переконання та покращенням розуміння людиною. Результатами були оцінки, отримані власноруч після коротких онлайн-розмов, неспостереженої поведінки при обміні інформацією, перевірки джерела, голосування або рішень, прийнятих під час кризи в прямому ефірі. Подальші дії в статті надають ранні докази наполегливості, але неоднозначні результати означають, що пізніше дослідження має попередньо зареєструвати довгострокові результати, відстежити відхід і перевірити, чи можуть учасники самі пояснити докази, а не просто повторювати висновок моделі.
Реплікація повинна варіювати джерело фактичного запису, а також населення. Ці експерименти надали власні бази фактів дослідників і залучили дорослих американців через CloudResearch, що робить налаштування надзвичайно контрольованими, але залишає відкритими питання щодо багатомовних подій, налаштувань з низьким підключенням і криз, під час яких офіційна інформація затримується або оскаржується. Відповідальне польове випробування зробить авторство моделі видимим, дозволить учасникам відмовитися від втручання, зареєструвати, які докази були показані, і залучити незалежних суддів, щоб перевірити, чи діалог виправив помилкове уявлення, не вводячи нового. Він повинен вимірювати довіру, емоційну реакцію та готовність ділитися претензіями разом із показниками віри.