Co się stało
Zespół badawczy Carnegie Mellon, MIT i Cornell opublikował 6 sierpnia dwa randomizowane studia przypadków, w których sprawdzano, czy krótkie rozmowy ze sztuczną inteligencją mogą przeciwstawić się przekonaniom spiskowym, podczas gdy fakty dotyczące najważniejszych wydarzeń wciąż wychodzą na jaw.
Naukowcy przeanalizowali 472 dorosłych Amerykanów, którzy wyrazili konspiracyjne poglądy po próbie zamachu na Donalda Trumpa w lipcu 2024 r. i 1035 po zabójstwie Charliego Kirka we wrześniu 2025 r. Uczestnicy zostali losowo przydzieleni do dostosowanego dialogu demaskującego, niepowiązanej rozmowy AI lub statycznej listy współczesnych faktów.
Grupy dialogowe przeprowadziły co najmniej pięć wymian z Gemini 1.5 Pro w pierwszym eksperymencie i Gemini 2.5 Pro w drugim. Obydwa modele otrzymały wyselekcjonowaną bazę faktów, w której oddzielono potwierdzone informacje, obalone twierdzenia i nierozwiązane pytania; drugi model mógłby także przeszukiwać sieć wyłącznie w celu sprawdzenia informacji opartych na faktach.
Na podstawie wiarygodności od 0 do 100 w ustaloną przez każdego uczestnika teorię, dostosowane dialogi przyniosły redukcję o 6,95 punktu w porównaniu z kontrolą niepowiązanych rozmów w pierwszym eksperymencie i 7,56 punktu w drugim. Różnice w stosunku do arkusza statycznego wyniosły 5,60 i 6,56 punktu. W artykule podano standaryzowane efekty dla tych porównań wynoszące około 0,32 do 0,38.
Obydwa studia przypadków zostały zaprojektowane wokół momentów, w których stan faktyczny był jeszcze w fazie tworzenia. Pierwsza miała miejsce po próbie zamachu na Donalda Trumpa w lipcu 2024 r.; drugi nastąpił po zabójstwie Charliego Kirka we wrześniu 2025 r. Uczestnicy zostali sprawdzeni pod kątem konspiracyjnych lub niepewnych interpretacji, a następnie przydzieleni do rozmowy, która dotyczyła ich własnej teorii, niepowiązanego czatu AI lub statycznego, współczesnego arkusza informacyjnego. Drugie badanie zostało wstępnie zarejestrowane, podczas gdy pierwsze nie, więc replikacja ma charakter informacyjny, ale nie jest równoważna dwóm niezależnym badaniom potwierdzającym.
Szczegóły źródła: Costello and colleagues' research paper on arXiv ↗
Dlaczego to ma znaczenie
Wynik sugeruje, że system konwersacyjny może zrobić więcej niż tylko powtórzyć korektę: może dostosować fakty, pytania i niepewność do konkretnego powodu, dla którego dana osoba wierzy.
To rozróżnienie jest przydatne w przypadku szybko zmieniających się wydarzeń, gdy zweryfikowane dowody są niekompletne, a ogólny arkusz informacyjny może nie odnosić się do twierdzenia, które dana osoba faktycznie uważa za przekonujące. Analiza strategii przeprowadzona w artykule wykazała, że model opierał się bardziej na wiarygodnych źródłach, otwartych pytaniach i ostrożności, gdy niewiele było wiadomo, a następnie wykorzystywał bardziej bezpośrednie dowody, gdy drugie wydarzenie miało szerszy kontekst faktyczny.
Autorzy zgłaszają również ograniczone dowody na późniejsze skutki uboczne. Dwa miesiące po pierwszym eksperymencie uczestnicy przydzieleni do dialogu rzadziej niż zbiorcza grupa kontrolna poparli dwie konspiracyjne interpretacje kolejnego zdarzenia. W drugiej obserwacji bezpośrednie przypisanie leczenia nie zmniejszyło znacząco przekonań na temat późniejszej strzelaniny, chociaż osobna, zarejestrowana wcześniej analiza uporczywości i szerszy pomiar spiskowy sugerowały mniejsze skutki przeniesienia.
Projekt pokazuje, dlaczego interakcja może przewyższać korektę statyczną, nie udowadniając, że perswazja jest zawsze pożądana. Gemini 1.5 Pro w pierwszym badaniu i Gemini 2.5 Pro w drugim otrzymały wyselekcjonowane przez badaczy bazy faktów oddzielające potwierdzone informacje, obalone twierdzenia i nierozwiązane pytania. Model może pytać o konkretne rozumowanie uczestnika i wybierać, czy odpowiedzieć bezpośrednio, zacytować wiarygodne dowody, czy też zachować niepewność. Ta zdolność adaptacji jest użyteczna w edukacji, ale daje także systemowi swobodę decydowania o tym, które twierdzenia należy kwestionować, a które źródła wysunąć na pierwszy plan.
Badanie nie uzasadnia automatycznego wdrażania botów perswazyjnych w rozmowach publicznych. System instruowany do zmiany przekonań ma niezwykłą moc, a autorzy zauważają, że podobne techniki mogą również zwiększyć wiarę w fałszywe twierdzenia. Każda prawdziwa usługa wymagałaby przejrzystego autorstwa, wiarygodnego uzasadnienia zdarzeń, zabezpieczeń przed celami politycznymi oraz niezależnych testów dokładności i niezamierzonych skutków.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
Co obejrzeć dalej
Zwróć uwagę na wzajemne recenzje, możliwości powtórzenia po dwóch kryzysach politycznych w USA oraz dowody terenowe pokazujące, czy ludzie decydują się na korzystanie z takiego narzędzia bez konieczności angażowania się w badanie.
Jest to nowy preprint zbudowany na podstawie dwóch studiów przypadku. Pierwszy eksperyment nie był rejestrowany wcześniej, drugi tak i w obu eksperymentach mierzono przekonania zgłaszane przez samych uczestników natychmiast po krótkiej interakcji w Internecie, a nie dzielenie się zachowaniami w świecie rzeczywistym, głosowanie czy długoterminowe zaufanie.
Analizowane próbki obejmowały tylko uczestników, których otwarte odpowiedzi zostały sklasyfikowane przez GPT-4o jako konspiracyjne lub niepewne, chociaż autorzy zgłaszają podobne wzorce w ramach alternatywnych zasad klasyfikacji. Do obu badań rekrutowano dorosłych Amerykanów za pośrednictwem CloudResearch, więc wyniki mogą nie zostać przeniesione na inne kraje, języki, wydarzenia lub populacje.
Modele nie opierały się na wiedzy niewspomaganej: badacze dostarczyli starannie zebrane bazy faktów i wyraźne instrukcje perswazji. Przyszłe prace powinny sprawdzić, kto podtrzymuje te fakty pod presją terminu, w jaki sposób koryguje się błędy, czy przeciwstawne punkty widzenia są traktowane konsekwentnie i kiedy system powinien zachować niepewność, zamiast próbować przekonywać.
Istnieje również różnica w pomiarze pomiędzy zmianą wyrażonego przekonania a poprawą zrozumienia danej osoby. Wynikiem były samodzielnie zgłaszane oceny zebrane po krótkich rozmowach online, niezaobserwowane zachowania związane z udostępnianiem, sprawdzanie źródła, głosowanie lub decyzje podejmowane podczas kryzysu na żywo. Dalsze działania opublikowane w artykule dostarczają wczesnych dowodów na trwałość wyników, ale mieszane wyniki oznaczają, że w późniejszym badaniu należy wstępnie zarejestrować długoterminowe wyniki, śledzić zanikanie i sprawdzać, czy uczestnicy potrafią sami wyjaśnić dowody, zamiast po prostu powtarzać wnioski płynące z modelu.
Replikacja powinna różnicować źródło danych faktycznych oraz populację. Eksperymenty te dostarczyły badaczom bazy faktów i za pośrednictwem CloudResearch zrekrutowano dorosłych Amerykanów, co sprawia, że konfiguracja jest niezwykle kontrolowana, ale pozostawia otwarte pytania dotyczące wydarzeń wielojęzycznych, ustawień niższej łączności i kryzysów, w których oficjalne informacje są opóźniane lub kwestionowane. Odpowiedzialna próba terenowa uwidoczniłaby autorstwo modelu, umożliwiłaby uczestnikom odmowę interwencji, zarejestrowanie, jakie dowody zostały przedstawione, i skorzystanie z niezależnych arbitrów w celu sprawdzenia, czy dialog poprawił błędne przekonanie bez wprowadzania nowego. Powinien mierzyć zaufanie, reakcję emocjonalną i chęć dzielenia się twierdzeniami wraz z wynikami przekonań.