무슨 일이 일어났나요?
카네기 멜론, MIT, 코넬 연구팀은 주요 사건에 대한 사실이 아직 밝혀지고 있는 동안 짧은 AI 대화가 음모론에 대응할 수 있는지 여부를 테스트하는 두 가지 무작위 사례 연구를 8월 6일에 게시했습니다.
연구진은 2024년 7월 도널드 트럼프 암살 시도 이후 음모론을 표명한 미국 성인 472명과 2025년 9월 찰리 커크 암살 이후 1,035명을 분석했다. 참가자들은 맞춤형 폭로 대화, 관련 없는 AI 대화 또는 동시 사실의 정적 목록에 무작위로 할당되었습니다.
대화 그룹은 첫 번째 실험에서 Gemini 1.5 Pro, 두 번째 실험에서 Gemini 2.5 Pro를 사용하여 최소 5번의 교환을 완료했습니다. 두 모델 모두 확인된 정보, 사실이 아닌 주장, 해결되지 않은 질문을 분리한 엄선된 사실 기반을 받았습니다. 두 번째 모델은 사실 정보를 확인하기 위해서만 웹을 검색할 수도 있었습니다.
각 참가자가 자신이 진술한 이론에 대한 신뢰도를 0~100으로 측정한 결과, 맞춤형 대화는 첫 번째 실험에서는 관련 없는 채팅 통제에 비해 6.95점 감소했고 두 번째 실험에서는 7.56점 감소했습니다. 정적 팩트 시트와의 차이는 5.60점과 6.56점이었습니다. 이 논문에서는 이러한 비교에 대해 대략 0.32~0.38의 표준화된 효과를 보고합니다.
두 가지 사례 연구는 사실 기록이 아직 진행 중인 순간을 중심으로 설계되었습니다. 첫 번째는 2024년 7월 도널드 트럼프 암살 시도 이후였습니다. 두 번째는 2025년 9월 찰리 커크(Charlie Kirk) 암살 이후였습니다. 참가자들은 음모 또는 불확실한 해석을 선별한 후 자신이 진술한 이론을 다루는 대화, 관련 없는 AI 채팅 또는 정적인 동시 팩트 시트에 할당되었습니다. 두 번째 연구는 사전 등록되었지만 첫 번째 연구는 등록되지 않았기 때문에 복제는 유익하지만 2개의 독립적인 확증 시험과 동일하지 않습니다.
소스 세부정보: Costello and colleagues' research paper on arXiv ↗
왜 중요한가요?
결과는 대화 시스템이 수정을 반복하는 것 이상의 역할을 할 수 있음을 시사합니다. 즉, 사실, 질문, 불확실성을 사람이 믿음에 대해 제시하는 구체적인 이유에 맞게 조정할 수 있습니다.
이러한 구별은 확인된 증거가 불완전하고 일반적인 사실 자료가 사람이 실제로 설득력 있다고 생각하는 주장을 다루지 않을 수 있는 빠르게 변화하는 사건 중에 유용합니다. 이 논문의 전략 분석에 따르면 모델은 알려진 것이 거의 없을 때 신뢰할 수 있는 출처, 공개 질문 및 주의에 더 의존했으며, 두 번째 사건에 더 큰 사실 기록이 있을 때 더 직접적인 증거를 사용했습니다.
저자들은 또한 나중에 유출될 수 있다는 제한된 증거를 보고합니다. 첫 번째 실험이 있은 지 2개월 후, 대화에 배정된 참가자는 통합 통제 그룹보다 후속 사건에 대한 두 가지 음모 해석을 지지할 가능성이 적었습니다. 두 번째 후속 조사에서는 별도의 사전 등록된 지속성 분석과 더 광범위한 음모 척도를 통해 더 작은 이월 효과가 제안되었지만 직접 치료 할당은 나중에 총격에 대한 믿음을 크게 감소시키지 않았습니다.
디자인은 설득이 항상 바람직하다는 것을 증명하지 않고도 상호 작용이 정적 수정보다 더 나은 성능을 발휘할 수 있는 이유를 보여줍니다. 첫 번째 연구의 Gemini 1.5 Pro와 두 번째 연구의 Gemini 2.5 Pro는 확인된 정보, 사실이 아닌 주장, 해결되지 않은 질문을 구분하여 연구원이 선별한 사실 기반을 받았습니다. 모델은 참가자의 구체적인 추론에 대해 질문하고 직접 답변할지, 신뢰할 수 있는 증거를 인용할지, 불확실성을 유지할지 선택할 수 있습니다. 이러한 적응성은 교육에 유용할 뿐만 아니라 어떤 주장이 이의를 제기하고 어떤 소스를 우선시할지에 대한 재량권을 시스템에 부여합니다.
이 연구는 설득력 있는 봇을 공개 대화에 자동으로 배포하는 것을 정당화하지 않습니다. 믿음을 바꾸도록 지시받은 시스템은 특별한 힘을 갖고 있으며, 저자들은 유사한 기술이 잘못된 주장에 대한 믿음을 증가시킬 수도 있다고 지적합니다. 모든 실제 서비스에는 투명한 저작, 신뢰할 수 있는 이벤트 기반, 정치적 타겟팅에 대한 보호 장치, 정확성과 의도하지 않은 효과에 대한 독립적인 테스트가 필요합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
다음에 무엇을 볼 것인가
동료 검토, 두 번의 미국 정치 위기 이후의 재현, 사람들이 연구에 참여하지 않고 이러한 도구를 사용하기로 선택했는지 여부를 보여주는 현장 증거를 살펴보세요.
이는 두 가지 사례 연구를 중심으로 구축된 새로운 사전 인쇄본입니다. 첫 번째 실험은 사전 등록되지 않았고 두 번째 실험은 사전 등록되었으며 둘 다 실제 공유 행동, 투표 또는 장기적인 신뢰보다는 짧은 온라인 상호 작용 직후에 자체 보고된 신념을 측정했습니다.
분석된 샘플에는 공개 응답이 GPT-4o에 의해 음모 또는 불확실로 분류된 참가자만 포함되었지만 저자는 대체 분류 규칙에 따라 유사한 패턴을 보고했습니다. 두 연구 모두 CloudResearch를 통해 미국 성인을 모집했기 때문에 결과가 다른 국가, 언어, 사건 또는 인구에게 전달되지 않을 수 있습니다.
모델은 비보조 지식에 의존하지 않았습니다. 연구자들은 신중하게 수집된 사실 기반과 명시적인 설득 지침을 제공했습니다. 향후 작업에서는 마감 기한이 촉박한 상황에서 누가 이러한 사실을 유지하는지, 오류를 수정하는 방법, 반대 관점을 일관되게 처리하는지, 시스템이 설득을 시도하는 대신 불확실성을 유지해야 하는 경우를 테스트해야 합니다.
또한 명시된 신념을 바꾸는 것과 개인의 이해를 향상시키는 것 사이에는 측정상의 차이가 있습니다. 결과는 관찰된 공유 행동, 소스 확인, 투표 또는 실시간 위기 상황에서 내린 결정이 아닌 짧은 온라인 대화 후에 수집된 자체 보고 등급이었습니다. 이 논문의 후속 조치는 지속성에 대한 초기 증거를 제공하지만 혼합된 결과는 이후 연구가 장기 결과를 사전 등록하고, 감소를 추적하고, 참가자가 단순히 모델의 결론을 반복하는 대신 증거를 직접 설명할 수 있는지 여부를 테스트해야 함을 의미합니다.
복제는 모집단뿐만 아니라 사실 기록의 출처도 다양해야 합니다. 이러한 실험은 연구자 자신의 사실 기반을 제공하고 CloudResearch를 통해 미국 성인을 모집했습니다. 이는 설정을 비정상적으로 제어하지만 다국어 이벤트, 낮은 연결 설정 및 공식 정보가 지연되거나 논쟁을 벌이는 위기에 대한 공개 질문을 남깁니다. 책임감 있는 현장 시험은 모델의 작성자를 가시화하고, 참가자가 개입을 거부하도록 하고, 어떤 증거가 표시되었는지 기록하고, 독립적인 심사관을 사용하여 대화가 새로운 개념을 도입하지 않고 오해를 수정했는지 여부를 확인하도록 합니다. 신뢰, 감정적 반응, 신념 점수와 함께 주장을 공유하려는 의지를 측정해야 합니다.