เกิดอะไรขึ้น
ทีมวิจัยของ Carnegie Mellon, MIT และ Cornell โพสต์กรณีศึกษาแบบสุ่มสองกรณีในวันที่ 6 สิงหาคม เพื่อทดสอบว่าการสนทนา AI สั้นๆ สามารถต่อต้านความเชื่อเรื่องการสมรู้ร่วมคิดได้หรือไม่ ในขณะที่ข้อเท็จจริงเกี่ยวกับเหตุการณ์สำคัญยังคงปรากฏอยู่
นักวิจัยวิเคราะห์ผู้ใหญ่ 472 คนในสหรัฐฯ ที่แสดงความคิดเห็นแบบสมรู้ร่วมคิดหลังความพยายามลอบสังหารโดนัลด์ ทรัมป์ เมื่อเดือนกรกฎาคมปี 2024 และ 1,035 คนหลังจากการลอบสังหารชาร์ลี เคิร์กเมื่อเดือนกันยายนปี 2025 ผู้เข้าร่วมได้รับการสุ่มให้เข้าร่วมบทสนทนาที่หักล้างการปรับแต่ง การสนทนา AI ที่ไม่เกี่ยวข้อง หรือรายการข้อเท็จจริงที่เกิดขึ้นในขณะเดียวกัน
กลุ่มบทสนทนาเสร็จสิ้นการแลกเปลี่ยนอย่างน้อยห้าครั้งด้วย Gemini 1.5 Pro ในการทดสอบครั้งแรกและ Gemini 2.5 Pro ในการทดสอบครั้งที่สอง ทั้งสองโมเดลได้รับฐานข้อเท็จจริงที่รวบรวมไว้ซึ่งแยกข้อมูลที่ได้รับการยืนยัน คำกล่าวอ้างที่หักล้าง และคำถามที่ยังไม่ได้รับการแก้ไข รุ่นที่สองยังสามารถค้นหาเว็บเพื่อตรวจสอบข้อมูลที่เป็นข้อเท็จจริงเท่านั้น
จากการวัดความเชื่อในทฤษฎีที่ผู้เข้าร่วมแต่ละคนระบุไว้ตั้งแต่ 0 ถึง 100 บทสนทนาที่ได้รับการปรับแต่งนั้นลดลง 6.95 คะแนนเมื่อเทียบกับการควบคุมการแชทที่ไม่เกี่ยวข้องในการทดลองครั้งแรก และ 7.56 คะแนนในการทดลองครั้งที่สอง ส่วนต่างจากเอกสารข้อเท็จจริงคงที่คือ 5.60 และ 6.56 คะแนน บทความนี้รายงานผลกระทบมาตรฐานประมาณ 0.32 ถึง 0.38 สำหรับการเปรียบเทียบเหล่านั้น
The two case studies were designed around moments when the factual record was still developing. The first followed the July 2024 attempt to assassinate Donald Trump; the second followed the September 2025 assassination of Charlie Kirk. Participants were screened for conspiratorial or uncertain interpretations, then assigned to a conversation that addressed their own stated theory, an unrelated AI chat, or a static contemporaneous fact sheet. The second study was preregistered, while the first was not, so the replication is informative but not equivalent to two independent confirmatory trials.
รายละเอียดที่มา: Costello and colleagues' research paper on arXiv ↗
ทำไมมันถึงสำคัญ
ผลที่ได้ชี้ให้เห็นว่าระบบการสนทนาสามารถทำได้มากกว่าการแก้ไขซ้ำๆ โดยสามารถปรับข้อเท็จจริง คำถาม และความไม่แน่นอนให้เข้ากับเหตุผลที่เจาะจงที่บุคคลให้ไว้สำหรับความเชื่อ
ความแตกต่างดังกล่าวมีประโยชน์ในระหว่างเหตุการณ์ที่เปลี่ยนแปลงไปอย่างรวดเร็ว เมื่อหลักฐานที่ได้รับการตรวจสอบแล้วไม่สมบูรณ์ และเอกสารข้อเท็จจริงทั่วไปอาจไม่กล่าวถึงข้อกล่าวอ้างที่บุคคลพบว่าโน้มน้าวใจได้จริง การวิเคราะห์กลยุทธ์ของรายงานพบว่าแบบจำลองอาศัยแหล่งข้อมูลที่น่าเชื่อถือ คำถามปลายเปิด และคำเตือนเมื่อไม่ค่อยมีใครรู้ จากนั้นจึงใช้หลักฐานโดยตรงมากขึ้นเมื่อเหตุการณ์ที่สองมีบันทึกข้อเท็จจริงที่ใหญ่กว่า
ผู้เขียนยังรายงานหลักฐานที่จำกัดของการรั่วไหลในภายหลัง สองเดือนหลังจากการทดลองครั้งแรก ผู้เข้าร่วมที่ได้รับมอบหมายให้เข้าร่วมการสนทนามีโอกาสน้อยกว่ากลุ่มควบคุมที่จะสนับสนุนการตีความแบบสมรู้ร่วมคิดสองครั้งของเหตุการณ์ต่อมา ในการติดตามผลครั้งที่สอง การมอบหมายการรักษาโดยตรงไม่ได้ลดความเชื่อเกี่ยวกับการยิงในภายหลังอย่างมีนัยสำคัญ แม้ว่าการวิเคราะห์ความคงอยู่ที่บันทึกไว้ล่วงหน้าที่แยกต่างหากและมาตรการสมรู้ร่วมคิดที่กว้างขึ้นจะเสนอแนะถึงผลกระทบที่น้อยลง
The design shows why the interaction may outperform a static correction without proving that persuasion is always desirable. Gemini 1.5 Pro in the first study and Gemini 2.5 Pro in the second received researcher-curated fact bases separating confirmed information, debunked claims, and unresolved questions. The model could ask about the participant's specific reasoning and choose whether to answer directly, cite credible evidence, or preserve uncertainty. That adaptability is useful for education, but it also gives the system discretion over which claims to challenge and which sources to foreground.
การศึกษานี้ไม่ได้แสดงให้เห็นถึงการนำบอทโน้มน้าวใจไปใช้ในการสนทนาสาธารณะโดยอัตโนมัติ ระบบที่ได้รับคำสั่งให้เปลี่ยนความเชื่อมีพลังที่ไม่ธรรมดา และผู้เขียนตั้งข้อสังเกตว่าเทคนิคที่คล้ายกันสามารถเพิ่มความเชื่อในการกล่าวอ้างที่เป็นเท็จได้ การบริการที่แท้จริงใดๆ ก็ตามจะต้องมีการประพันธ์ที่โปร่งใส การมีเหตุผลของเหตุการณ์ที่เชื่อถือได้ การป้องกันการกำหนดเป้าหมายทางการเมือง และการทดสอบความถูกต้องและผลกระทบที่ไม่ได้ตั้งใจโดยอิสระ
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
จะดูอะไรต่อไป.
ติดตามการทบทวนโดยผู้ทรงคุณวุฒิ การจำลองแบบหลังวิกฤตการณ์ทางการเมืองของสหรัฐฯ สองครั้ง และหลักฐานภาคสนามที่แสดงให้เห็นว่าผู้คนเลือกที่จะใช้เครื่องมือดังกล่าวโดยไม่ได้รับคัดเลือกเข้าสู่การศึกษาหรือไม่
นี่เป็นฉบับพิมพ์ใหม่ที่สร้างขึ้นเกี่ยวกับกรณีศึกษาสองกรณี การทดลองครั้งแรกไม่ได้ลงทะเบียนล่วงหน้า การทดลองครั้งที่สองคือ และทั้งสองวัดความเชื่อที่รายงานด้วยตนเองทันทีหลังจากการโต้ตอบออนไลน์สั้นๆ แทนที่จะเป็นพฤติกรรมการแบ่งปันในโลกแห่งความเป็นจริง การลงคะแนนเสียง หรือความไว้วางใจในระยะยาว
ตัวอย่างที่วิเคราะห์รวมเฉพาะผู้เข้าร่วมที่มีการตอบกลับแบบเปิดเผยถูกจัดประเภทเป็นผู้สมรู้ร่วมคิดหรือไม่แน่นอนโดย GPT-4o แม้ว่าผู้เขียนจะรายงานรูปแบบที่คล้ายกันภายใต้กฎการจำแนกประเภทอื่น การศึกษาทั้งสองได้คัดเลือกผู้ใหญ่ในสหรัฐอเมริกาผ่าน CloudResearch ดังนั้นข้อค้นพบจึงไม่สามารถถ่ายโอนไปยังประเทศ ภาษา กิจกรรม หรือประชากรอื่นได้
แบบจำลองเหล่านี้ไม่ได้อาศัยความรู้ที่ไม่ได้รับความช่วยเหลือ: นักวิจัยได้จัดเตรียมฐานข้อเท็จจริงที่รวบรวมมาอย่างรอบคอบและคำแนะนำในการโน้มน้าวใจที่ชัดเจน งานในอนาคตควรทดสอบว่าใครเป็นผู้รักษาข้อเท็จจริงเหล่านั้นภายใต้แรงกดดันด้านกำหนดเวลา วิธีแก้ไขข้อผิดพลาด มุมมองที่ตรงกันข้ามได้รับการปฏิบัติอย่างสม่ำเสมอ และเมื่อใดที่ระบบควรรักษาความไม่แน่นอนแทนที่จะพยายามโน้มน้าวใจ
There is also a measurement distinction between changing a stated belief and improving a person's understanding. The outcomes were self-reported ratings collected after short online conversations, not observed sharing behavior, source checking, voting, or decisions made during a live crisis. The paper's follow-ups provide early evidence about persistence, but the mixed results mean a later study should pre-register long-term outcomes, track attrition, and test whether participants can explain the evidence themselves rather than simply repeating the model's conclusion.
Replication should vary the source of the factual record as well as the population. These experiments supplied researchers' own fact bases and recruited US adults through CloudResearch, which makes the setup unusually controlled but leaves open questions about multilingual events, lower-connectivity settings, and crises in which official information is delayed or disputed. A responsible field trial would make the model's authorship visible, let participants decline the intervention, log which evidence was shown, and use independent adjudicators to check whether the dialogue corrected a misconception without introducing a new one. It should measure trust, emotional response, and willingness to share claims alongside belief scores.