กลับไปที่ข่าว
สื่อAI Understanding บรรยายสรุป

การศึกษาพบว่าการแชทด้วย AI สั้น ๆ ลดความเชื่อในการสมรู้ร่วมคิดใหม่

การทดลองในสหรัฐอเมริกา 2 ครั้งพบว่าการสนทนา Gemini ที่ปรับแต่งมาลดความเชื่อของผู้เข้าร่วมในทฤษฎีสมคบคิดที่เพิ่งสร้างขึ้นมากกว่าการแชทที่ไม่เกี่ยวข้อง และมักจะมากกว่าเอกสารข้อเท็จจริงแบบคงที่

5 min readRead the primary source
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
Costello and colleagues' research paper on arXiv
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.06151
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

การจำแนกประเภท
งานที่แบบจำลองกำหนดอินพุตให้กับหมวดหมู่ที่กำหนดไว้ล่วงหน้าอย่างน้อยหนึ่งหมวดหมู่
ทดสอบตัวเองแบบทดสอบจริยธรรมของ AI

เกิดอะไรขึ้น

ทีมวิจัยของ Carnegie Mellon, MIT และ Cornell โพสต์กรณีศึกษาแบบสุ่มสองกรณีในวันที่ 6 สิงหาคม เพื่อทดสอบว่าการสนทนา AI สั้นๆ สามารถต่อต้านความเชื่อเรื่องการสมรู้ร่วมคิดได้หรือไม่ ในขณะที่ข้อเท็จจริงเกี่ยวกับเหตุการณ์สำคัญยังคงปรากฏอยู่

นักวิจัยวิเคราะห์ผู้ใหญ่ 472 คนในสหรัฐฯ ที่แสดงความคิดเห็นแบบสมรู้ร่วมคิดหลังความพยายามลอบสังหารโดนัลด์ ทรัมป์ เมื่อเดือนกรกฎาคมปี 2024 และ 1,035 คนหลังจากการลอบสังหารชาร์ลี เคิร์กเมื่อเดือนกันยายนปี 2025 ผู้เข้าร่วมได้รับการสุ่มให้เข้าร่วมบทสนทนาที่หักล้างการปรับแต่ง การสนทนา AI ที่ไม่เกี่ยวข้อง หรือรายการข้อเท็จจริงที่เกิดขึ้นในขณะเดียวกัน

กลุ่มบทสนทนาเสร็จสิ้นการแลกเปลี่ยนอย่างน้อยห้าครั้งด้วย Gemini 1.5 Pro ในการทดสอบครั้งแรกและ Gemini 2.5 Pro ในการทดสอบครั้งที่สอง ทั้งสองโมเดลได้รับฐานข้อเท็จจริงที่รวบรวมไว้ซึ่งแยกข้อมูลที่ได้รับการยืนยัน คำกล่าวอ้างที่หักล้าง และคำถามที่ยังไม่ได้รับการแก้ไข รุ่นที่สองยังสามารถค้นหาเว็บเพื่อตรวจสอบข้อมูลที่เป็นข้อเท็จจริงเท่านั้น

จากการวัดความเชื่อในทฤษฎีที่ผู้เข้าร่วมแต่ละคนระบุไว้ตั้งแต่ 0 ถึง 100 บทสนทนาที่ได้รับการปรับแต่งนั้นลดลง 6.95 คะแนนเมื่อเทียบกับการควบคุมการแชทที่ไม่เกี่ยวข้องในการทดลองครั้งแรก และ 7.56 คะแนนในการทดลองครั้งที่สอง ส่วนต่างจากเอกสารข้อเท็จจริงคงที่คือ 5.60 และ 6.56 คะแนน บทความนี้รายงานผลกระทบมาตรฐานประมาณ 0.32 ถึง 0.38 สำหรับการเปรียบเทียบเหล่านั้น

The two case studies were designed around moments when the factual record was still developing. The first followed the July 2024 attempt to assassinate Donald Trump; the second followed the September 2025 assassination of Charlie Kirk. Participants were screened for conspiratorial or uncertain interpretations, then assigned to a conversation that addressed their own stated theory, an unrelated AI chat, or a static contemporaneous fact sheet. The second study was preregistered, while the first was not, so the replication is informative but not equivalent to two independent confirmatory trials.

รายละเอียดที่มา: Costello and colleagues' research paper on arXiv

ทำไมมันถึงสำคัญ

ผลที่ได้ชี้ให้เห็นว่าระบบการสนทนาสามารถทำได้มากกว่าการแก้ไขซ้ำๆ โดยสามารถปรับข้อเท็จจริง คำถาม และความไม่แน่นอนให้เข้ากับเหตุผลที่เจาะจงที่บุคคลให้ไว้สำหรับความเชื่อ

ความแตกต่างดังกล่าวมีประโยชน์ในระหว่างเหตุการณ์ที่เปลี่ยนแปลงไปอย่างรวดเร็ว เมื่อหลักฐานที่ได้รับการตรวจสอบแล้วไม่สมบูรณ์ และเอกสารข้อเท็จจริงทั่วไปอาจไม่กล่าวถึงข้อกล่าวอ้างที่บุคคลพบว่าโน้มน้าวใจได้จริง การวิเคราะห์กลยุทธ์ของรายงานพบว่าแบบจำลองอาศัยแหล่งข้อมูลที่น่าเชื่อถือ คำถามปลายเปิด และคำเตือนเมื่อไม่ค่อยมีใครรู้ จากนั้นจึงใช้หลักฐานโดยตรงมากขึ้นเมื่อเหตุการณ์ที่สองมีบันทึกข้อเท็จจริงที่ใหญ่กว่า

ผู้เขียนยังรายงานหลักฐานที่จำกัดของการรั่วไหลในภายหลัง สองเดือนหลังจากการทดลองครั้งแรก ผู้เข้าร่วมที่ได้รับมอบหมายให้เข้าร่วมการสนทนามีโอกาสน้อยกว่ากลุ่มควบคุมที่จะสนับสนุนการตีความแบบสมรู้ร่วมคิดสองครั้งของเหตุการณ์ต่อมา ในการติดตามผลครั้งที่สอง การมอบหมายการรักษาโดยตรงไม่ได้ลดความเชื่อเกี่ยวกับการยิงในภายหลังอย่างมีนัยสำคัญ แม้ว่าการวิเคราะห์ความคงอยู่ที่บันทึกไว้ล่วงหน้าที่แยกต่างหากและมาตรการสมรู้ร่วมคิดที่กว้างขึ้นจะเสนอแนะถึงผลกระทบที่น้อยลง

The design shows why the interaction may outperform a static correction without proving that persuasion is always desirable. Gemini 1.5 Pro in the first study and Gemini 2.5 Pro in the second received researcher-curated fact bases separating confirmed information, debunked claims, and unresolved questions. The model could ask about the participant's specific reasoning and choose whether to answer directly, cite credible evidence, or preserve uncertainty. That adaptability is useful for education, but it also gives the system discretion over which claims to challenge and which sources to foreground.

การศึกษานี้ไม่ได้แสดงให้เห็นถึงการนำบอทโน้มน้าวใจไปใช้ในการสนทนาสาธารณะโดยอัตโนมัติ ระบบที่ได้รับคำสั่งให้เปลี่ยนความเชื่อมีพลังที่ไม่ธรรมดา และผู้เขียนตั้งข้อสังเกตว่าเทคนิคที่คล้ายกันสามารถเพิ่มความเชื่อในการกล่าวอ้างที่เป็นเท็จได้ การบริการที่แท้จริงใดๆ ก็ตามจะต้องมีการประพันธ์ที่โปร่งใส การมีเหตุผลของเหตุการณ์ที่เชื่อถือได้ การป้องกันการกำหนดเป้าหมายทางการเมือง และการทดสอบความถูกต้องและผลกระทบที่ไม่ได้ตั้งใจโดยอิสระ

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Ethics Quiz

Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?

จะดูอะไรต่อไป.

ติดตามการทบทวนโดยผู้ทรงคุณวุฒิ การจำลองแบบหลังวิกฤตการณ์ทางการเมืองของสหรัฐฯ สองครั้ง และหลักฐานภาคสนามที่แสดงให้เห็นว่าผู้คนเลือกที่จะใช้เครื่องมือดังกล่าวโดยไม่ได้รับคัดเลือกเข้าสู่การศึกษาหรือไม่

นี่เป็นฉบับพิมพ์ใหม่ที่สร้างขึ้นเกี่ยวกับกรณีศึกษาสองกรณี การทดลองครั้งแรกไม่ได้ลงทะเบียนล่วงหน้า การทดลองครั้งที่สองคือ และทั้งสองวัดความเชื่อที่รายงานด้วยตนเองทันทีหลังจากการโต้ตอบออนไลน์สั้นๆ แทนที่จะเป็นพฤติกรรมการแบ่งปันในโลกแห่งความเป็นจริง การลงคะแนนเสียง หรือความไว้วางใจในระยะยาว

ตัวอย่างที่วิเคราะห์รวมเฉพาะผู้เข้าร่วมที่มีการตอบกลับแบบเปิดเผยถูกจัดประเภทเป็นผู้สมรู้ร่วมคิดหรือไม่แน่นอนโดย GPT-4o แม้ว่าผู้เขียนจะรายงานรูปแบบที่คล้ายกันภายใต้กฎการจำแนกประเภทอื่น การศึกษาทั้งสองได้คัดเลือกผู้ใหญ่ในสหรัฐอเมริกาผ่าน CloudResearch ดังนั้นข้อค้นพบจึงไม่สามารถถ่ายโอนไปยังประเทศ ภาษา กิจกรรม หรือประชากรอื่นได้

แบบจำลองเหล่านี้ไม่ได้อาศัยความรู้ที่ไม่ได้รับความช่วยเหลือ: นักวิจัยได้จัดเตรียมฐานข้อเท็จจริงที่รวบรวมมาอย่างรอบคอบและคำแนะนำในการโน้มน้าวใจที่ชัดเจน งานในอนาคตควรทดสอบว่าใครเป็นผู้รักษาข้อเท็จจริงเหล่านั้นภายใต้แรงกดดันด้านกำหนดเวลา วิธีแก้ไขข้อผิดพลาด มุมมองที่ตรงกันข้ามได้รับการปฏิบัติอย่างสม่ำเสมอ และเมื่อใดที่ระบบควรรักษาความไม่แน่นอนแทนที่จะพยายามโน้มน้าวใจ

There is also a measurement distinction between changing a stated belief and improving a person's understanding. The outcomes were self-reported ratings collected after short online conversations, not observed sharing behavior, source checking, voting, or decisions made during a live crisis. The paper's follow-ups provide early evidence about persistence, but the mixed results mean a later study should pre-register long-term outcomes, track attrition, and test whether participants can explain the evidence themselves rather than simply repeating the model's conclusion.

Replication should vary the source of the factual record as well as the population. These experiments supplied researchers' own fact bases and recruited US adults through CloudResearch, which makes the setup unusually controlled but leaves open questions about multilingual events, lower-connectivity settings, and crises in which official information is delayed or disputed. A responsible field trial would make the model's authorship visible, let participants decline the intervention, log which evidence was shown, and use independent adjudicators to check whether the dialogue corrected a misconception without introducing a new one. It should measure trust, emotional response, and willingness to share claims alongside belief scores.

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

จริยธรรม AIความปลอดภัยของเอไอเอไอคืออะไร?ทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเรา
พบว่าสิ่งนี้มีประโยชน์หรือไม่?