خبروں پر واپس جائیں۔
میڈیاAI Understanding بریفنگ

مطالعہ سے پتہ چلتا ہے کہ مختصر AI چیٹس نے نئی سازشوں میں یقین کو کم کیا۔

دو امریکی تجربات سے معلوم ہوا کہ Gemini کے مطابق گفتگو نے شرکاء کے نئے تشکیل شدہ سازشی نظریات پر یقین کو غیر متعلقہ چیٹس سے زیادہ اور عام طور پر جامد حقائق کے شیٹس سے زیادہ کم کیا۔

5 min readRead the primary source
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
Costello and colleagues' research paper on arXiv
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.06151
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

درجہ بندی
ایسا کام جہاں ایک ماڈل ایک یا زیادہ پہلے سے طے شدہ زمروں کو ان پٹ تفویض کرتا ہے۔
اپنے آپ کو جانچیں۔AI اخلاقیات کوئز

کیا ہوا؟

کارنیگی میلن، ایم آئی ٹی، اور کارنیل ریسرچ ٹیم نے 6 اگست کو دو بے ترتیب کیس اسٹڈیز پوسٹ کیں جس میں جانچ کی گئی کہ آیا مختصر AI گفتگو سازشی عقائد کا مقابلہ کر سکتی ہے جب کہ بڑے واقعات کے بارے میں حقائق اب بھی سامنے آ رہے تھے۔

محققین نے 472 امریکی بالغوں کا تجزیہ کیا جنہوں نے جولائی 2024 میں ڈونلڈ ٹرمپ کے قتل کی کوشش کے بعد سازشی خیالات کا اظہار کیا اور ستمبر 2025 میں چارلی کرک کے قتل کے بعد 1,035 افراد کا۔ شرکاء کو تصادفی طور پر ایک موزوں ڈیبنکنگ ڈائیلاگ، ایک غیر متعلقہ AI گفتگو، یا ہم عصر حقائق کی ایک مستحکم فہرست کے لیے تفویض کیا گیا تھا۔

ڈائیلاگ گروپس نے پہلے تجربے میں Gemini 1.5 پرو اور دوسرے میں Gemini 2.5 پرو کے ساتھ کم از کم پانچ تبادلے مکمل کیے۔ دونوں ماڈلز کو ایک کیوریٹڈ فیکٹ بیس ملا جس نے تصدیق شدہ معلومات، ڈیبنک دعوے، اور حل نہ ہونے والے سوالات کو الگ کیا۔ دوسرا ماڈل بھی ویب پر صرف حقائق کی تصدیق کے لیے تلاش کر سکتا ہے۔

ہر شریک کے اپنے بیان کردہ تھیوری پر یقین کے 0 سے 100 پیمانہ پر، تیار کردہ مکالموں نے پہلے تجربے میں غیر متعلقہ چیٹ کنٹرول کے مقابلے میں 6.95 پوائنٹس اور دوسرے میں 7.56 پوائنٹس کی کمی کی۔ سٹیٹک فیکٹ شیٹ سے فرق 5.60 اور 6.56 پوائنٹس تھے۔ کاغذ ان موازنہوں کے لیے تقریباً 0.32 سے 0.38 کے معیاری اثرات کی رپورٹ کرتا ہے۔

The two case studies were designed around moments when the factual record was still developing. The first followed the July 2024 attempt to assassinate Donald Trump; the second followed the September 2025 assassination of Charlie Kirk. Participants were screened for conspiratorial or uncertain interpretations, then assigned to a conversation that addressed their own stated theory, an unrelated AI chat, or a static contemporaneous fact sheet. The second study was preregistered, while the first was not, so the replication is informative but not equivalent to two independent confirmatory trials.

ماخذ کی تفصیلات: Costello and colleagues' research paper on arXiv

یہ کیوں اہمیت رکھتا ہے۔

نتیجہ یہ بتاتا ہے کہ بات چیت کا نظام اصلاح کو دہرانے سے زیادہ کچھ کر سکتا ہے: یہ حقائق، سوالات اور غیر یقینی صورتحال کو اس مخصوص وجہ کے مطابق ڈھال سکتا ہے جو ایک شخص کسی عقیدے کے لیے دیتا ہے۔

یہ فرق تیز رفتاری سے چلنے والے واقعات کے دوران مفید ہے، جب تصدیق شدہ شواہد نامکمل ہوں اور ہو سکتا ہے کہ ایک عام فیکٹ شیٹ اس دعوے پر توجہ نہ دے سکے جو کسی شخص کو حقیقت میں قائل کرنے والا لگتا ہے۔ کاغذ کے حکمت عملی کے تجزیے سے معلوم ہوا کہ ماڈل نے معتبر ذرائع، کھلے سوالات اور احتیاط پر زیادہ انحصار کیا جب بہت کم معلوم تھا، پھر جب دوسرے واقعے کا حقیقت پر مبنی ریکارڈ بڑا تھا تو براہ راست ثبوت کا استعمال کیا۔

مصنفین بعد میں پھیلنے کے محدود ثبوت کی بھی اطلاع دیتے ہیں۔ پہلے تجربے کے دو ماہ بعد، مکالمے کے لیے تفویض کیے گئے شرکاء کے بعد کے واقعے کی دو سازشی تشریحات کی توثیق کرنے کے لیے پولڈ کنٹرول سے کم امکان تھا۔ دوسرے فالو اپ میں، براہ راست علاج کی تفویض نے بعد میں ہونے والی شوٹنگ کے بارے میں عقائد کو نمایاں طور پر کم نہیں کیا، حالانکہ ایک علیحدہ پہلے سے رجسٹرڈ استقامت کا تجزیہ اور ایک وسیع تر سازشی اقدام نے چھوٹے لے جانے والے اثرات کی تجویز پیش کی۔

The design shows why the interaction may outperform a static correction without proving that persuasion is always desirable. Gemini 1.5 Pro in the first study and Gemini 2.5 Pro in the second received researcher-curated fact bases separating confirmed information, debunked claims, and unresolved questions. The model could ask about the participant's specific reasoning and choose whether to answer directly, cite credible evidence, or preserve uncertainty. That adaptability is useful for education, but it also gives the system discretion over which claims to challenge and which sources to foreground.

مطالعہ عوامی گفتگو میں قائل کرنے والے بوٹس کو خود بخود تعینات کرنے کا جواز پیش نہیں کرتا ہے۔ عقائد کو تبدیل کرنے کی ہدایت کی گئی ایک نظام میں غیر معمولی طاقت ہوتی ہے، اور مصنفین نوٹ کرتے ہیں کہ اسی طرح کی تکنیکیں جھوٹے دعوؤں میں بھی یقین کو بڑھا سکتی ہیں۔ کسی بھی حقیقی خدمت کے لیے شفاف تصنیف، قابل اعتماد واقعہ کی بنیاد، سیاسی ہدف کے خلاف حفاظتی اقدامات، اور درستگی اور غیر ارادی اثرات کے آزاد ٹیسٹ کی ضرورت ہوگی۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Ethics Quiz

Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?

آگے کیا دیکھنا ہے۔

ہم مرتبہ جائزہ، دو امریکی سیاسی بحرانوں سے آگے کی نقل، اور فیلڈ شواہد کے لیے دیکھیں کہ آیا لوگ مطالعہ میں بھرتی کیے بغیر اس طرح کے ٹول کو استعمال کرنے کا انتخاب کرتے ہیں۔

یہ ایک نیا پری پرنٹ ہے جو دو کیس اسٹڈیز کے ارد گرد بنایا گیا ہے۔ پہلا تجربہ پہلے سے رجسٹرڈ نہیں تھا، دوسرا تھا، اور دونوں نے حقیقی دنیا میں اشتراک کے رویے، ووٹنگ، یا طویل مدتی اعتماد کے بجائے ایک مختصر آن لائن تعامل کے فوراً بعد خود اطلاع شدہ عقائد کی پیمائش کی۔

تجزیہ کردہ نمونوں میں صرف وہ شرکاء شامل تھے جن کے کھلے ردعمل کو GPT-4o کے ذریعہ سازشی یا غیر یقینی کے طور پر درجہ بندی کیا گیا تھا، حالانکہ مصنفین متبادل درجہ بندی کے قواعد کے تحت اسی طرح کے نمونوں کی اطلاع دیتے ہیں۔ دونوں مطالعات نے CloudResearch کے ذریعے امریکی بالغوں کو بھرتی کیا، لہذا نتائج دوسرے ممالک، زبانوں، واقعات، یا آبادی میں منتقل نہیں ہوسکتے ہیں۔

ماڈل غیر امدادی علم پر انحصار نہیں کر رہے تھے: محققین نے احتیاط سے جمع کردہ حقائق کی بنیادیں اور واضح قائل ہدایات فراہم کیں۔ مستقبل کے کام کو جانچنا چاہئے کہ کون ان حقائق کو ڈیڈ لائن کے دباؤ میں برقرار رکھتا ہے، غلطیوں کو کیسے درست کیا جاتا ہے، کیا مخالف نقطہ نظر کو مستقل طور پر برتا جاتا ہے، اور جب کسی نظام کو قائل کرنے کی کوشش کرنے کی بجائے غیر یقینی صورتحال کو برقرار رکھنا چاہئے۔

There is also a measurement distinction between changing a stated belief and improving a person's understanding. The outcomes were self-reported ratings collected after short online conversations, not observed sharing behavior, source checking, voting, or decisions made during a live crisis. The paper's follow-ups provide early evidence about persistence, but the mixed results mean a later study should pre-register long-term outcomes, track attrition, and test whether participants can explain the evidence themselves rather than simply repeating the model's conclusion.

Replication should vary the source of the factual record as well as the population. These experiments supplied researchers' own fact bases and recruited US adults through CloudResearch, which makes the setup unusually controlled but leaves open questions about multilingual events, lower-connectivity settings, and crises in which official information is delayed or disputed. A responsible field trial would make the model's authorship visible, let participants decline the intervention, log which evidence was shown, and use independent adjudicators to check whether the dialogue corrected a misconception without introducing a new one. It should measure trust, emotional response, and willingness to share claims alongside belief scores.

متعلقہ گائیڈز اور کوئزز

اے آئی اخلاقیاتاے آئی سیفٹیAI کیا ہے؟آپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیں
یہ مفید پایا؟