সংবাদে ফিরে যান
মিডিয়াAI Understanding ব্রিফিং

গবেষণায় দেখা গেছে সংক্ষিপ্ত এআই চ্যাট নতুন ষড়যন্ত্রে বিশ্বাস হ্রাস করেছে

দুটি মার্কিন পরীক্ষায় দেখা গেছে যে উপযোগী Gemini কথোপকথনগুলি নতুনভাবে তৈরি হওয়া ষড়যন্ত্র তত্ত্বগুলিতে অংশগ্রহণকারীদের বিশ্বাসকে সম্পর্কহীন চ্যাটের চেয়ে বেশি এবং সাধারণত স্ট্যাটিক ফ্যাক্ট শীটের চেয়ে বেশি কমিয়ে দেয়।

5 min readRead the primary source
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
Costello and colleagues' research paper on arXiv
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.06151
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

শ্রেণীবিভাগ
একটি টাস্ক যেখানে একটি মডেল এক বা একাধিক পূর্বনির্ধারিত বিভাগে একটি ইনপুট বরাদ্দ করে৷
নিজেকে পরীক্ষা করুনএআই এথিক্স কুইজ

কি হয়েছে

একটি কার্নেগি মেলন, এমআইটি, এবং কর্নেল গবেষণা দল 6 আগস্টে দুটি এলোমেলো কেস স্টাডি পোস্ট করেছে যে ছোট এআই কথোপকথনগুলি ষড়যন্ত্রের বিশ্বাসকে মোকাবেলা করতে পারে কিনা তা পরীক্ষা করে যখন বড় ঘটনাগুলি সম্পর্কে তথ্য এখনও উঠে আসছে।

গবেষকরা 472 মার্কিন প্রাপ্তবয়স্কদের বিশ্লেষণ করেছেন যারা 2024 সালের জুলাইয়ে ডোনাল্ড ট্রাম্পকে হত্যার প্রচেষ্টার পরে ষড়যন্ত্রমূলক মতামত প্রকাশ করেছিলেন এবং 2025 সালের সেপ্টেম্বরে চার্লি কার্কের হত্যার পরে 1,035 জন। অংশগ্রহণকারীদের এলোমেলোভাবে একটি উপযোগী ডিবাঙ্কিং সংলাপ, একটি সম্পর্কহীন এআই কথোপকথন বা সমসাময়িক তথ্যগুলির একটি স্ট্যাটিক তালিকার জন্য বরাদ্দ করা হয়েছিল।

সংলাপ গোষ্ঠীগুলি প্রথম পরীক্ষায় Gemini 1.5 Pro এবং দ্বিতীয় পরীক্ষায় Gemini 2.5 প্রো এর সাথে কমপক্ষে পাঁচটি বিনিময় সম্পন্ন করেছে৷ উভয় মডেলই একটি কিউরেটেড ফ্যাক্ট বেস পেয়েছে যা নিশ্চিত তথ্য, ডিবাঙ্কড দাবি এবং অমীমাংসিত প্রশ্নগুলিকে আলাদা করেছে; দ্বিতীয় মডেলটি শুধুমাত্র বাস্তব তথ্য যাচাই করার জন্য ওয়েবে অনুসন্ধান করতে পারে।

প্রতিটি অংশগ্রহণকারীর নিজস্ব বিবৃত তত্ত্বে বিশ্বাসের 0-থেকে-100 পরিমাপের উপর, উপযোগী সংলাপগুলি প্রথম পরীক্ষায় সম্পর্কহীন-চ্যাট নিয়ন্ত্রণের তুলনায় 6.95 পয়েন্ট এবং দ্বিতীয়টিতে 7.56 পয়েন্ট হ্রাস করেছে। স্ট্যাটিক ফ্যাক্ট শীট থেকে পার্থক্য ছিল 5.60 এবং 6.56 পয়েন্ট। কাগজটি সেই তুলনার জন্য মোটামুটি 0.32 থেকে 0.38 এর মানসম্মত প্রভাবের প্রতিবেদন করে।

দুটি কেস স্টাডি এমন মুহুর্তগুলির কাছাকাছি ডিজাইন করা হয়েছিল যখন বাস্তবিক রেকর্ড এখনও বিকাশ করছিল। প্রথমটি 2024 সালের জুলাইয়ে ডোনাল্ড ট্রাম্পকে হত্যার প্রচেষ্টা অনুসরণ করে; দ্বিতীয়টি 2025 সালের সেপ্টেম্বরে চার্লি কার্কের হত্যাকাণ্ডের পর। অংশগ্রহণকারীদের ষড়যন্ত্রমূলক বা অনিশ্চিত ব্যাখ্যার জন্য স্ক্রীন করা হয়েছিল, তারপরে একটি কথোপকথনের জন্য বরাদ্দ করা হয়েছিল যা তাদের নিজস্ব বিবৃত তত্ত্ব, একটি সম্পর্কহীন এআই চ্যাট বা একটি স্ট্যাটিক সমসাময়িক ফ্যাক্ট শীটকে সম্বোধন করে। দ্বিতীয় অধ্যয়নটি পূর্ব-নিবন্ধিত ছিল, যদিও প্রথমটি ছিল না, তাই প্রতিলিপিটি তথ্যপূর্ণ কিন্তু দুটি স্বাধীন নিশ্চিতকরণ পরীক্ষার সমতুল্য নয়।

উত্স বিবরণ: Costello and colleagues' research paper on arXiv

কেন এটা গুরুত্বপূর্ণ

ফলাফলটি পরামর্শ দেয় যে একটি কথোপকথন ব্যবস্থা একটি সংশোধনের পুনরাবৃত্তি করার চেয়ে আরও বেশি কিছু করতে পারে: এটি সত্য, প্রশ্ন এবং অনিশ্চয়তাকে একজন ব্যক্তি বিশ্বাসের জন্য যে নির্দিষ্ট কারণ দেয় তার সাথে খাপ খাইয়ে নিতে পারে।

এই পার্থক্যটি দ্রুত-চলমান ইভেন্টের সময় কার্যকর হয়, যখন যাচাইকৃত প্রমাণ অসম্পূর্ণ থাকে এবং একটি জেনেরিক ফ্যাক্ট শীট এমন দাবির সমাধান নাও করতে পারে যেটি একজন ব্যক্তি আসলে প্ররোচক বলে মনে করেন। কাগজের কৌশল বিশ্লেষণে দেখা গেছে যে মডেলটি বিশ্বাসযোগ্য উত্স, খোলা প্রশ্ন এবং সতর্কতার দিকে বেশি ঝুঁকেছে যখন সামান্য জানা ছিল, তারপরে দ্বিতীয় ইভেন্টের একটি বড় বাস্তব রেকর্ড থাকলে আরও প্রত্যক্ষ প্রমাণ ব্যবহার করেছে।

লেখকরা পরবর্তী স্পিলওভারের সীমিত প্রমাণও রিপোর্ট করেছেন। প্রথম পরীক্ষার দুই মাস পরে, সংলাপে নিযুক্ত অংশগ্রহণকারীদের পরবর্তী ঘটনার দুটি ষড়যন্ত্রমূলক ব্যাখ্যাকে সমর্থন করার জন্য সমন্বিত নিয়ন্ত্রণের চেয়ে কম সম্ভাবনা ছিল। দ্বিতীয় ফলো-আপে, প্রত্যক্ষ চিকিত্সা নিয়োগ পরবর্তী শ্যুটিং সম্পর্কে বিশ্বাসকে উল্লেখযোগ্যভাবে হ্রাস করেনি, যদিও একটি পৃথক পূর্ব-নিবন্ধিত অধ্যবসায় বিশ্লেষণ এবং একটি বিস্তৃত ষড়যন্ত্রের পরিমাপ ছোট বহন-ওভার প্রভাবের পরামর্শ দিয়েছে।

নকশা দেখায় কেন মিথস্ক্রিয়া একটি স্থির সংশোধনকে ছাড়িয়ে যেতে পারে তা প্রমাণ না করেই যে প্ররোচনা সর্বদা কাম্য। প্রথম গবেষণায় Gemini 1.5 Pro এবং দ্বিতীয়টিতে Gemini 2.5 প্রো নিশ্চিত করা তথ্য, খণ্ডিত দাবি এবং অমীমাংসিত প্রশ্নগুলিকে আলাদা করে গবেষক-নিয়োজিত তথ্যের ভিত্তি পেয়েছে। মডেলটি অংশগ্রহণকারীর নির্দিষ্ট যুক্তি সম্পর্কে জিজ্ঞাসা করতে পারে এবং সরাসরি উত্তর দিতে, বিশ্বাসযোগ্য প্রমাণ উদ্ধৃত করতে বা অনিশ্চয়তা সংরক্ষণ করতে পারে কিনা তা বেছে নিতে পারে। সেই অভিযোজনযোগ্যতা শিক্ষার জন্য উপযোগী, কিন্তু এটা সিস্টেমকে বিচক্ষণতাও দেয় কোন দাবিগুলোকে চ্যালেঞ্জ করতে হবে এবং কোন উৎসগুলোকে অগ্রভাগে নিতে হবে।

অধ্যয়ন জনসাধারণের কথোপকথনে স্বয়ংক্রিয়ভাবে প্ররোচক বট স্থাপনের ন্যায্যতা দেয় না। বিশ্বাস পরিবর্তন করার জন্য নির্দেশিত একটি সিস্টেম অস্বাভাবিক শক্তি ধারণ করে এবং লেখকরা মনে করেন যে অনুরূপ কৌশলগুলি মিথ্যা দাবিতে বিশ্বাস বাড়াতে পারে। যেকোনো বাস্তব পরিষেবার জন্য স্বচ্ছ লেখকত্ব, নির্ভরযোগ্য ইভেন্ট গ্রাউন্ডিং, রাজনৈতিক টার্গেটিংয়ের বিরুদ্ধে সুরক্ষা, এবং নির্ভুলতা এবং অনিচ্ছাকৃত প্রভাবগুলির স্বাধীন পরীক্ষা প্রয়োজন।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Ethics Quiz

Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?

পরবর্তী কি দেখতে

সমকক্ষ পর্যালোচনা, দুটি মার্কিন রাজনৈতিক সংকটের বাইরে প্রতিলিপি, এবং ক্ষেত্র প্রমাণের জন্য দেখুন যে লোকেরা একটি গবেষণায় নিয়োগ না করে এই জাতীয় সরঞ্জাম ব্যবহার করতে পছন্দ করে কিনা।

এটি দুটি কেস স্টাডির চারপাশে নির্মিত একটি নতুন প্রিপ্রিন্ট। প্রথম পরীক্ষাটি পূর্ব-নিবন্ধিত ছিল না, দ্বিতীয়টি ছিল, এবং উভয়ই বাস্তব-বিশ্ব ভাগ করে নেওয়ার আচরণ, ভোটদান, বা দীর্ঘমেয়াদী আস্থার পরিবর্তে একটি সংক্ষিপ্ত অনলাইন ইন্টারঅ্যাকশনের পরপরই স্ব-প্রতিবেদিত বিশ্বাসগুলি পরিমাপ করে।

বিশ্লেষিত নমুনাগুলিতে শুধুমাত্র অংশগ্রহণকারীদের অন্তর্ভুক্ত ছিল যাদের উন্মুক্ত প্রতিক্রিয়াগুলি GPT-4o দ্বারা ষড়যন্ত্রমূলক বা অনিশ্চিত হিসাবে শ্রেণীবদ্ধ করা হয়েছিল, যদিও লেখকরা বিকল্প শ্রেণীবিন্যাস নিয়মের অধীনে অনুরূপ নিদর্শনগুলি রিপোর্ট করেছেন। উভয় গবেষণাই ক্লাউড রিসার্চের মাধ্যমে মার্কিন প্রাপ্তবয়স্কদের নিয়োগ করেছে, তাই ফলাফলগুলি অন্য দেশ, ভাষা, ঘটনা বা জনসংখ্যাতে স্থানান্তরিত নাও হতে পারে।

মডেলগুলি অসহায় জ্ঞানের উপর নির্ভর করছিল না: গবেষকরা যত্ন সহকারে একত্রিত তথ্যের ভিত্তি এবং সুস্পষ্ট প্ররোচনা নির্দেশাবলী সরবরাহ করেছিলেন। ভবিষ্যত কাজের পরীক্ষা করা উচিত যে সময়সীমার চাপে কে সেই তথ্যগুলি বজায় রাখে, কীভাবে ত্রুটিগুলি সংশোধন করা হয়, বিরোধী দৃষ্টিভঙ্গিগুলি ধারাবাহিকভাবে আচরণ করা হয় কিনা এবং কখন একটি সিস্টেমকে বোঝানোর চেষ্টা করার পরিবর্তে অনিশ্চয়তা রক্ষা করা উচিত।

একটি বিবৃত বিশ্বাস পরিবর্তন এবং একজন ব্যক্তির বোঝার উন্নতির মধ্যে একটি পরিমাপের পার্থক্যও রয়েছে। ফলাফলগুলি হল স্ব-প্রতিবেদিত রেটিংগুলি সংক্ষিপ্ত অনলাইন কথোপকথনের পরে সংগৃহীত, শেয়ারিং আচরণ, উত্স চেকিং, ভোটদান বা লাইভ সংকটের সময় নেওয়া সিদ্ধান্তগুলি পর্যবেক্ষণ করা হয়নি। কাগজের ফলো-আপগুলি অধ্যবসায়ের বিষয়ে প্রাথমিক প্রমাণ সরবরাহ করে, কিন্তু মিশ্র ফলাফলের অর্থ হল পরবর্তী গবেষণায় দীর্ঘমেয়াদী ফলাফলগুলিকে প্রাক-নিবন্ধন করা উচিত, অ্যাট্রিশন ট্র্যাক করা উচিত এবং অংশগ্রহণকারীরা কেবল মডেলের উপসংহারের পুনরাবৃত্তি করার পরিবর্তে প্রমাণগুলি নিজেরাই ব্যাখ্যা করতে পারে কিনা তা পরীক্ষা করা উচিত।

প্রতিলিপি বাস্তবিক রেকর্ডের উৎসের পাশাপাশি জনসংখ্যার ভিন্নতা থাকা উচিত। এই পরীক্ষাগুলি গবেষকদের নিজস্ব ফ্যাক্ট বেস সরবরাহ করেছিল এবং ক্লাউড রিসার্চের মাধ্যমে মার্কিন প্রাপ্তবয়স্কদের নিয়োগ করেছিল, যা সেটআপটিকে অস্বাভাবিকভাবে নিয়ন্ত্রিত করে কিন্তু বহুভাষিক ইভেন্ট, নিম্ন-সংযোগের সেটিংস এবং সরকারী তথ্য বিলম্বিত বা বিতর্কিত সংকট সম্পর্কে খোলা প্রশ্ন ছেড়ে দেয়। একটি দায়িত্বশীল ফিল্ড ট্রায়াল মডেলটির লেখকত্বকে দৃশ্যমান করে তুলবে, অংশগ্রহণকারীদের হস্তক্ষেপ প্রত্যাখ্যান করতে দেবে, কোন প্রমাণ দেখানো হয়েছে তা লগ করবে এবং সংলাপটি একটি নতুন প্রবর্তন না করে একটি ভুল ধারণা সংশোধন করেছে কিনা তা পরীক্ষা করতে স্বাধীন বিচারকদের ব্যবহার করবে। এটি বিশ্বাস, মানসিক প্রতিক্রিয়া এবং বিশ্বাসের স্কোরের পাশাপাশি দাবিগুলি ভাগ করার ইচ্ছাকে পরিমাপ করা উচিত।

সম্পর্কিত গাইড এবং কুইজ

এআই নীতিশাস্ত্রএআই নিরাপত্তাAI কি?আপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুন
এই দরকারী পাওয়া গেছে?