কি হয়েছে
একটি কার্নেগি মেলন, এমআইটি, এবং কর্নেল গবেষণা দল 6 আগস্টে দুটি এলোমেলো কেস স্টাডি পোস্ট করেছে যে ছোট এআই কথোপকথনগুলি ষড়যন্ত্রের বিশ্বাসকে মোকাবেলা করতে পারে কিনা তা পরীক্ষা করে যখন বড় ঘটনাগুলি সম্পর্কে তথ্য এখনও উঠে আসছে।
গবেষকরা 472 মার্কিন প্রাপ্তবয়স্কদের বিশ্লেষণ করেছেন যারা 2024 সালের জুলাইয়ে ডোনাল্ড ট্রাম্পকে হত্যার প্রচেষ্টার পরে ষড়যন্ত্রমূলক মতামত প্রকাশ করেছিলেন এবং 2025 সালের সেপ্টেম্বরে চার্লি কার্কের হত্যার পরে 1,035 জন। অংশগ্রহণকারীদের এলোমেলোভাবে একটি উপযোগী ডিবাঙ্কিং সংলাপ, একটি সম্পর্কহীন এআই কথোপকথন বা সমসাময়িক তথ্যগুলির একটি স্ট্যাটিক তালিকার জন্য বরাদ্দ করা হয়েছিল।
সংলাপ গোষ্ঠীগুলি প্রথম পরীক্ষায় Gemini 1.5 Pro এবং দ্বিতীয় পরীক্ষায় Gemini 2.5 প্রো এর সাথে কমপক্ষে পাঁচটি বিনিময় সম্পন্ন করেছে৷ উভয় মডেলই একটি কিউরেটেড ফ্যাক্ট বেস পেয়েছে যা নিশ্চিত তথ্য, ডিবাঙ্কড দাবি এবং অমীমাংসিত প্রশ্নগুলিকে আলাদা করেছে; দ্বিতীয় মডেলটি শুধুমাত্র বাস্তব তথ্য যাচাই করার জন্য ওয়েবে অনুসন্ধান করতে পারে।
প্রতিটি অংশগ্রহণকারীর নিজস্ব বিবৃত তত্ত্বে বিশ্বাসের 0-থেকে-100 পরিমাপের উপর, উপযোগী সংলাপগুলি প্রথম পরীক্ষায় সম্পর্কহীন-চ্যাট নিয়ন্ত্রণের তুলনায় 6.95 পয়েন্ট এবং দ্বিতীয়টিতে 7.56 পয়েন্ট হ্রাস করেছে। স্ট্যাটিক ফ্যাক্ট শীট থেকে পার্থক্য ছিল 5.60 এবং 6.56 পয়েন্ট। কাগজটি সেই তুলনার জন্য মোটামুটি 0.32 থেকে 0.38 এর মানসম্মত প্রভাবের প্রতিবেদন করে।
দুটি কেস স্টাডি এমন মুহুর্তগুলির কাছাকাছি ডিজাইন করা হয়েছিল যখন বাস্তবিক রেকর্ড এখনও বিকাশ করছিল। প্রথমটি 2024 সালের জুলাইয়ে ডোনাল্ড ট্রাম্পকে হত্যার প্রচেষ্টা অনুসরণ করে; দ্বিতীয়টি 2025 সালের সেপ্টেম্বরে চার্লি কার্কের হত্যাকাণ্ডের পর। অংশগ্রহণকারীদের ষড়যন্ত্রমূলক বা অনিশ্চিত ব্যাখ্যার জন্য স্ক্রীন করা হয়েছিল, তারপরে একটি কথোপকথনের জন্য বরাদ্দ করা হয়েছিল যা তাদের নিজস্ব বিবৃত তত্ত্ব, একটি সম্পর্কহীন এআই চ্যাট বা একটি স্ট্যাটিক সমসাময়িক ফ্যাক্ট শীটকে সম্বোধন করে। দ্বিতীয় অধ্যয়নটি পূর্ব-নিবন্ধিত ছিল, যদিও প্রথমটি ছিল না, তাই প্রতিলিপিটি তথ্যপূর্ণ কিন্তু দুটি স্বাধীন নিশ্চিতকরণ পরীক্ষার সমতুল্য নয়।
উত্স বিবরণ: Costello and colleagues' research paper on arXiv ↗
কেন এটা গুরুত্বপূর্ণ
ফলাফলটি পরামর্শ দেয় যে একটি কথোপকথন ব্যবস্থা একটি সংশোধনের পুনরাবৃত্তি করার চেয়ে আরও বেশি কিছু করতে পারে: এটি সত্য, প্রশ্ন এবং অনিশ্চয়তাকে একজন ব্যক্তি বিশ্বাসের জন্য যে নির্দিষ্ট কারণ দেয় তার সাথে খাপ খাইয়ে নিতে পারে।
এই পার্থক্যটি দ্রুত-চলমান ইভেন্টের সময় কার্যকর হয়, যখন যাচাইকৃত প্রমাণ অসম্পূর্ণ থাকে এবং একটি জেনেরিক ফ্যাক্ট শীট এমন দাবির সমাধান নাও করতে পারে যেটি একজন ব্যক্তি আসলে প্ররোচক বলে মনে করেন। কাগজের কৌশল বিশ্লেষণে দেখা গেছে যে মডেলটি বিশ্বাসযোগ্য উত্স, খোলা প্রশ্ন এবং সতর্কতার দিকে বেশি ঝুঁকেছে যখন সামান্য জানা ছিল, তারপরে দ্বিতীয় ইভেন্টের একটি বড় বাস্তব রেকর্ড থাকলে আরও প্রত্যক্ষ প্রমাণ ব্যবহার করেছে।
লেখকরা পরবর্তী স্পিলওভারের সীমিত প্রমাণও রিপোর্ট করেছেন। প্রথম পরীক্ষার দুই মাস পরে, সংলাপে নিযুক্ত অংশগ্রহণকারীদের পরবর্তী ঘটনার দুটি ষড়যন্ত্রমূলক ব্যাখ্যাকে সমর্থন করার জন্য সমন্বিত নিয়ন্ত্রণের চেয়ে কম সম্ভাবনা ছিল। দ্বিতীয় ফলো-আপে, প্রত্যক্ষ চিকিত্সা নিয়োগ পরবর্তী শ্যুটিং সম্পর্কে বিশ্বাসকে উল্লেখযোগ্যভাবে হ্রাস করেনি, যদিও একটি পৃথক পূর্ব-নিবন্ধিত অধ্যবসায় বিশ্লেষণ এবং একটি বিস্তৃত ষড়যন্ত্রের পরিমাপ ছোট বহন-ওভার প্রভাবের পরামর্শ দিয়েছে।
নকশা দেখায় কেন মিথস্ক্রিয়া একটি স্থির সংশোধনকে ছাড়িয়ে যেতে পারে তা প্রমাণ না করেই যে প্ররোচনা সর্বদা কাম্য। প্রথম গবেষণায় Gemini 1.5 Pro এবং দ্বিতীয়টিতে Gemini 2.5 প্রো নিশ্চিত করা তথ্য, খণ্ডিত দাবি এবং অমীমাংসিত প্রশ্নগুলিকে আলাদা করে গবেষক-নিয়োজিত তথ্যের ভিত্তি পেয়েছে। মডেলটি অংশগ্রহণকারীর নির্দিষ্ট যুক্তি সম্পর্কে জিজ্ঞাসা করতে পারে এবং সরাসরি উত্তর দিতে, বিশ্বাসযোগ্য প্রমাণ উদ্ধৃত করতে বা অনিশ্চয়তা সংরক্ষণ করতে পারে কিনা তা বেছে নিতে পারে। সেই অভিযোজনযোগ্যতা শিক্ষার জন্য উপযোগী, কিন্তু এটা সিস্টেমকে বিচক্ষণতাও দেয় কোন দাবিগুলোকে চ্যালেঞ্জ করতে হবে এবং কোন উৎসগুলোকে অগ্রভাগে নিতে হবে।
অধ্যয়ন জনসাধারণের কথোপকথনে স্বয়ংক্রিয়ভাবে প্ররোচক বট স্থাপনের ন্যায্যতা দেয় না। বিশ্বাস পরিবর্তন করার জন্য নির্দেশিত একটি সিস্টেম অস্বাভাবিক শক্তি ধারণ করে এবং লেখকরা মনে করেন যে অনুরূপ কৌশলগুলি মিথ্যা দাবিতে বিশ্বাস বাড়াতে পারে। যেকোনো বাস্তব পরিষেবার জন্য স্বচ্ছ লেখকত্ব, নির্ভরযোগ্য ইভেন্ট গ্রাউন্ডিং, রাজনৈতিক টার্গেটিংয়ের বিরুদ্ধে সুরক্ষা, এবং নির্ভুলতা এবং অনিচ্ছাকৃত প্রভাবগুলির স্বাধীন পরীক্ষা প্রয়োজন।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
পরবর্তী কি দেখতে
সমকক্ষ পর্যালোচনা, দুটি মার্কিন রাজনৈতিক সংকটের বাইরে প্রতিলিপি, এবং ক্ষেত্র প্রমাণের জন্য দেখুন যে লোকেরা একটি গবেষণায় নিয়োগ না করে এই জাতীয় সরঞ্জাম ব্যবহার করতে পছন্দ করে কিনা।
এটি দুটি কেস স্টাডির চারপাশে নির্মিত একটি নতুন প্রিপ্রিন্ট। প্রথম পরীক্ষাটি পূর্ব-নিবন্ধিত ছিল না, দ্বিতীয়টি ছিল, এবং উভয়ই বাস্তব-বিশ্ব ভাগ করে নেওয়ার আচরণ, ভোটদান, বা দীর্ঘমেয়াদী আস্থার পরিবর্তে একটি সংক্ষিপ্ত অনলাইন ইন্টারঅ্যাকশনের পরপরই স্ব-প্রতিবেদিত বিশ্বাসগুলি পরিমাপ করে।
বিশ্লেষিত নমুনাগুলিতে শুধুমাত্র অংশগ্রহণকারীদের অন্তর্ভুক্ত ছিল যাদের উন্মুক্ত প্রতিক্রিয়াগুলি GPT-4o দ্বারা ষড়যন্ত্রমূলক বা অনিশ্চিত হিসাবে শ্রেণীবদ্ধ করা হয়েছিল, যদিও লেখকরা বিকল্প শ্রেণীবিন্যাস নিয়মের অধীনে অনুরূপ নিদর্শনগুলি রিপোর্ট করেছেন। উভয় গবেষণাই ক্লাউড রিসার্চের মাধ্যমে মার্কিন প্রাপ্তবয়স্কদের নিয়োগ করেছে, তাই ফলাফলগুলি অন্য দেশ, ভাষা, ঘটনা বা জনসংখ্যাতে স্থানান্তরিত নাও হতে পারে।
মডেলগুলি অসহায় জ্ঞানের উপর নির্ভর করছিল না: গবেষকরা যত্ন সহকারে একত্রিত তথ্যের ভিত্তি এবং সুস্পষ্ট প্ররোচনা নির্দেশাবলী সরবরাহ করেছিলেন। ভবিষ্যত কাজের পরীক্ষা করা উচিত যে সময়সীমার চাপে কে সেই তথ্যগুলি বজায় রাখে, কীভাবে ত্রুটিগুলি সংশোধন করা হয়, বিরোধী দৃষ্টিভঙ্গিগুলি ধারাবাহিকভাবে আচরণ করা হয় কিনা এবং কখন একটি সিস্টেমকে বোঝানোর চেষ্টা করার পরিবর্তে অনিশ্চয়তা রক্ষা করা উচিত।
একটি বিবৃত বিশ্বাস পরিবর্তন এবং একজন ব্যক্তির বোঝার উন্নতির মধ্যে একটি পরিমাপের পার্থক্যও রয়েছে। ফলাফলগুলি হল স্ব-প্রতিবেদিত রেটিংগুলি সংক্ষিপ্ত অনলাইন কথোপকথনের পরে সংগৃহীত, শেয়ারিং আচরণ, উত্স চেকিং, ভোটদান বা লাইভ সংকটের সময় নেওয়া সিদ্ধান্তগুলি পর্যবেক্ষণ করা হয়নি। কাগজের ফলো-আপগুলি অধ্যবসায়ের বিষয়ে প্রাথমিক প্রমাণ সরবরাহ করে, কিন্তু মিশ্র ফলাফলের অর্থ হল পরবর্তী গবেষণায় দীর্ঘমেয়াদী ফলাফলগুলিকে প্রাক-নিবন্ধন করা উচিত, অ্যাট্রিশন ট্র্যাক করা উচিত এবং অংশগ্রহণকারীরা কেবল মডেলের উপসংহারের পুনরাবৃত্তি করার পরিবর্তে প্রমাণগুলি নিজেরাই ব্যাখ্যা করতে পারে কিনা তা পরীক্ষা করা উচিত।
প্রতিলিপি বাস্তবিক রেকর্ডের উৎসের পাশাপাশি জনসংখ্যার ভিন্নতা থাকা উচিত। এই পরীক্ষাগুলি গবেষকদের নিজস্ব ফ্যাক্ট বেস সরবরাহ করেছিল এবং ক্লাউড রিসার্চের মাধ্যমে মার্কিন প্রাপ্তবয়স্কদের নিয়োগ করেছিল, যা সেটআপটিকে অস্বাভাবিকভাবে নিয়ন্ত্রিত করে কিন্তু বহুভাষিক ইভেন্ট, নিম্ন-সংযোগের সেটিংস এবং সরকারী তথ্য বিলম্বিত বা বিতর্কিত সংকট সম্পর্কে খোলা প্রশ্ন ছেড়ে দেয়। একটি দায়িত্বশীল ফিল্ড ট্রায়াল মডেলটির লেখকত্বকে দৃশ্যমান করে তুলবে, অংশগ্রহণকারীদের হস্তক্ষেপ প্রত্যাখ্যান করতে দেবে, কোন প্রমাণ দেখানো হয়েছে তা লগ করবে এবং সংলাপটি একটি নতুন প্রবর্তন না করে একটি ভুল ধারণা সংশোধন করেছে কিনা তা পরীক্ষা করতে স্বাধীন বিচারকদের ব্যবহার করবে। এটি বিশ্বাস, মানসিক প্রতিক্রিয়া এবং বিশ্বাসের স্কোরের পাশাপাশি দাবিগুলি ভাগ করার ইচ্ছাকে পরিমাপ করা উচিত।