সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

ওয়্যারউলফ বেঞ্চমার্ক দেখেছে যে LLMগুলি বিশ্বস্ত অভিযুক্তদেরকে বেশি মূল্য দিতে পারে৷

40 টি ওপেন-ওয়েট এলএলএম কনফিগারেশনের একটি বেঞ্চমার্ক পাওয়া গেছে যে অভিযোগগুলি মডেলের বিশ্বাসকে পরিবর্তন করতে পারে এমনকি যখন অভিযুক্ত ব্যক্তি বিরোধী পক্ষের সাথে সংযুক্ত থাকে।

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2609.12446
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
টীকা
মেশিন লার্নিং মডেলের প্রশিক্ষণ বা মূল্যায়ন করতে ব্যবহৃত মানব-সংযোজিত লেবেল বা মেটাডেটা।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা একটি ওয়্যারওল্ফ বেঞ্চমার্ক প্রবর্তন করেছেন যা পরিমাপ করে যে কীভাবে এলএলএমগুলি সন্দেহ এবং অভিযোগের বার্তা পাওয়ার পরে তাদের বিশ্বাস আপডেট করে। 1,224 টি টীকাযুক্ত বার্তা এবং 40টি ওপেন-ওয়েট মডেল কনফিগারেশন জুড়ে, বৃহত্তর মডেলগুলি প্রায়শই গেমের ইতিহাস থেকে সত্যিকারের নেকড়েদের সনাক্ত করে তবে অভিযোগ এবং অভিযুক্তের অনুভূত বিশ্বাসযোগ্যতা দ্বারা দৃঢ়ভাবে প্রভাবিত ছিল।

কাগজটি শুধুমাত্র একটি সামাজিক-ডিডাকশন গেমের চূড়ান্ত ফলাফলের উপর নির্ভর না করে বিশ্বাস পরিবর্তনের মূল্যায়ন করার প্রস্তাব করে। এটির সেটআপে, একটি পর্যবেক্ষক গ্রাম-পাশের মডেল সন্দেহ এবং অভিযোগ সহ গেমের বার্তাগুলি পায় এবং গবেষকরা প্রতিটি বার্তার পরে কীভাবে এর বিশ্বাসগুলি পরিবর্তিত হয় তা পরিমাপ করে।

40টি ওপেন-ওয়েট এলএলএম কনফিগারেশন এবং 1,224টি টীকাযুক্ত বার্তা থেকে বিমূর্ত প্রতিবেদনের ফলাফল। বৃহত্তর মডেলগুলি সম্পূর্ণ গেমের ইতিহাস ব্যবহার করে গ্রামবাসীদের থেকে নেকড়েদের আলাদা করতে আরও ভাল পারফর্ম করেছে। যাইহোক, অভিযোগগুলি এখনও অভিযুক্তের প্রতি সন্দেহ বাড়ায় এবং অভিযুক্তের প্রতি সন্দেহ হ্রাস করে, বিশেষ করে যখন অভিযুক্ত ব্যক্তি ইতিমধ্যেই বিশ্বস্ত ছিল।

বিশ্বস্ত অভিযোগকারী নেকড়ে সারিবদ্ধ থাকলেও রিপোর্ট করা প্যাটার্ন বজায় ছিল। বৃহত্তর মডেলগুলি অভিযুক্তদের কাছ থেকে আসা অভিযোগগুলিকে তারা ইতিমধ্যে অবিশ্বাস করতে আরও ভালভাবে প্রতিরোধ করতে সক্ষম হয়েছিল, কিন্তু 120 বিলিয়ন প্যারামিটার পর্যন্ত মডেলগুলি এখনও অভিযোগের বিষয়বস্তুকে এর উত্সের নির্ভরযোগ্যতার সাথে একীভূত করতে সংগ্রাম করেছে৷ উৎসটি প্রতি-মডেলের বিশদ স্কোর, পরিসংখ্যানগত অনিশ্চয়তা, বা সরবরাহকৃত পাঠ্যে স্বাধীন প্রতিলিপি প্রদান করে না।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

অধ্যয়নটি কৌশলগত যোগাযোগের একটি নির্দিষ্ট দুর্বলতা চিহ্নিত করে: মডেলগুলি সেই স্পিকারের দাবিতে থাকা প্রমাণ থেকে একজন স্পিকারের বিশ্বাসযোগ্যতাকে পর্যাপ্তভাবে আলাদা করতে পারে না। সেটিংসে কাজ করা LLM এজেন্টদের জন্য এটি গুরুত্বপূর্ণ যেখানে বার্তাগুলি নির্বাচনী, প্রতারণামূলক বা প্রতিপক্ষ হতে পারে। ফলাফলটি একটি বেঞ্চমার্ক এবং গবেষণার ফলাফল, প্রমাণ নয় যে সমস্ত স্থাপন করা এআই সিস্টেম এইভাবে আচরণ করে বা মূল্যায়নটি ওয়্যারওল্ফের বাইরে সাধারণীকরণ করে।

এলএলএম এজেন্টদের মূল্যায়নকারী গবেষকদের জন্য, ফলাফলটি পরামর্শ দেয় যে চূড়ান্ত খেলার সাফল্য মধ্যবর্তী যুক্তি এবং বিশ্বাস আপডেট করার ক্ষেত্রে গুরুত্বপূর্ণ দুর্বলতাগুলি লুকিয়ে রাখতে পারে। উপলব্ধ প্রমাণের পাশাপাশি দাবির মূল্যায়ন না করে কে একটি দাবি প্রদান করেছে তার ওজন বেশি হওয়া সত্ত্বেও একটি মডেল একটি যুক্তিসঙ্গত সিদ্ধান্তে পৌঁছাতে পারে।

ব্যবহারিক তাত্পর্য সীমিত কিন্তু দরকারী: এজেন্টদের মূল্যায়ন যারা যোগাযোগ করে বা একাধিক প্রতিবেদন থেকে সিদ্ধান্ত নেয় তাদের পৃথক বার্তাগুলির পরে বিশ্বাসের পরিবর্তনগুলি পরিমাপ করতে হতে পারে, যেখানে বিশ্বাসযোগ্য বক্তা বিভ্রান্তিকর। গবেষণাটি স্থাপন করে না যে একই আচরণ স্থাপন করা পণ্যগুলিতে বা নন-গেম সেটিংসে ঘটে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

বেঞ্চমার্ক এবং কোডটি প্রকল্পের ওয়েবসাইটের মাধ্যমে উপলব্ধ, তবে উত্সটি লাইসেন্সিং, হোস্টিং বিশদ বা মূল্যায়ন করা মডেলগুলি সর্বজনীন ব্যবহারের জন্য উপলব্ধ কিনা তা জানায় না। পরবর্তী কাজের পরীক্ষা করা উচিত যে অনুসন্ধান অন্যান্য যোগাযোগের কাজে স্থানান্তরিত হয় কিনা, প্রশিক্ষণ উৎস-সামগ্রী যুক্তির উন্নতি করে কিনা এবং গেমের নকশা এবং টীকা পছন্দের উপর কতটা ফলাফল নির্ভর করে।

লেখক বলেছেন যে বেঞ্চমার্ক এবং কোড লিঙ্কযুক্ত প্রকল্প পৃষ্ঠায় উপলব্ধ। সরবরাহকৃত উত্স অ্যাক্সেসের প্রয়োজনীয়তা, লাইসেন্সিং, মূল্য নির্ধারণ, সমর্থিত ফ্রেমওয়ার্ক বা বেঞ্চমার্কে টীকাযুক্ত বার্তাগুলির বাইরে মডেল আউটপুট অন্তর্ভুক্ত রয়েছে কিনা তা নথিভুক্ত করে না।

গুরুত্বপূর্ণ অজানাগুলির মধ্যে রয়েছে কীভাবে বার্তাগুলি তৈরি এবং টীকা করা হয়েছিল, কীভাবে বিশ্বাস প্রতিষ্ঠিত হয়েছিল, ফলাফলগুলি পৃথক মডেলগুলিতে পরিসংখ্যানগতভাবে শক্তিশালী কিনা এবং বৃহত্তর মডেলগুলির উন্নত গেম-ইতিহাস যুক্তি ম্যানিপুলেশনের আরও ভাল প্রতিরোধে অনুবাদ করে কিনা।

অন্যান্য কৌশলগত যোগাযোগের কাজগুলির প্রতিলিপি এটি একটি ওয়্যারউলফ-নির্দিষ্ট প্রভাব কিনা বা এলএলএম এজেন্টরা অভিযোগের বিষয়বস্তুর সাথে উত্সের বিশ্বাসযোগ্যতাকে কীভাবে একত্রিত করে তার একটি বিস্তৃত সীমাবদ্ধতা নির্ধারণ করতে সহায়তা করবে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই এজেন্টএআই নীতিশাস্ত্রআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?