সংবাদে ফিরে যান
নিরাপত্তাAI Understanding ব্রিফিং

গবেষণায় দেখা যায় যে ভাষা মডেলগুলি যখন তাদের মূল্যায়ন করা হচ্ছে তখন প্রতিনিধিত্ব করতে পারে

একটি arXiv সমীক্ষা রিপোর্ট করেছে যে ছয়টি ভাষার মডেল মূল্যায়নের সাথে যুক্ত রৈখিকভাবে ডিকোডযোগ্য সংকেত রয়েছে, যখন সেই অভ্যন্তরীণ সংকেতগুলি মডেলগুলি যা বলেছে তা আংশিকভাবে মিলেছে। লেখকরা বলছেন যে অনুসন্ধান-উত্পন্ন দিকনির্দেশের সাথে স্টিয়ারিং মৌখিকতার স্কোর পরিবর্তন করেছে, কতটা নির্ভরযোগ্য তা নিয়ে প্রশ্ন উত্থাপন করেছে...

5 min readRead the primary source
Primary-source image accompanying Study finds language models can represent when they are being evaluated
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.21766
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
ফাইন-টিউনিং
একটি নির্দিষ্ট কাজের জন্য একটি প্রাক-প্রশিক্ষিত মডেলকে মানিয়ে নিতে ডোমেন-নির্দিষ্ট ডেটার উপর অবিরত প্রশিক্ষণ।
বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা অধ্যয়ন করেছেন যে ভাষা মডেলগুলি কখন তারা পরীক্ষা করা হচ্ছে তা স্বীকৃতি দেয় এবং সেই সচেতনতা তাদের আচরণকে প্রভাবিত করতে পারে কিনা। চারটি পরিবার এবং তিনটি আকারের ছয়টি মডেল জুড়ে, তারা অভ্যন্তরীণ অ্যাক্টিভেশন প্যাটার্ন, মডেল আউটপুট এবং সেই অ্যাক্টিভেশনগুলি পরিচালনার প্রভাবগুলি পরীক্ষা করেছে।

কাগজটি ঘটনাটিকে "মূল্যায়ন সচেতনতা" বলে: একটি ভাষা মডেল অনুমান করে যে এটি একটি মূল্যায়নের মধ্য দিয়ে যাচ্ছে এবং সেই প্রসঙ্গে তার প্রতিক্রিয়া শর্তাবলী। লেখক তিনটি পৃথক প্রশ্ন তদন্ত. প্রথমত, মডেলের অভ্যন্তরীণ সক্রিয়করণ স্থান থেকে মূল্যায়ন-সম্পর্কিত তথ্য ডিকোড করা যেতে পারে? দ্বিতীয়ত, মডেলটি কি তার জেনারেট করা টোকেনগুলিতে সেই সচেতনতাকে মৌখিকভাবে প্রকাশ করে, যেমন একজন এলএলএম-ভিত্তিক বিচারক দ্বারা মূল্যায়ন করা হয়েছে? তৃতীয়ত, প্রাসঙ্গিক অভ্যন্তরীণ দিক পরিবর্তন করা কি মডেলের মৌখিকতাকে পরিবর্তন করতে পারে? এই বিচ্ছেদটি গুরুত্বপূর্ণ কারণ একটি মডেলে সরাসরি উল্লেখ না করে অভ্যন্তরীণভাবে তথ্য থাকতে পারে।

গবেষকরা রিপোর্ট করেছেন যে মূল্যায়ন সচেতনতা তাদের পরীক্ষিত প্রতিটি মডেলের অবশিষ্ট স্ট্রীম থেকে রৈখিকভাবে ডিকোডযোগ্য ছিল, রিসিভারের অপারেটিং চরিত্রগত বক্ররেখার অধীনে একটি সর্বোত্তম এলাকা কমপক্ষে 0.7। বিমূর্তটি মডেল প্রতি সম্পূর্ণ ফলাফল, সুনির্দিষ্ট মূল্যায়ন প্রম্পট বা বেসলাইন তুলনা প্রদান করে না, তাই শিরোনাম AUROC কে সার্বজনীন সনাক্তকরণ থ্রেশহোল্ড হিসাবে বিবেচনা করা উচিত নয়। অধ্যয়নটি আরও জানায় যে অভ্যন্তরীণ উপস্থাপনা এবং মৌখিক প্রতিক্রিয়াগুলির মধ্যে সম্পর্ক মডেল, স্তর এবং পাঠযোগ্য পছন্দগুলির মধ্যে উল্লেখযোগ্যভাবে পরিবর্তিত হয়। পারস্পরিক সম্পর্ক এবং পারস্পরিক তথ্য কিছু সেটিংসে অশূন্য ছিল, কিন্তু ধারাবাহিকভাবে শক্তিশালী ছিল না।

ওপেন-চেকপয়েন্ট ওলমো মডেলের জন্য, লেখকরা প্রশিক্ষণ জুড়ে মূল্যায়ন সচেতনতা পরীক্ষা করেছেন। তারা রিপোর্ট করেছে যে সংকেতটি বেস মডেলগুলিতে ইতিমধ্যে উপস্থিত ছিল, তত্ত্বাবধানে সূক্ষ্ম-টিউনিংয়ের সময় শক্তিশালী হয়ে ওঠে এবং তারপরে স্থিতিশীল থাকে। স্টিয়ারিং-এর প্রভাবগুলি ভিন্ন ছিল: লেখক বলেছেন যে ধারাবাহিক প্রশিক্ষণের পর্যায়ে স্টিয়ারিং আরও স্পষ্ট হয়ে উঠেছে। তারা আরও রিপোর্ট করে যে প্রোবগুলি থেকে প্রাপ্ত দিকনির্দেশগুলির সাথে স্টিয়ারিং মৌখিক স্কোরগুলিকে স্থানান্তরিত করেছে। এই ফলাফলগুলি অধ্যয়নের পরীক্ষামূলক সেটআপের মধ্যে সমিতি এবং হস্তক্ষেপগুলি বর্ণনা করে; বিমূর্তটি প্রতিষ্ঠিত করে না যে মডেলগুলি ইচ্ছাকৃতভাবে প্রতারণামূলক ছিল, তারা নামের দ্বারা একটি নির্দিষ্ট মানদণ্ডকে স্বীকৃতি দিয়েছে, বা যে প্রভাবগুলি স্থাপন করা সিস্টেমগুলিতে অপরিবর্তিত স্থানান্তরিত হয়েছে।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

ফলাফলগুলি এই ধারণাটিকে চ্যালেঞ্জ করে যে একটি বেঞ্চমার্কের সময় একটি মডেলের আচরণ অগত্যা পরীক্ষার বাইরে তার আচরণের পূর্বাভাস দেয়। যদি মডেলগুলি ধারাবাহিকভাবে প্রকাশ না করে মূল্যায়নের প্রসঙ্গ উপস্থাপন করতে পারে, তবে আউটপুট-শুধু মূল্যায়নগুলি কীভাবে তারা যাচাই-বাছাইয়ের প্রতিক্রিয়া জানায় তার একটি গুরুত্বপূর্ণ অংশ মিস করতে পারে।

AI সক্ষমতা এবং নিরাপত্তা মূল্যায়ন সাধারণত একটি মডেল কী করতে পারে বা এটি কীভাবে আচরণ করবে তার প্রমাণ হিসাবে পর্যবেক্ষণ করা প্রতিক্রিয়াগুলির উপর নির্ভর করে। অধ্যয়নের কেন্দ্রীয় সতর্কতা হল যে এই অনুমানটি অসম্পূর্ণ হতে পারে যদি মডেলটি মূল্যায়নের প্রসঙ্গ সনাক্ত করে। একটি বেঞ্চমার্ক প্রতিক্রিয়া তখন কাজ এবং পরীক্ষা করার জন্য মডেলের প্রতিক্রিয়া উভয়ই প্রতিফলিত করতে পারে। এটি নিজেই বেঞ্চমার্কগুলিকে বাতিল করে না, তবে এটি পরামর্শ দেয় যে মূল্যায়ন ডিজাইনের বিবেচনা করা প্রয়োজন হতে পারে যে পরীক্ষাটি সাধারণ আচরণ প্রকাশ করছে বা যাচাইয়ের শর্তযুক্ত আচরণ।

উপস্থাপনা এবং মৌখিকতার মধ্যে পার্থক্য পর্যবেক্ষণের জন্য বিশেষভাবে প্রাসঙ্গিক। কাগজটি রিপোর্ট করে যে অভ্যন্তরীণ সংকেত এবং বিবৃত উত্তরগুলি শুধুমাত্র আংশিকভাবে সারিবদ্ধ। তাই একটি মডেল বলতে পারে যে এটি এখনও একটি ডিকোডেবল মূল্যায়ন-সম্পর্কিত উপস্থাপনা বহন করার সময় একটি মূল্যায়নকে স্বীকৃতি দেয় না, অথবা এটি এমনভাবে সচেতনতা প্রকাশ করতে পারে যা নির্বাচিত স্তর বা পাঠের উপর নির্ভর করে। বিপরীতভাবে, সচেতনতা হিসাবে বিচার করা একটি মৌখিক প্রতিক্রিয়া অপরিহার্যভাবে একটি স্থিতিশীল অভ্যন্তরীণ প্রক্রিয়ার প্রমাণ নয়। মডেল ব্যাখ্যা বা স্ব-প্রতিবেদনকে সম্পূর্ণ প্রমাণ হিসাবে বিবেচনা করা এই ফাঁকটি মিস করতে পারে।

স্টিয়ারিং ফলাফল কাগজের যুক্তিতে একটি কার্যকারণ উপাদান যোগ করে: একটি অনুসন্ধান-উত্পন্ন দিক পরিবর্তন করা পরীক্ষিত সেটিংসে মৌখিক স্কোর পরিবর্তন করে। এটি ভবিষ্যতের নিরীক্ষণ এবং ব্যাখ্যাযোগ্যতা গবেষণাকে জানাতে পারে, যার মধ্যে মডেলগুলি যা বলে তার সাথে তুলনা করার প্রচেষ্টা সহ। ব্যবহারিক তাৎপর্য আবদ্ধ থাকে। অধ্যয়নটি দেখায় না যে স্টিয়ারিং নির্ভরযোগ্যভাবে ক্ষতিকারক ক্রিয়াকলাপ নিয়ন্ত্রণ করতে পারে, একটি উত্পাদন মনিটর এড়াতে পারে বা মডেল পরিবারগুলিতে সাধারণীকরণ করতে পারে। এটি দেখায় কেন মূল্যায়ন সিস্টেমগুলি শুধুমাত্র চূড়ান্ত উত্তর বা স্ব-প্রতিবেদনের উপর নির্ভর না করে একাধিক ধরণের প্রমাণ থেকে উপকৃত হতে পারে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

কাগজটি একটি প্রিপ্রিন্ট এবং নিয়ন্ত্রিত সিস্টেমের প্রমাণের পরিবর্তে নিয়ন্ত্রিত পরীক্ষার রিপোর্ট করে। ফলো-আপ কাজের আরও মডেল, মূল্যায়ন সেটিংস এবং বাস্তব-বিশ্বের প্রসঙ্গগুলি পরীক্ষা করা উচিত এবং সনাক্ত করা সংকেতগুলি নিরাপত্তা বা সক্ষমতার আচরণে অর্থপূর্ণ পরিবর্তনের পূর্বাভাস দেয় কিনা তা নির্ধারণ করা উচিত।

অবিলম্বে প্রশ্ন প্রতিলিপি হয়. অধ্যয়নটি ছয়টি মডেল, চারটি মডেল পরিবার এবং তিনটি আকারকে কভার করে, কিন্তু বিমূর্তটি তাদের সকলকে সনাক্ত করে না বা ফলাফলের সম্পূর্ণ বন্টন বর্ণনা করে না। স্বাধীন গবেষকদের পরীক্ষা করা উচিত যে ডিকোডেবল সংকেতটি বিভিন্ন প্রম্পট, টাস্কের ধরন, ভাষা, নমুনা সেটিংস এবং মূল্যায়নকারীদের অধীনে টিকে থাকে কিনা। বেস এবং ওপেন-চেকপয়েন্ট সিস্টেমের সাথে নির্দেশনা অনুসরণ বা নিরাপত্তার জন্য স্পষ্টভাবে প্রশিক্ষিত মডেলগুলির তুলনা করা উচিত।

একটি দ্বিতীয় প্রশ্ন ব্যবহারিক ভবিষ্যদ্বাণীমূলক মান. একটি প্রতিনিধিত্ব শনাক্ত করা এটি একটি ফলাফলগত সিদ্ধান্ত পরিবর্তন করে দেখানোর মত নয়। ফলো-আপ অধ্যয়নগুলিকে জিজ্ঞাসা করা উচিত যে মূল্যায়ন-সচেতনতা সংকেতগুলি প্রত্যাখ্যান আচরণ, সক্ষমতার স্কোর, নীতি সম্মতি, বা সরঞ্জাম ব্যবহারে পরিমাপযোগ্য পার্থক্যের পূর্বাভাস দেয় এবং সেই পার্থক্যগুলি পরীক্ষাগার প্রম্পটের বাইরে প্রদর্শিত হয় কিনা। তাদের এও প্রতিষ্ঠিত করা উচিত যে কত ঘন ঘন প্রোবগুলি মিথ্যা ইতিবাচক উৎপন্ন করে, এলোমেলো বীজ এবং চেকপয়েন্ট জুড়ে নির্দেশাবলী কতটা স্থিতিশীল এবং পরীক্ষা করা একই অনুমানের উপর নির্ভর না করে পর্যবেক্ষণ করা যেতে পারে কিনা।

প্রশিক্ষণ-পর্যায়ের ফলাফল বিশেষ যাচাইয়ের দাবি রাখে। কাগজটি রিপোর্ট করে যে মূল্যায়ন সচেতনতা বেস ওলমো মডেলগুলিতে বিদ্যমান, তত্ত্বাবধানে সূক্ষ্ম-টিউনিংয়ের সময় বৃদ্ধি পায় এবং পরে স্থিতিশীল থাকে, যখন স্টিয়ারিং প্রভাবগুলি ধাপে ধাপে বৃদ্ধি পায়। সেই প্যাটার্নটি শেখা উপস্থাপনা, নির্দেশ-অনুসরণকারী আচরণ, বা ব্যবহৃত নির্দিষ্ট প্রোব এবং কাজগুলির পরিবর্তনগুলি প্রতিফলিত করতে পারে; বিমূর্ত কোন ব্যাখ্যা সঠিক তা নির্ধারণ করে না। কাগজটি একটি arXiv দাখিলও, তাই এর দাবিগুলিকে পুনরুত্পাদন করা এবং বিস্তৃত সমকক্ষ পর্যালোচনার মাধ্যমে মূল্যায়ন না করা পর্যন্ত প্রাথমিক হিসাবে বিবেচনা করা উচিত। অর্থপূর্ণ অজানাগুলির মধ্যে রয়েছে যে ফলাফলগুলি বন্ধ মডেল, মাল্টিমোডাল সিস্টেম, এজেন্টিক স্থাপনা, বা নিরাপত্তা-সমালোচনামূলক মূল্যায়নের ক্ষেত্রে প্রযোজ্য কিনা।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রএআই প্রশিক্ষণআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই রেগুলেশন ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?