সংবাদে ফিরে যান
নিরাপত্তাAI Understanding ব্রিফিং

গবেষণায় দেখা গেছে AI সেফটি বেঞ্চমার্ক অনেক কম পরীক্ষা ব্যবহার করতে পারে

একটি ইউকে এআই সিকিউরিটি ইনস্টিটিউট-অধিভুক্ত প্রিপ্রিন্ট 97-99% কম প্রম্পট সহ বেশ কয়েকটি নিরাপত্তা-বেঞ্চমার্ক ফলাফল পুনরুত্পাদন করেছে, যখন সতর্ক করেছে যে ছোট পরীক্ষাগুলি বাস্তব-বিশ্বের নিরাপত্তা প্রমাণ করে না।

5 min readRead the primary source
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
Rivera and colleagues' research paper on arXiv
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.05086
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

এআই নিরাপত্তা
AI সিস্টেমে ক্ষতিকর আচরণ, ব্যর্থতা এবং অপব্যবহারের ঝুঁকি কমানোর উপর দৃষ্টি নিবদ্ধ করা একটি ক্ষেত্র।
API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস)
একটি সফ্টওয়্যার সিস্টেমের জন্য একটি কাঠামোগত উপায় অন্য সিস্টেমে অনুরোধ পাঠাতে এবং প্রতিক্রিয়াগুলি গ্রহণ করার জন্য।
সিস্টেম প্রম্পট
একটি উচ্চ-অগ্রাধিকার নির্দেশ যা একটি মডেলের জন্য আচরণ, নীতি এবং প্রতিক্রিয়া শৈলী সেট করে।
নিজেকে পরীক্ষা করুনAI কি? কুইজ

কি হয়েছে

5 আগস্ট পোস্ট করা একটি গবেষণা পত্র এআই নিরাপত্তা বেঞ্চমার্কগুলি কী ক্যাপচার করে তা পরিমাপ করতে, দরকারী প্রম্পটগুলির ছোট সেট নির্বাচন এবং মডেল আচরণে অডিট পরিবর্তনের জন্য শিক্ষাগত পরীক্ষার একটি পদ্ধতি প্রয়োগ করে৷

UK AI সিকিউরিটি ইনস্টিটিউটের সাথে যুক্ত দুইজন স্বাধীন গবেষক এবং দুইজন গবেষক ক্ষতিকারক-অনুরোধ প্রত্যাখ্যান, সৌম্য অনুরোধের অতিরিক্ত-প্রত্যাখ্যান, প্রাসঙ্গিক ক্ষতি এবং সত্যবাদিতা কভার করে আটটি বেঞ্চমার্কে 192টি চ্যাট মডেল মূল্যায়ন করেছেন। সম্পূর্ণ স্যুটে প্রিপ্রসেস করার আগে 5,255টি প্রম্পট রয়েছে; পরীক্ষিত মডেলের মধ্যে পার্থক্য না করে এমন অস্কোর করা প্রতিক্রিয়া এবং আইটেমগুলি সরিয়ে দেওয়ার পরে বিশ্লেষণটি 5,067 ধরে রেখেছে।

কোন প্রম্পটগুলি কঠিন এবং কোনটি সর্বোত্তম আলাদা করা মডেল তা অনুমান করতে আইটেম প্রতিক্রিয়া তত্ত্ব ব্যবহার করে দলটি মডেলগুলিকে পরীক্ষা গ্রহণকারী এবং বেঞ্চমার্ক প্রম্পটগুলিকে পরীক্ষার আইটেম হিসাবে বিবেচনা করেছিল। এর প্রধান ফ্যাক্টর বিশ্লেষণে, একটি তিন-ফ্যাক্টর সমাধান - প্রত্যাখ্যান কঠোরতা, সত্যবাদিতা এবং প্রাসঙ্গিক ক্ষতি হিসাবে সংক্ষিপ্ত - মডেল ক্ষমতার বৈচিত্র্যের 77% ব্যাখ্যা করেছে, একটি একক ফ্যাক্টরের জন্য 47% এর তুলনায়।

20টি অনুষ্ঠিত-আউট মূল্যায়ন জুড়ে, তিনটি নির্দিষ্ট 25-প্রম্পট পরীক্ষাগুলি স্যুটের 2% এরও কম ব্যবহার করে সেই তিনটি কারণ পুনরুদ্ধার করেছে। HarmBench, SORRY-Bench, এবং OR-Bench-Hard-এর জন্য, মোটামুটি 10টি অভিযোজিতভাবে নির্বাচিত প্রম্পট 0.92 থেকে 0.94 এর পারস্পরিক সম্পর্ক সহ পূর্ণ-বেঞ্চমার্ক র‌্যাঙ্কিং পুনরুত্পাদন করে এবং প্রম্পটের সংখ্যা 97-99% কমিয়ে দেয়; পরীক্ষার বাজেট বাড়ার সাথে সাথে সুবিধা সংকুচিত হয়েছে।

সংকোচন কেবল র্যান্ডম স্যাম্পলিং নয়। আইটেম প্রতিক্রিয়া তত্ত্ব অনুমান করে যে প্রতিটি প্রম্পট কতটা কঠিন এবং এটি বিভিন্ন প্রতিক্রিয়া নিদর্শনগুলির সাথে মডেলগুলিকে কতটা ভালভাবে আলাদা করে, তারপর বৃহত্তর পরীক্ষার কাঠামো সংরক্ষণ করে এমন আইটেমগুলি নির্বাচন করে। লেখকরা অভিযোজিত নির্বাচনের সাথে নির্দিষ্ট সংক্ষিপ্ত ফর্মের তুলনা করেছেন এবং শুধুমাত্র প্রম্পট বেছে নেওয়ার জন্য ব্যবহৃত ডেটা পরিমাপ করার পরিবর্তে মূল্যায়ন করেছেন। এই নকশাটি সংকীর্ণ দাবিকে সমর্থন করে যে কিছু বিদ্যমান বেঞ্চমার্ক র‌্যাঙ্কিং দক্ষতার সাথে পুনরুত্পাদন করা যেতে পারে; এটি দেখায় না যে একটি 10- বা 25-আইটেম পরীক্ষা একটি সম্পূর্ণ নতুন ব্যর্থতার মোড আবিষ্কার করতে পারে।

উত্স বিবরণ: Rivera and colleagues' research paper on arXiv ↗

কেন এটা গুরুত্বপূর্ণ

সমীক্ষায় পরামর্শ দেওয়া হয়েছে যে ভাল-নির্বাচিত প্রম্পটগুলি ঘন ঘন AI সুরক্ষা পরীক্ষাকে সস্তা করে তুলতে পারে এমন ভান না করে যে প্রতিটি বেঞ্চমার্ক একটি সর্বজনীন সুরক্ষা স্কোর পরিমাপ করে।

সস্তা পরীক্ষাগুলি ডেভেলপার, ছোট পরীক্ষাগার এবং স্বাধীন মূল্যায়নকারীদের প্রশিক্ষণ, সূক্ষ্ম-টিউনিং, কোয়ান্টাইজেশন এবং সিস্টেম-প্রম্পট পরিবর্তনের সময় আরও মডেল সংস্করণ পরীক্ষা করতে দেয়। ফলাফলটি বিদ্যমান বেঞ্চমার্ক পরিমাপগুলি দক্ষতার সাথে পুনরুত্পাদন সম্পর্কে, সেই মানদণ্ডগুলি কী সনাক্ত করতে পারে তা প্রসারিত না করে৷

ফ্যাক্টর বিশ্লেষণ একটি স্কোরিং ট্রেডঅফও প্রকাশ করে। পুরষ্কার প্রত্যাখ্যানের মানদণ্ডগুলি একে অপরের সাথে ওভারল্যাপ করতে পারে, যখন অপ্রয়োজনীয় প্রত্যাখ্যান এড়ানোর জন্য একটি বেঞ্চমার্ক বিপরীত আচরণকে পুরস্কৃত করে। ওজন ব্যাখ্যা না করে তাদের গড় করা লুকিয়ে রাখতে পারে যে একটি মডেল নিরাপদ, নিছক আরো সীমাবদ্ধ, বা সৌম্য অনুরোধে কম কার্যকর হয়েছে কিনা।

কাগজটি ইচ্ছাকৃতভাবে প্ররোচিত স্যান্ডব্যাগিং আচরণের উপর ব্ল্যাক-বক্স অডিট পদ্ধতিগুলিও পরীক্ষা করেছে। একটি রেসপন্স-প্যাটার্ন চেক সিলেক্টিভ কম পারফরম্যান্স ধরা পড়ে কিন্তু বেশিরভাগ ইউনিফর্ম কম পারফরমেন্স মিস করে; একটি ঐতিহাসিক ক্ষমতা চেক যোগ করা সিমুলেটেড কেস জুড়ে সম্মিলিত সনাক্তকরণকে 94-97% এ উন্নীত করেছে। এটি একটি একক স্কোরের উপর নির্ভর করার পরিবর্তে স্তরযুক্ত অডিট সমর্থন করে।

বিকাশকারীদের জন্য, অপারেশনাল মান হল ফ্রিকোয়েন্সি। একটি সংক্ষিপ্ত মূল্যায়ন একটি সিস্টেম-প্রম্পট পরিবর্তন, কোয়ান্টাইজেশন পাস, ফাইন-টিউন, টুল আপডেট, বা সুরক্ষা-নীতি সংশোধনের পরে প্রতিবার একটি পূর্ণ বেঞ্চমার্কের বাজেট ব্যবহার না করে পুনরায় চালানো যেতে পারে। কিন্তু ফলাফলটি তখনই উপযোগী হয় যখন দলগুলি মূল স্যুটটিকে পর্যায়ক্রমিক অডিট হিসাবে রাখে, হোল্ড-আউট প্রম্পটগুলি ঘোরায় এবং সংকুচিত পরীক্ষার জন্য সরাসরি অপ্টিমাইজ করার পরিবর্তে আশ্চর্যজনক পরিবর্তনগুলি তদন্ত করে। অন্যথায় সস্তা চেক ওভারফিটিংয়ের জন্য আরেকটি লক্ষ্য হয়ে উঠতে পারে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
What is AI? Quiz

Which description best fits "narrow AI", the kind of AI in use today?

পরবর্তী কি দেখতে

স্বাধীন প্রতিলিপি, ভবিষ্যত মডেল পরিবারগুলির বৈধতা এবং প্রমাণের জন্য দেখুন যে সংক্ষিপ্ত পরীক্ষাগুলি পুনরুত্পাদনের জন্য ডিজাইন করা বেঞ্চমার্কের বাইরে আচরণের পূর্বাভাস দেয়।

এটি একটি নতুন প্রিপ্রিন্ট, সম্পূর্ণ পিয়ার-রিভিউ রায় নয়। সুপ্ত-গঠন বিশ্লেষণে 134টি মডেল ব্যবহার করা হয়েছে, যা লেখকরা মনে করেন প্রচলিত সাইকোমেট্রিক মান দ্বারা ছোট, এবং একটি বিকল্প নিষ্কাশন পদ্ধতি তিনটির পরিবর্তে দুটি কারণকে ধরে রেখেছে। ফ্যাক্টরের নামগুলি পরীক্ষামূলক সারাংশ, নিরাপত্তার বৈধ সংজ্ঞা নয়।

প্রতিটি মডেল OpenRouter এর মাধ্যমে উপলব্ধ প্রম্পটে একটি প্রতিক্রিয়া তৈরি করেছে এবং প্রতিটি বেঞ্চমার্ক তার নির্ধারিত স্বয়ংক্রিয় বিচারক ব্যবহার করেছে। ফলস্বরূপ সংক্ষিপ্ত পরীক্ষাগুলি মূল প্রম্পট, স্কোরিং নিয়ম, ভাষা কভারেজ এবং বিচারকগুলিতে ত্রুটিগুলি উত্তরাধিকার সূত্রে পেতে পারে; লেখকরা স্পষ্টভাবে বলেছেন যে কম্প্রেশন দেখায় না যে একটি বেঞ্চমার্ক স্থাপনার নিরাপত্তার পূর্বাভাস দেয় বা ভবিষ্যতের মডেলের জন্য তথ্যপূর্ণ থাকে।

স্যান্ডব্যাগিং পরীক্ষায় মূল্যায়ন এড়ানোর জন্য সূক্ষ্মভাবে তৈরি মডেলের পরিবর্তে প্রম্পটেড মডেল অর্গানিজম ব্যবহার করা হয়েছে, যা সনাক্ত করা সহজ হতে পারে। এপিআই চেক আচরণগত ধারাবাহিকতা প্রতিষ্ঠা করে, লুকানো মডেল ওজনের পরিচয় নয়, এবং গবেষণাটি অডিট পদ্ধতিগুলিকে পরাস্ত করার জন্য বিশেষভাবে প্রশিক্ষিত কোনো প্রতিপক্ষকে পরীক্ষা করেনি।

কাগজের সবচেয়ে গুরুত্বপূর্ণ সীমানা হল পরিমাপের দক্ষতা এবং নিরাপত্তা নিশ্চিতকরণের মধ্যে। একটি সংক্ষিপ্ত ফর্ম মূল বেঞ্চমার্কে উপস্থিত সুপ্ত কারণগুলি অনুমান করতে পারে, তবে এটি সেই বেঞ্চমার্কের ভাষা, বিচার, প্রম্পট ফ্রেমিং এবং অন্ধ দাগগুলিকে উত্তরাধিকার সূত্রে প্রাপ্ত করে৷ ভবিষ্যত মূল্যায়নের জন্য বহুভাষিক প্রম্পট, টুল-সক্ষম এজেন্ট, দীর্ঘ কথোপকথন, প্রতিকূলভাবে সূক্ষ্ম সুর করা মডেল এবং স্বাধীন মানবিক বিচার পরীক্ষা করা উচিত। যখন একটি সংকুচিত স্কোর অস্থির হয়ে যায় তখন তাদের রিপোর্ট করা উচিত, কারণ হোল্ড-আউট ডেটার একটি ঝরঝরে পারস্পরিক সম্পর্ক পরবর্তী মডেল পরিবারে ব্যর্থতা লুকিয়ে রাখতে পারে।

একটি ব্যবহারিক দত্তক নেওয়ার নিয়ম সেই সীমাবদ্ধতাগুলি থেকে অনুসরণ করে: সংকুচিত পরীক্ষাগুলিকে সেন্টিনেল হিসাবে ব্যবহার করুন, রায় নয়। দলগুলি রিগ্রেশনগুলি ধরতে ঘন ঘন সেগুলি চালাতে পারে, তারপর যখন সংক্ষিপ্ত ফর্মটি অপ্রত্যাশিতভাবে সরে যায় তখন সম্পূর্ণ বেঞ্চমার্ক এবং মানব পর্যালোচনাতে একটি পরিবর্তন বাড়াতে পারে। অধ্যয়নের নিজস্ব প্রমাণগুলি স্তরযুক্ত কর্মপ্রবাহকে সমর্থন করে কারণ ফ্যাক্টর কাঠামোটি নির্দিষ্ট প্রম্পট, বিচারক এবং মডেল আউটপুট থেকে উদ্ভূত হয়েছিল। নির্বাচিত আইটেম, নির্বাচনের কোড, হোল্ড-আউট ফলাফল এবং সংস্করণের ইতিহাস প্রকাশ করা স্বাধীন মূল্যায়নকারীদের ডেভেলপারদের দেখার পরে এবং নতুন মডেল পরিবারগুলি প্রতিক্রিয়াগুলির বিতরণ পরিবর্তন করার পরে সংক্ষিপ্ত পরীক্ষাগুলি তথ্যপূর্ণ থাকে কিনা তা পরীক্ষা করতে দেয়৷

যখন একটি মডেল আপডেট করা হয় তখন একই স্বচ্ছতা গুরুত্বপূর্ণ। একটি প্রজন্মের উপর ক্রমাঙ্কিত একটি সংক্ষিপ্ত পরীক্ষা খুব সহজ, খুব সংকীর্ণ, বা ঘটনাক্রমে একটি নতুন সিস্টেম প্রম্পটের সাথে সারিবদ্ধ হতে পারে। টিমগুলির পূর্বের সংস্করণগুলি সংরক্ষণ করা উচিত, একটি আইটেম বা বিচারক পরিবর্তন হলে প্রকাশ করা উচিত এবং একটি সুনির্দিষ্ট নিরাপত্তা স্কোর হিসাবে একটি সংকুচিত র‌্যাঙ্কিং উপস্থাপন করার পরিবর্তে আত্মবিশ্বাসের ব্যবধানের প্রতিবেদন করা উচিত। এই অনুশীলনগুলি গভীর পর্যালোচনার জন্য মূল বেঞ্চমার্ক উপলব্ধ রেখে কাগজের দক্ষতা ফলাফলকে একটি নিরীক্ষণযোগ্য পর্যবেক্ষণ প্রোগ্রামে পরিণত করে।

সম্পর্কিত গাইড এবং কুইজ

AI কি?ChatGPT ও এলএলএমএআই নীতিশাস্ত্রআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই রেগুলেশন ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?