সংবাদে ফিরে যান
নিরাপত্তাAI Understanding ব্রিফিং

AWS বেঞ্চমার্ক AI দুর্বলতা সনাক্তকারী পতাকা নিরাপদ কোড খুঁজে পায়

হেল্প নেট সিকিউরিটি রিপোর্ট করে যে AWS একটি বেঞ্চমার্কে 12টি AI মডেল পরীক্ষা করেছে যা নিরাপদ কোড থেকে শোষণযোগ্য দুর্বলতাগুলিকে আলাদা করার জন্য ডিজাইন করা হয়েছে যা শুধুমাত্র বিপজ্জনক দেখায়। মিথ্যা-ইতিবাচক এবং মিথ্যা-নেতিবাচক উভয় হারের জন্য AWS-এর উল্লিখিত উৎপাদন থ্রেশহোল্ড কেউই পূরণ করেনি।

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
উৎস রেফারেন্সউৎস রেকর্ড করা হয়েছে
প্রকাশক
helpnetsecurity.com
উৎস লিঙ্ক
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
উত্স প্রকার
লিঙ্কযুক্ত উৎস — প্রাথমিক-উৎস স্থিতি প্রতিষ্ঠিত হয়নি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
যথার্থতা
ভবিষ্যদ্বাণীকৃত ইতিবাচকের অনুপাত যা আসলে সঠিক।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

হেল্প নেট সিকিউরিটি রিপোর্ট করে যে AWS সর্বজনীনভাবে তার প্রতারণার বেঞ্চমার্ক প্রকাশ করেছে, যা পরীক্ষা করে যে AI মডেলগুলি বিভ্রান্তিকর দুর্বলতার নিদর্শন ধারণকারী নিরাপদ কোড থেকে প্রকৃত সফ্টওয়্যার দুর্বলতাগুলিকে আলাদা করতে পারে কিনা। বেঞ্চমার্কে 16টি প্রোগ্রামিং ভাষা এবং 70টিরও বেশি CWE বিভাগ বিস্তৃত 14,822টি নমুনা রয়েছে; 9,695টি স্কোর করা হয়েছে এবং 5,127টি আনস্কোরড নমুনা হিসাবে মিশ্রিত হয়েছে।

হেল্প নেট সিকিউরিটি রিপোর্ট করে যে AWS মিথ্যা পজিটিভের চারপাশে ডিজাইন করা একটি বেঞ্চমার্ক ব্যবহার করে পাঁচটি প্রদানকারীর কাছ থেকে 12টি সাধারণ-উদ্দেশ্য মডেলের মূল্যায়ন করেছে। বেঞ্চমার্কের নিরাপদ উদাহরণগুলিতে সুরক্ষার পাশাপাশি প্রকৃত দুর্বলতার নিদর্শন রয়েছে যা শোষণ প্রতিরোধ করে। কিছু চ্যালেঞ্জ মোতায়েনের অবস্থার পরিবর্তিত হয়, যেমন কুবারনেটস নেটওয়ার্ক নীতি, তাই একটি মডেলকে অবশ্যই কোড এবং এর পরিবেশ উভয়ই বিবেচনা করতে হবে।

প্রতিবেদন অনুসারে, AWS শ্রেণীবদ্ধ করা খুব সহজ ছিল এমন নমুনাগুলি বাদ দিয়ে সীমান্ত মডেলগুলির বিরুদ্ধে উদাহরণ তৈরি এবং পরিমার্জিত করেছে৷ AWS বলেছেন যে এই প্রক্রিয়াটি কয়েক বিলিয়ন টোকেন ব্যবহার করেছে। কোম্পানি প্রকাশ্যে নমুনা প্রকাশ করে কিন্তু তাদের লেবেল আটকে রাখে; ব্যবহারকারীরা যাচাইকৃত স্কোরিংয়ের জন্য AWS-এ ভবিষ্যদ্বাণী জমা দেয়। স্কোরিং-এর অ্যাক্সেস ফি বা অন্যান্য যোগ্যতার প্রয়োজনীয়তা বহন করে কিনা তা উৎসটি উল্লেখ করে না।

হেল্প নেট সিকিউরিটি রিপোর্ট করে যে স্বাধীন পর্যালোচক একে অপরের সিদ্ধান্ত বা মূল যুক্তি না দেখে লেবেল চেক করে। বিতর্কিত নমুনাগুলি আরও পর্যালোচনা পায় এবং অমীমাংসিত কেসগুলি আনস্কোরড সেটে স্থানান্তরিত হয়। AWS বলেছেন যে স্কোর করা নমুনার 3% এরও কম পর্যালোচনার পরে প্রতিদ্বন্দ্বিতা করা হয়েছে, 1% এরও কম মানুষের পর্যালোচনার লক্ষ্যমাত্রা রয়েছে, এবং 100টি এলোমেলোভাবে নির্বাচিত স্কোর করা নমুনার পর্যালোচনাতে কোনও লেবেল ত্রুটির রিপোর্ট করেনি৷ এই দাবিগুলি এখানে স্বাধীনভাবে নিশ্চিত করা হয়নি।

উত্স বিবরণ: helpnetsecurity.com ↗

কেন এটা গুরুত্বপূর্ণ

ফলাফলগুলি পরামর্শ দেয় যে সন্দেহজনক কোড খুঁজে পাওয়ার ক্ষেত্রে শক্তিশালী কার্যকারিতা অগত্যা নির্ভরযোগ্য দুর্বলতা ট্রাইজে অনুবাদ করে না। উচ্চ মিথ্যা-ইতিবাচক হার নিরাপত্তা দলগুলিকে বোঝায় এবং সতর্কতার প্রতি আস্থাকে দুর্বল করতে পারে, যখন কঠোর প্রমাণের প্রয়োজনীয়তাগুলি মডেলগুলিকে প্রকৃত দুর্বলতাগুলি মিস করতে পারে৷ ফলাফলগুলি এআই-সহায়তা কোড পর্যালোচনা বা সুরক্ষা ক্রিয়াকলাপ বিবেচনা করে এমন সংস্থাগুলির জন্য প্রাসঙ্গিক, তবে তারা সম্পূর্ণ বাণিজ্যিক সুরক্ষা পণ্যগুলি পরিমাপ করে না।

বেঞ্চমার্ক এআই-সহায়তা সুরক্ষার একটি ব্যবহারিক দুর্বলতাকে সম্বোধন করে: একটি মডেল শোষণ প্রতিরোধকারী নিয়ন্ত্রণগুলি না বুঝেই একটি বিপজ্জনক চেহারার প্যাটার্ন চিনতে পারে। হেল্প নেট সিকিউরিটি রিপোর্ট করে যে সরাসরি প্রম্পটিং 41% থেকে 99% পর্যন্ত মিথ্যা-ইতিবাচক হার তৈরি করে, যেখানে নির্ভুলতা 52% থেকে 71% পর্যন্ত।

প্রতিবেদন অনুসারে, একটি দুর্বলতাকে বাস্তবে কাজে লাগানো যেতে পারে তা প্রমাণ করতে মডেলগুলিকে জিজ্ঞাসা করা মিথ্যা ইতিবাচককে 17 থেকে 74 শতাংশ পয়েন্ট কমিয়েছে, কিন্তু মিথ্যা-নেতিবাচক হার 7% এবং 44% এর মধ্যে বৃদ্ধি করেছে। AWS-এর উল্লিখিত ন্যূনতম উত্পাদন বার উভয় ব্যবস্থার জন্য 10% এর নিচে ছিল এবং পরীক্ষিত কনফিগারেশনের কোনোটিই উভয় থ্রেশহোল্ড পূরণ করেনি।

এই ফলাফলগুলি সম্পূর্ণ নিরাপত্তা পণ্যের র‌্যাঙ্কিং হিসাবে পড়া উচিত নয়। AWS সাধারণ-উদ্দেশ্যের মডেলগুলিতে একক-টার্ন প্রম্পট পরীক্ষা করেছে, উদ্দেশ্য-নির্মিত সিস্টেমগুলি নয় যা সরঞ্জাম ব্যবহার করে, বারবার বৈধতা বা এজেন্টিক ওয়ার্কফ্লো ব্যবহার করে। উত্সটি তাই মডেল-স্তরের দুর্বলতার রায় সম্পর্কে সতর্কতা সমর্থন করে, একটি উপসংহার নয় যে AI সুরক্ষা পণ্যগুলি সম্পূর্ণরূপে ব্যর্থ হয়৷

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

প্রকাশিত নমুনাগুলি ব্যবহার করে স্বাধীন মূল্যায়ন, টুল-ব্যবহার বা বহু-পদক্ষেপ সুরক্ষা সিস্টেমের ফলাফল এবং বাস্তব উত্পাদন পরিবেশে কর্মক্ষমতা সম্পর্কে প্রমাণের জন্য দেখুন। উৎসটি মূল্য, পরিষেবা-স্তরের অ্যাক্সেস, বা AWS-এর স্কোরিং প্রক্রিয়া সীমাবদ্ধতা ছাড়াই উপলব্ধ কিনা তা নথিভুক্ত করে না। এটিও প্রতিষ্ঠিত করে না যে পরীক্ষিত মডেলগুলি অপ্রকাশিত এন্টারপ্রাইজ কোডে একইভাবে কাজ করে।

স্বাধীন গবেষকরা AWS-এর রিপোর্ট করা ডেটা-জেনারেশন খরচ পুনরায় তৈরি না করেই পাবলিক নমুনা এবং মূল্যায়ন প্রক্রিয়া ব্যবহার করতে পারেন, কিন্তু আটকে রাখা লেবেল এবং AWS- যাচাইকৃত স্কোরিং বেঞ্চমার্ক-নির্দিষ্ট অপ্টিমাইজেশান সীমিত করার উদ্দেশ্যে। বাইরের গোষ্ঠীর দ্বারা প্রতিলিপি রিপোর্ট করা ফলাফল এবং লেবেল গুণমান পরীক্ষা করতে সাহায্য করবে।

ভবিষ্যত মূল্যায়নের জন্য সিঙ্গেল-পাস মডেলগুলিকে এমন সিস্টেমগুলির সাথে তুলনা করা উচিত যা সংগ্রহস্থলগুলি পরিদর্শন করে, কোডটি নিরাপদে কার্যকর করে, স্থাপনার কনফিগারেশনের উপর যুক্তি দেয় এবং সতর্কতা জারি করার আগে প্রমাণের প্রয়োজন হয়। এই পরীক্ষাগুলি কেবলমাত্র মডেলের ফলাফলগুলিতে কতটা ব্যবহারিক সুরক্ষা সরঞ্জাম উন্নত করে তা আরও ভালভাবে নির্দেশ করবে।

উত্সটি গুরুত্বপূর্ণ অজানা ছেড়ে যায়: এটি 12টি পরীক্ষিত মডেল কনফিগারেশন সনাক্ত করে না, সরবরাহ করা পাঠ্যে প্রতি-মডেলের ফলাফলের প্রতিবেদন করে, যাচাইকৃত স্কোরিংয়ের জন্য নথির মূল্য বা অ্যাক্সেসের শর্তাবলী, বা কীভাবে কার্যকারিতা মালিকানা কোডবেসে স্থানান্তরিত হয় এবং লাইভ নিরাপত্তা ক্রিয়াকলাপ দেখায় না।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রPrompt Engineeringআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই রেগুলেশন ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?