কি হয়েছে
হেল্প নেট সিকিউরিটি রিপোর্ট করে যে AWS সর্বজনীনভাবে তার প্রতারণার বেঞ্চমার্ক প্রকাশ করেছে, যা পরীক্ষা করে যে AI মডেলগুলি বিভ্রান্তিকর দুর্বলতার নিদর্শন ধারণকারী নিরাপদ কোড থেকে প্রকৃত সফ্টওয়্যার দুর্বলতাগুলিকে আলাদা করতে পারে কিনা। বেঞ্চমার্কে 16টি প্রোগ্রামিং ভাষা এবং 70টিরও বেশি CWE বিভাগ বিস্তৃত 14,822টি নমুনা রয়েছে; 9,695টি স্কোর করা হয়েছে এবং 5,127টি আনস্কোরড নমুনা হিসাবে মিশ্রিত হয়েছে।
হেল্প নেট সিকিউরিটি রিপোর্ট করে যে AWS মিথ্যা পজিটিভের চারপাশে ডিজাইন করা একটি বেঞ্চমার্ক ব্যবহার করে পাঁচটি প্রদানকারীর কাছ থেকে 12টি সাধারণ-উদ্দেশ্য মডেলের মূল্যায়ন করেছে। বেঞ্চমার্কের নিরাপদ উদাহরণগুলিতে সুরক্ষার পাশাপাশি প্রকৃত দুর্বলতার নিদর্শন রয়েছে যা শোষণ প্রতিরোধ করে। কিছু চ্যালেঞ্জ মোতায়েনের অবস্থার পরিবর্তিত হয়, যেমন কুবারনেটস নেটওয়ার্ক নীতি, তাই একটি মডেলকে অবশ্যই কোড এবং এর পরিবেশ উভয়ই বিবেচনা করতে হবে।
প্রতিবেদন অনুসারে, AWS শ্রেণীবদ্ধ করা খুব সহজ ছিল এমন নমুনাগুলি বাদ দিয়ে সীমান্ত মডেলগুলির বিরুদ্ধে উদাহরণ তৈরি এবং পরিমার্জিত করেছে৷ AWS বলেছেন যে এই প্রক্রিয়াটি কয়েক বিলিয়ন টোকেন ব্যবহার করেছে। কোম্পানি প্রকাশ্যে নমুনা প্রকাশ করে কিন্তু তাদের লেবেল আটকে রাখে; ব্যবহারকারীরা যাচাইকৃত স্কোরিংয়ের জন্য AWS-এ ভবিষ্যদ্বাণী জমা দেয়। স্কোরিং-এর অ্যাক্সেস ফি বা অন্যান্য যোগ্যতার প্রয়োজনীয়তা বহন করে কিনা তা উৎসটি উল্লেখ করে না।
হেল্প নেট সিকিউরিটি রিপোর্ট করে যে স্বাধীন পর্যালোচক একে অপরের সিদ্ধান্ত বা মূল যুক্তি না দেখে লেবেল চেক করে। বিতর্কিত নমুনাগুলি আরও পর্যালোচনা পায় এবং অমীমাংসিত কেসগুলি আনস্কোরড সেটে স্থানান্তরিত হয়। AWS বলেছেন যে স্কোর করা নমুনার 3% এরও কম পর্যালোচনার পরে প্রতিদ্বন্দ্বিতা করা হয়েছে, 1% এরও কম মানুষের পর্যালোচনার লক্ষ্যমাত্রা রয়েছে, এবং 100টি এলোমেলোভাবে নির্বাচিত স্কোর করা নমুনার পর্যালোচনাতে কোনও লেবেল ত্রুটির রিপোর্ট করেনি৷ এই দাবিগুলি এখানে স্বাধীনভাবে নিশ্চিত করা হয়নি।
উত্স বিবরণ: helpnetsecurity.com ↗
কেন এটা গুরুত্বপূর্ণ
ফলাফলগুলি পরামর্শ দেয় যে সন্দেহজনক কোড খুঁজে পাওয়ার ক্ষেত্রে শক্তিশালী কার্যকারিতা অগত্যা নির্ভরযোগ্য দুর্বলতা ট্রাইজে অনুবাদ করে না। উচ্চ মিথ্যা-ইতিবাচক হার নিরাপত্তা দলগুলিকে বোঝায় এবং সতর্কতার প্রতি আস্থাকে দুর্বল করতে পারে, যখন কঠোর প্রমাণের প্রয়োজনীয়তাগুলি মডেলগুলিকে প্রকৃত দুর্বলতাগুলি মিস করতে পারে৷ ফলাফলগুলি এআই-সহায়তা কোড পর্যালোচনা বা সুরক্ষা ক্রিয়াকলাপ বিবেচনা করে এমন সংস্থাগুলির জন্য প্রাসঙ্গিক, তবে তারা সম্পূর্ণ বাণিজ্যিক সুরক্ষা পণ্যগুলি পরিমাপ করে না।
বেঞ্চমার্ক এআই-সহায়তা সুরক্ষার একটি ব্যবহারিক দুর্বলতাকে সম্বোধন করে: একটি মডেল শোষণ প্রতিরোধকারী নিয়ন্ত্রণগুলি না বুঝেই একটি বিপজ্জনক চেহারার প্যাটার্ন চিনতে পারে। হেল্প নেট সিকিউরিটি রিপোর্ট করে যে সরাসরি প্রম্পটিং 41% থেকে 99% পর্যন্ত মিথ্যা-ইতিবাচক হার তৈরি করে, যেখানে নির্ভুলতা 52% থেকে 71% পর্যন্ত।
প্রতিবেদন অনুসারে, একটি দুর্বলতাকে বাস্তবে কাজে লাগানো যেতে পারে তা প্রমাণ করতে মডেলগুলিকে জিজ্ঞাসা করা মিথ্যা ইতিবাচককে 17 থেকে 74 শতাংশ পয়েন্ট কমিয়েছে, কিন্তু মিথ্যা-নেতিবাচক হার 7% এবং 44% এর মধ্যে বৃদ্ধি করেছে। AWS-এর উল্লিখিত ন্যূনতম উত্পাদন বার উভয় ব্যবস্থার জন্য 10% এর নিচে ছিল এবং পরীক্ষিত কনফিগারেশনের কোনোটিই উভয় থ্রেশহোল্ড পূরণ করেনি।
এই ফলাফলগুলি সম্পূর্ণ নিরাপত্তা পণ্যের র্যাঙ্কিং হিসাবে পড়া উচিত নয়। AWS সাধারণ-উদ্দেশ্যের মডেলগুলিতে একক-টার্ন প্রম্পট পরীক্ষা করেছে, উদ্দেশ্য-নির্মিত সিস্টেমগুলি নয় যা সরঞ্জাম ব্যবহার করে, বারবার বৈধতা বা এজেন্টিক ওয়ার্কফ্লো ব্যবহার করে। উত্সটি তাই মডেল-স্তরের দুর্বলতার রায় সম্পর্কে সতর্কতা সমর্থন করে, একটি উপসংহার নয় যে AI সুরক্ষা পণ্যগুলি সম্পূর্ণরূপে ব্যর্থ হয়৷
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
প্রকাশিত নমুনাগুলি ব্যবহার করে স্বাধীন মূল্যায়ন, টুল-ব্যবহার বা বহু-পদক্ষেপ সুরক্ষা সিস্টেমের ফলাফল এবং বাস্তব উত্পাদন পরিবেশে কর্মক্ষমতা সম্পর্কে প্রমাণের জন্য দেখুন। উৎসটি মূল্য, পরিষেবা-স্তরের অ্যাক্সেস, বা AWS-এর স্কোরিং প্রক্রিয়া সীমাবদ্ধতা ছাড়াই উপলব্ধ কিনা তা নথিভুক্ত করে না। এটিও প্রতিষ্ঠিত করে না যে পরীক্ষিত মডেলগুলি অপ্রকাশিত এন্টারপ্রাইজ কোডে একইভাবে কাজ করে।
স্বাধীন গবেষকরা AWS-এর রিপোর্ট করা ডেটা-জেনারেশন খরচ পুনরায় তৈরি না করেই পাবলিক নমুনা এবং মূল্যায়ন প্রক্রিয়া ব্যবহার করতে পারেন, কিন্তু আটকে রাখা লেবেল এবং AWS- যাচাইকৃত স্কোরিং বেঞ্চমার্ক-নির্দিষ্ট অপ্টিমাইজেশান সীমিত করার উদ্দেশ্যে। বাইরের গোষ্ঠীর দ্বারা প্রতিলিপি রিপোর্ট করা ফলাফল এবং লেবেল গুণমান পরীক্ষা করতে সাহায্য করবে।
ভবিষ্যত মূল্যায়নের জন্য সিঙ্গেল-পাস মডেলগুলিকে এমন সিস্টেমগুলির সাথে তুলনা করা উচিত যা সংগ্রহস্থলগুলি পরিদর্শন করে, কোডটি নিরাপদে কার্যকর করে, স্থাপনার কনফিগারেশনের উপর যুক্তি দেয় এবং সতর্কতা জারি করার আগে প্রমাণের প্রয়োজন হয়। এই পরীক্ষাগুলি কেবলমাত্র মডেলের ফলাফলগুলিতে কতটা ব্যবহারিক সুরক্ষা সরঞ্জাম উন্নত করে তা আরও ভালভাবে নির্দেশ করবে।
উত্সটি গুরুত্বপূর্ণ অজানা ছেড়ে যায়: এটি 12টি পরীক্ষিত মডেল কনফিগারেশন সনাক্ত করে না, সরবরাহ করা পাঠ্যে প্রতি-মডেলের ফলাফলের প্রতিবেদন করে, যাচাইকৃত স্কোরিংয়ের জন্য নথির মূল্য বা অ্যাক্সেসের শর্তাবলী, বা কীভাবে কার্যকারিতা মালিকানা কোডবেসে স্থানান্তরিত হয় এবং লাইভ নিরাপত্তা ক্রিয়াকলাপ দেখায় না।