क्या हुआ?
हेल्प नेट सिक्योरिटी की रिपोर्ट है कि AWS ने सार्वजनिक रूप से अपना डिसेप्शन बेंचमार्क जारी किया है, जो परीक्षण करता है कि क्या AI मॉडल वास्तविक सॉफ़्टवेयर कमजोरियों को भ्रामक भेद्यता पैटर्न वाले सुरक्षित कोड से अलग कर सकते हैं। बेंचमार्क में 16 प्रोग्रामिंग भाषाओं और 70 से अधिक सीडब्ल्यूई श्रेणियों में फैले 14,822 नमूने शामिल हैं; 9,695 को स्कोर किया गया है और 5,127 को बिना स्कोर वाले नमूनों के रूप में मिलाया गया है।
हेल्प नेट सिक्योरिटी की रिपोर्ट है कि AWS ने झूठी सकारात्मकता के आधार पर डिज़ाइन किए गए बेंचमार्क का उपयोग करके पांच प्रदाताओं के 12 सामान्य-उद्देश्य वाले मॉडल का मूल्यांकन किया। बेंचमार्क के सुरक्षित उदाहरणों में शोषण को रोकने वाली सुरक्षा के साथ-साथ वास्तविक भेद्यता पैटर्न भी शामिल हैं। कुछ चुनौतियाँ परिनियोजन स्थितियों में भिन्न होती हैं, जैसे कि कुबेरनेट्स नेटवर्क नीतियां, इसलिए एक मॉडल को कोड और उसके वातावरण दोनों पर विचार करना चाहिए।
रिपोर्ट के अनुसार, AWS ने उन नमूनों को छोड़कर, जिन्हें वर्गीकृत करना बहुत आसान था, सीमांत मॉडलों के विरुद्ध उदाहरण तैयार किए और परिष्कृत किए। AWS का कहना है कि इस प्रक्रिया में दसियों अरब टोकन की खपत हुई। कंपनी सार्वजनिक रूप से नमूने जारी करती है लेकिन उनके लेबल रोक देती है; सत्यापित स्कोरिंग के लिए उपयोगकर्ता AWS पर पूर्वानुमान प्रस्तुत करते हैं। स्रोत यह नहीं बताता है कि स्कोरिंग तक पहुंच के लिए शुल्क या अन्य पात्रता आवश्यकताएं हैं या नहीं।
हेल्प नेट सिक्योरिटी की रिपोर्ट है कि स्वतंत्र समीक्षक एक-दूसरे के निर्णय या मूल तर्क को देखे बिना लेबल की जाँच करते हैं। विवादित नमूनों की आगे समीक्षा की जाती है, और अनसुलझे मामलों को अनस्कोर्ड सेट में ले जाया जाता है। AWS का कहना है कि 3% से भी कम स्कोर किए गए नमूने समीक्षा के बाद विवादित रह जाते हैं, 1% से कम जीवित मानव समीक्षा का लक्ष्य होता है, और 100 यादृच्छिक रूप से चयनित स्कोर किए गए नमूनों की समीक्षा में कोई लेबलिंग त्रुटि नहीं होने की रिपोर्ट करता है। यहां इन दावों की स्वतंत्र रूप से पुष्टि नहीं की गई है।
स्रोत विवरण: helpnetsecurity.com ↗
यह क्यों मायने रखता है?
नतीजे बताते हैं कि संदिग्ध कोड खोजने पर मजबूत प्रदर्शन जरूरी नहीं कि विश्वसनीय भेद्यता ट्राइएज में तब्दील हो। उच्च झूठी-सकारात्मक दरें सुरक्षा टीमों पर बोझ डाल सकती हैं और अलर्ट में विश्वास को कमजोर कर सकती हैं, जबकि सख्त प्रमाण आवश्यकताओं के कारण मॉडल वास्तविक कमजोरियों से चूक सकते हैं। निष्कर्ष एआई-सहायता प्राप्त कोड समीक्षा या सुरक्षा संचालन पर विचार करने वाले संगठनों के लिए प्रासंगिक हैं, लेकिन वे संपूर्ण वाणिज्यिक सुरक्षा उत्पादों को नहीं मापते हैं।
बेंचमार्क एआई-सहायता प्राप्त सुरक्षा में एक व्यावहारिक कमजोरी को संबोधित करता है: एक मॉडल शोषण को रोकने वाले नियंत्रणों को समझे बिना खतरनाक दिखने वाले पैटर्न को पहचान सकता है। हेल्प नेट सिक्योरिटी की रिपोर्ट है कि प्रत्यक्ष संकेत से 41% से 99% तक गलत-सकारात्मक दर उत्पन्न हुई, जबकि सटीकता 52% से 71% तक थी।
रिपोर्ट के अनुसार, मॉडलों से यह प्रदर्शित करने के लिए कहने पर कि किसी भेद्यता का वास्तव में फायदा उठाया जा सकता है, झूठी सकारात्मकता को 17 से 74 प्रतिशत अंक तक कम कर दिया, लेकिन झूठी-नकारात्मक दरों को 7% से 44% के बीच बढ़ा दिया। AWS का बताया गया न्यूनतम उत्पादन बार दोनों उपायों के लिए 10% से कम था, और कोई भी परीक्षण किया गया कॉन्फ़िगरेशन दोनों सीमाओं को पूरा नहीं करता था।
इन परिणामों को संपूर्ण सुरक्षा उत्पादों की रैंकिंग के रूप में नहीं पढ़ा जाना चाहिए। AWS ने सामान्य-उद्देश्य वाले मॉडल पर सिंगल-टर्न प्रॉम्प्ट का परीक्षण किया, न कि उद्देश्य-निर्मित सिस्टम पर जो टूल, बार-बार सत्यापन, या एजेंटिक वर्कफ़्लो का उपयोग करते हैं। इसलिए स्रोत मॉडल-स्तरीय भेद्यता निर्णयों के बारे में सावधानी का समर्थन करता है, न कि इस निष्कर्ष का कि एआई सुरक्षा उत्पाद पूरी तरह से विफल हैं।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
जारी किए गए नमूनों का उपयोग करके स्वतंत्र मूल्यांकन, टूल-उपयोग या बहु-चरणीय सुरक्षा प्रणालियों के परिणाम और वास्तविक उत्पादन वातावरण में प्रदर्शन के बारे में साक्ष्य पर नज़र रखें। स्रोत मूल्य निर्धारण, सेवा-स्तर की पहुंच, या AWS की स्कोरिंग प्रक्रिया बिना किसी प्रतिबंध के उपलब्ध है या नहीं, इसका दस्तावेजीकरण नहीं करता है। यह भी स्थापित नहीं करता है कि परीक्षण किए गए मॉडल अज्ञात एंटरप्राइज़ कोड पर समान प्रदर्शन करते हैं।
स्वतंत्र शोधकर्ता AWS की रिपोर्ट की गई डेटा-जनरेशन लागत को दोबारा बनाए बिना सार्वजनिक नमूनों और मूल्यांकन प्रक्रिया का उपयोग कर सकते हैं, लेकिन रोके गए लेबल और AWS-सत्यापित स्कोरिंग का उद्देश्य बेंचमार्क-विशिष्ट अनुकूलन को सीमित करना है। बाहरी समूहों द्वारा प्रतिकृति से रिपोर्ट किए गए परिणामों और लेबलिंग गुणवत्ता का परीक्षण करने में मदद मिलेगी।
भविष्य के मूल्यांकन में सिंगल-पास मॉडल की तुलना उन प्रणालियों से की जानी चाहिए जो रिपॉजिटरी का निरीक्षण करते हैं, कोड को सुरक्षित रूप से निष्पादित करते हैं, तैनाती कॉन्फ़िगरेशन पर तर्क करते हैं, और अलर्ट जारी करने से पहले साक्ष्य की आवश्यकता होती है। वे परीक्षण बेहतर संकेत देंगे कि मॉडल-केवल परिणामों पर व्यावहारिक सुरक्षा टूलींग कितना सुधार करती है।
स्रोत महत्वपूर्ण अज्ञात छोड़ता है: यह 12 परीक्षण किए गए मॉडल कॉन्फ़िगरेशन की पहचान नहीं करता है, आपूर्ति किए गए पाठ में प्रति-मॉडल परिणामों की रिपोर्ट नहीं करता है, दस्तावेज़ मूल्य निर्धारण या सत्यापित स्कोरिंग के लिए पहुंच की स्थिति, या यह नहीं दिखाता है कि प्रदर्शन मालिकाना कोडबेस और लाइव सुरक्षा संचालन में कैसे स्थानांतरित होता है।