समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

AWS बेंचमार्क AI भेद्यता डिटेक्टरों को ध्वज सुरक्षित कोड ढूंढता है

हेल्प नेट सिक्योरिटी की रिपोर्ट है कि AWS ने एक बेंचमार्क पर 12 AI मॉडल का परीक्षण किया, जो कि केवल खतरनाक दिखने वाले सुरक्षित कोड से शोषक कमजोरियों को अलग करने के लिए डिज़ाइन किया गया है। झूठी-सकारात्मक और झूठी-नकारात्मक दोनों दरों के लिए AWS की बताई गई उत्पादन सीमा को कोई भी पूरा नहीं कर पाया।

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
स्रोत संदर्भस्रोत रिकार्ड किया गया
प्रकाशक
helpnetsecurity.com
स्रोत लिंक
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
स्रोत प्रकार
लिंक्ड स्रोत - प्राथमिक-स्रोत स्थिति स्थापित नहीं की गई है।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
परिशुद्धता
पूर्वानुमानित सकारात्मकताओं का अनुपात जो वास्तव में सही है।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

हेल्प नेट सिक्योरिटी की रिपोर्ट है कि AWS ने सार्वजनिक रूप से अपना डिसेप्शन बेंचमार्क जारी किया है, जो परीक्षण करता है कि क्या AI मॉडल वास्तविक सॉफ़्टवेयर कमजोरियों को भ्रामक भेद्यता पैटर्न वाले सुरक्षित कोड से अलग कर सकते हैं। बेंचमार्क में 16 प्रोग्रामिंग भाषाओं और 70 से अधिक सीडब्ल्यूई श्रेणियों में फैले 14,822 नमूने शामिल हैं; 9,695 को स्कोर किया गया है और 5,127 को बिना स्कोर वाले नमूनों के रूप में मिलाया गया है।

हेल्प नेट सिक्योरिटी की रिपोर्ट है कि AWS ने झूठी सकारात्मकता के आधार पर डिज़ाइन किए गए बेंचमार्क का उपयोग करके पांच प्रदाताओं के 12 सामान्य-उद्देश्य वाले मॉडल का मूल्यांकन किया। बेंचमार्क के सुरक्षित उदाहरणों में शोषण को रोकने वाली सुरक्षा के साथ-साथ वास्तविक भेद्यता पैटर्न भी शामिल हैं। कुछ चुनौतियाँ परिनियोजन स्थितियों में भिन्न होती हैं, जैसे कि कुबेरनेट्स नेटवर्क नीतियां, इसलिए एक मॉडल को कोड और उसके वातावरण दोनों पर विचार करना चाहिए।

रिपोर्ट के अनुसार, AWS ने उन नमूनों को छोड़कर, जिन्हें वर्गीकृत करना बहुत आसान था, सीमांत मॉडलों के विरुद्ध उदाहरण तैयार किए और परिष्कृत किए। AWS का कहना है कि इस प्रक्रिया में दसियों अरब टोकन की खपत हुई। कंपनी सार्वजनिक रूप से नमूने जारी करती है लेकिन उनके लेबल रोक देती है; सत्यापित स्कोरिंग के लिए उपयोगकर्ता AWS पर पूर्वानुमान प्रस्तुत करते हैं। स्रोत यह नहीं बताता है कि स्कोरिंग तक पहुंच के लिए शुल्क या अन्य पात्रता आवश्यकताएं हैं या नहीं।

हेल्प नेट सिक्योरिटी की रिपोर्ट है कि स्वतंत्र समीक्षक एक-दूसरे के निर्णय या मूल तर्क को देखे बिना लेबल की जाँच करते हैं। विवादित नमूनों की आगे समीक्षा की जाती है, और अनसुलझे मामलों को अनस्कोर्ड सेट में ले जाया जाता है। AWS का कहना है कि 3% से भी कम स्कोर किए गए नमूने समीक्षा के बाद विवादित रह जाते हैं, 1% से कम जीवित मानव समीक्षा का लक्ष्य होता है, और 100 यादृच्छिक रूप से चयनित स्कोर किए गए नमूनों की समीक्षा में कोई लेबलिंग त्रुटि नहीं होने की रिपोर्ट करता है। यहां इन दावों की स्वतंत्र रूप से पुष्टि नहीं की गई है।

स्रोत विवरण: helpnetsecurity.com ↗

यह क्यों मायने रखता है?

नतीजे बताते हैं कि संदिग्ध कोड खोजने पर मजबूत प्रदर्शन जरूरी नहीं कि विश्वसनीय भेद्यता ट्राइएज में तब्दील हो। उच्च झूठी-सकारात्मक दरें सुरक्षा टीमों पर बोझ डाल सकती हैं और अलर्ट में विश्वास को कमजोर कर सकती हैं, जबकि सख्त प्रमाण आवश्यकताओं के कारण मॉडल वास्तविक कमजोरियों से चूक सकते हैं। निष्कर्ष एआई-सहायता प्राप्त कोड समीक्षा या सुरक्षा संचालन पर विचार करने वाले संगठनों के लिए प्रासंगिक हैं, लेकिन वे संपूर्ण वाणिज्यिक सुरक्षा उत्पादों को नहीं मापते हैं।

बेंचमार्क एआई-सहायता प्राप्त सुरक्षा में एक व्यावहारिक कमजोरी को संबोधित करता है: एक मॉडल शोषण को रोकने वाले नियंत्रणों को समझे बिना खतरनाक दिखने वाले पैटर्न को पहचान सकता है। हेल्प नेट सिक्योरिटी की रिपोर्ट है कि प्रत्यक्ष संकेत से 41% से 99% तक गलत-सकारात्मक दर उत्पन्न हुई, जबकि सटीकता 52% से 71% तक थी।

रिपोर्ट के अनुसार, मॉडलों से यह प्रदर्शित करने के लिए कहने पर कि किसी भेद्यता का वास्तव में फायदा उठाया जा सकता है, झूठी सकारात्मकता को 17 से 74 प्रतिशत अंक तक कम कर दिया, लेकिन झूठी-नकारात्मक दरों को 7% से 44% के बीच बढ़ा दिया। AWS का बताया गया न्यूनतम उत्पादन बार दोनों उपायों के लिए 10% से कम था, और कोई भी परीक्षण किया गया कॉन्फ़िगरेशन दोनों सीमाओं को पूरा नहीं करता था।

इन परिणामों को संपूर्ण सुरक्षा उत्पादों की रैंकिंग के रूप में नहीं पढ़ा जाना चाहिए। AWS ने सामान्य-उद्देश्य वाले मॉडल पर सिंगल-टर्न प्रॉम्प्ट का परीक्षण किया, न कि उद्देश्य-निर्मित सिस्टम पर जो टूल, बार-बार सत्यापन, या एजेंटिक वर्कफ़्लो का उपयोग करते हैं। इसलिए स्रोत मॉडल-स्तरीय भेद्यता निर्णयों के बारे में सावधानी का समर्थन करता है, न कि इस निष्कर्ष का कि एआई सुरक्षा उत्पाद पूरी तरह से विफल हैं।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

जारी किए गए नमूनों का उपयोग करके स्वतंत्र मूल्यांकन, टूल-उपयोग या बहु-चरणीय सुरक्षा प्रणालियों के परिणाम और वास्तविक उत्पादन वातावरण में प्रदर्शन के बारे में साक्ष्य पर नज़र रखें। स्रोत मूल्य निर्धारण, सेवा-स्तर की पहुंच, या AWS की स्कोरिंग प्रक्रिया बिना किसी प्रतिबंध के उपलब्ध है या नहीं, इसका दस्तावेजीकरण नहीं करता है। यह भी स्थापित नहीं करता है कि परीक्षण किए गए मॉडल अज्ञात एंटरप्राइज़ कोड पर समान प्रदर्शन करते हैं।

स्वतंत्र शोधकर्ता AWS की रिपोर्ट की गई डेटा-जनरेशन लागत को दोबारा बनाए बिना सार्वजनिक नमूनों और मूल्यांकन प्रक्रिया का उपयोग कर सकते हैं, लेकिन रोके गए लेबल और AWS-सत्यापित स्कोरिंग का उद्देश्य बेंचमार्क-विशिष्ट अनुकूलन को सीमित करना है। बाहरी समूहों द्वारा प्रतिकृति से रिपोर्ट किए गए परिणामों और लेबलिंग गुणवत्ता का परीक्षण करने में मदद मिलेगी।

भविष्य के मूल्यांकन में सिंगल-पास मॉडल की तुलना उन प्रणालियों से की जानी चाहिए जो रिपॉजिटरी का निरीक्षण करते हैं, कोड को सुरक्षित रूप से निष्पादित करते हैं, तैनाती कॉन्फ़िगरेशन पर तर्क करते हैं, और अलर्ट जारी करने से पहले साक्ष्य की आवश्यकता होती है। वे परीक्षण बेहतर संकेत देंगे कि मॉडल-केवल परिणामों पर व्यावहारिक सुरक्षा टूलींग कितना सुधार करती है।

स्रोत महत्वपूर्ण अज्ञात छोड़ता है: यह 12 परीक्षण किए गए मॉडल कॉन्फ़िगरेशन की पहचान नहीं करता है, आपूर्ति किए गए पाठ में प्रति-मॉडल परिणामों की रिपोर्ट नहीं करता है, दस्तावेज़ मूल्य निर्धारण या सत्यापित स्कोरिंग के लिए पहुंच की स्थिति, या यह नहीं दिखाता है कि प्रदर्शन मालिकाना कोडबेस और लाइव सुरक्षा संचालन में कैसे स्थानांतरित होता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई नैतिकताPrompt Engineeringआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?