خبروں پر واپس جائیں۔
سیکیورٹیAI Understanding بریفنگ

AWS بینچ مارک نے AI خطرے کا پتہ لگانے والے فلیگ سیف کوڈ تلاش کیا۔

ہیلپ نیٹ سیکیورٹی رپورٹ کرتی ہے کہ AWS نے ایک بینچ مارک پر 12 AI ماڈلز کا تجربہ کیا ہے تاکہ استحصالی کمزوریوں کو محفوظ کوڈ سے الگ کیا جا سکے جو صرف خطرناک نظر آتے ہیں۔ AWS کی جھوٹی-مثبت اور غلط-منفی دونوں شرحوں کے لیے کوئی بھی پیداواری حد کو پورا نہیں کرتا ہے۔

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
ماخذ حوالہماخذ ریکارڈ شدہ
پبلشر
helpnetsecurity.com
ماخذ لنک
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
ماخذ کی قسم
منسلک ذریعہ - بنیادی ماخذ کی حیثیت قائم نہیں کی گئی ہے۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
صحت سے متعلق
پیش گوئی کی گئی مثبتات کا تناسب جو حقیقت میں درست ہیں۔
اپنے آپ کو جانچیں۔AI ماڈلز نے کوئز کی وضاحت کی۔

کیا ہوا؟

ہیلپ نیٹ سیکیورٹی کی اطلاع ہے کہ AWS نے عوامی طور پر اپنا فریب بینچ مارک جاری کیا ہے، جو یہ جانچتا ہے کہ آیا AI ماڈلز گمراہ کن خطرے کے نمونوں پر مشتمل محفوظ کوڈ سے حقیقی سافٹ ویئر کی کمزوریوں میں فرق کر سکتے ہیں۔ بینچ مارک میں 14,822 نمونے شامل ہیں جن میں 16 پروگرامنگ زبانیں اور 70 سے زیادہ CWE زمرے ہیں۔ 9,695 اسکور کیے گئے ہیں اور 5,127 کو غیر اسکور شدہ نمونوں کے طور پر ملا دیا گیا ہے۔

ہیلپ نیٹ سیکیورٹی کی رپورٹ ہے کہ AWS نے پانچ فراہم کنندگان سے 12 عام مقصد کے ماڈلز کا جائزہ لیا ہے جو غلط مثبت کے ارد گرد ڈیزائن کردہ بینچ مارک استعمال کرتے ہیں۔ بینچ مارک کی محفوظ مثالوں میں تحفظات کے ساتھ حقیقی کمزوری کے نمونے ہوتے ہیں جو استحصال کو روکتے ہیں۔ کچھ چیلنجز تعیناتی کے حالات میں مختلف ہوتے ہیں، جیسے Kubernetes نیٹ ورک کی پالیسیاں، اس لیے ماڈل کو کوڈ اور اس کے ماحول دونوں پر غور کرنا چاہیے۔

رپورٹ کے مطابق، AWS نے فرنٹیئر ماڈلز کے خلاف مثالیں تیار کیں اور ان کو بہتر بنایا، ان نمونوں کو چھوڑ کر جن کی درجہ بندی کرنا بہت آسان تھا۔ AWS کا کہنا ہے کہ اس عمل نے دسیوں بلین ٹوکن استعمال کیے ہیں۔ کمپنی عوامی طور پر نمونے جاری کرتی ہے لیکن ان کے لیبل روک لیتی ہے۔ صارفین تصدیق شدہ اسکورنگ کے لیے AWS پر پیشین گوئیاں جمع کراتے ہیں۔ ذریعہ یہ نہیں بتاتا کہ آیا اسکورنگ تک رسائی فیس یا اہلیت کے دیگر تقاضے رکھتی ہے۔

مدد نیٹ سیکیورٹی رپورٹس کہ آزاد جائزہ لینے والے ایک دوسرے کے فیصلوں یا اصل استدلال کو دیکھے بغیر لیبل چیک کرتے ہیں۔ متنازعہ نمونوں کا مزید جائزہ لیا جاتا ہے، اور حل نہ ہونے والے معاملات کو بغیر اسکور شدہ سیٹ میں منتقل کر دیا جاتا ہے۔ AWS کا کہنا ہے کہ 3% سے کم سکور کیے گئے نمونے جائزے کے بعد مقابلہ کیے گئے ہیں، جس کا ہدف 1% سے کم زندہ بچ جانے والا انسانی جائزہ ہے، اور 100 تصادفی طور پر منتخب کیے گئے اسکور کیے گئے نمونوں کے جائزے میں کوئی لیبلنگ کی غلطیوں کی اطلاع نہیں ہے۔ یہاں ان دعوؤں کی آزادانہ طور پر تصدیق نہیں کی گئی ہے۔

ماخذ کی تفصیلات: helpnetsecurity.com ↗

یہ کیوں اہمیت رکھتا ہے۔

نتائج بتاتے ہیں کہ مشتبہ کوڈ کو تلاش کرنے پر مضبوط کارکردگی ضروری طور پر قابل اعتماد خطرے کی آزمائش میں ترجمہ نہیں کرتی ہے۔ اعلی غلط-مثبت شرحیں سیکیورٹی ٹیموں پر بوجھ ڈال سکتی ہیں اور الرٹس میں اعتماد کو کمزور کر سکتی ہیں، جبکہ ثبوت کے سخت تقاضے ماڈلز کو حقیقی خطرات سے محروم کر سکتے ہیں۔ نتائج ان تنظیموں سے متعلق ہیں جو AI کی مدد سے کوڈ کے جائزے یا سیکیورٹی آپریشنز پر غور کر رہے ہیں، لیکن وہ مکمل تجارتی سیکیورٹی مصنوعات کی پیمائش نہیں کرتے ہیں۔

بینچ مارک AI کی مدد سے سیکیورٹی میں ایک عملی کمزوری کو دور کرتا ہے: ایک ماڈل استحصال کو روکنے والے کنٹرولز کو سمجھے بغیر خطرناک نظر آنے والے پیٹرن کو پہچان سکتا ہے۔ ہیلپ نیٹ سیکیورٹی رپورٹ کرتی ہے کہ ڈائریکٹ پرمپٹنگ نے 41% سے 99% کی غلط مثبت شرحیں پیدا کیں، جبکہ درستگی 52% سے 71% تک ہے۔

Asking models to demonstrate that a vulnerability could actually be exploited reduced false positives by 17 to 74 percentage points, according to the report, but increased false-negative rates to between 7% and 44%. AWS’s stated minimum production bar was below 10% for both measures, and none of the tested configurations met both thresholds.

These results should not be read as a ranking of complete security products. AWS tested single-turn prompts on general-purpose models, not purpose-built systems that use tools, repeated validation, or agentic workflows. The source therefore supports caution about model-level vulnerability judgments, not a conclusion that AI security products as a whole fail.

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

آگے کیا دیکھنا ہے۔

جاری کردہ نمونوں کا استعمال کرتے ہوئے آزادانہ تشخیصات، ٹول کے استعمال یا ملٹی سٹیپ سیکیورٹی سسٹمز کے نتائج، اور حقیقی پیداواری ماحول میں کارکردگی کے بارے میں ثبوت دیکھیں۔ ماخذ قیمتوں کا تعین، سروس کی سطح تک رسائی، یا AWS کے اسکورنگ کا عمل بغیر کسی پابندی کے دستیاب ہے یا نہیں اس کی دستاویز نہیں کرتا ہے۔ اس سے یہ بھی ثابت نہیں ہوتا ہے کہ ٹیسٹ شدہ ماڈل نامعلوم انٹرپرائز کوڈ پر اسی طرح کی کارکردگی کا مظاہرہ کرتے ہیں۔

Independent researchers can use the public samples and evaluation process without recreating AWS’s reported data-generation costs, but withheld labels and AWS-verified scoring are intended to limit -specific optimization. Replication by outside groups would help test the reported results and labeling quality.

Future evaluations should compare single-pass models with systems that inspect repositories, execute code safely, reason over deployment configuration, and require evidence before issuing an alert. Those tests would better indicate how much practical security tooling improves on the model-only results.

The source leaves important unknowns: it does not identify the 12 tested model configurations, report per-model results in the supplied text, document pricing or access conditions for verified scoring, or show how performance transfers to proprietary codebases and live security operations.

متعلقہ گائیڈز اور کوئزز

AI ماڈلز کی وضاحتاے آئی اخلاقیاتPrompt Engineeringآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ریگولیشن ٹریکر پر عمل کریں۔
یہ مفید پایا؟