خبروں پر واپس جائیں۔
سیکیورٹیAI Understanding بریفنگ

مطالعہ سے پتہ چلتا ہے کہ اے آئی سیفٹی بینچ مارک بہت کم ٹیسٹ استعمال کر سکتے ہیں۔

UK AI سیکیورٹی انسٹی ٹیوٹ سے وابستہ پری پرنٹ نے 97–99% کم اشارے کے ساتھ کئی حفاظتی بینچ مارک کے نتائج کو دوبارہ پیش کیا، جبکہ انتباہ دیا کہ چھوٹے ٹیسٹ حقیقی دنیا کی حفاظت کو ثابت نہیں کرتے ہیں۔

5 min readRead the primary source
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
Rivera and colleagues' research paper on arXiv
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.05086
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

اے آئی سیفٹی
AI سسٹمز میں نقصان دہ رویے، ناکامیوں اور غلط استعمال کے خطرات کو کم کرنے پر توجہ مرکوز کرنے والا فیلڈ۔
API (ایپلی کیشن پروگرامنگ انٹرفیس)
ایک سافٹ ویئر سسٹم کے لیے دوسرے سسٹم کو درخواستیں بھیجنے اور اس سے جواب موصول کرنے کا ایک منظم طریقہ۔
سسٹم پرامپٹ
ایک اعلی ترجیحی ہدایت جو ماڈل کے لیے طرز عمل، پالیسی اور ردعمل کا انداز متعین کرتی ہے۔
اپنے آپ کو جانچیں۔AI کیا ہے؟ کوئز

کیا ہوا؟

5 اگست کو پوسٹ کیا گیا ایک تحقیقی مقالہ تعلیمی جانچ سے ایک طریقہ کا اطلاق کرتا ہے جس سے اندازہ لگایا جاسکتا ہے کہ AI حفاظتی معیارات کیا حاصل کرتے ہیں، مفید اشارے کے چھوٹے سیٹ منتخب کرتے ہیں، اور ماڈل کے رویے میں تبدیلیوں کا آڈٹ کرتے ہیں۔

دو آزاد محققین اور UK AI سیکورٹی انسٹی ٹیوٹ سے وابستہ دو محققین نے آٹھ معیارات پر 192 چیٹ ماڈلز کا جائزہ لیا جس میں نقصان دہ درخواست سے انکار، بے نظیر درخواستوں سے زیادہ انکار، متعلقہ نقصانات اور سچائی کا احاطہ کیا گیا ہے۔ مکمل سویٹ میں پری پروسیسنگ سے پہلے 5,255 پرامپٹس تھے۔ تجزیہ نے 5,067 کو برقرار رکھا غیر اسکور شدہ جوابات اور آئٹمز کو ہٹانے کے بعد جو ٹیسٹ شدہ ماڈلز میں فرق نہیں کرتے تھے۔

ٹیم نے ماڈلز کو ٹیسٹ لینے والوں اور بینچ مارک پرامپٹس کو ٹیسٹ آئٹمز کے طور پر سمجھا، آئٹم رسپانس تھیوری کا استعمال کرتے ہوئے اس بات کا اندازہ لگایا کہ کون سے اشارے مشکل تھے اور کون سے بہترین الگ الگ ماڈل۔ اس کے بنیادی عنصر کے تجزیے میں، ایک تین عنصری حل — جس کا خلاصہ انکار سختی، سچائی، اور سیاق و سباق کے نقصان کے طور پر کیا گیا — نے ماڈل کی صلاحیتوں میں 77٪ تغیرات کی وضاحت کی، اس کے مقابلے میں ایک عنصر کے لیے 47٪۔

منعقدہ 20 جائزوں میں، تین فکسڈ 25-پرامپٹ ٹیسٹوں نے ان تینوں عوامل کو بازیافت کیا جو سوٹ کے 2% سے بھی کم استعمال کرتے ہیں۔ HarmBench، SORRY-Bench، اور OR-Bench-Hard کے لیے، تقریباً 10 انکولی طور پر منتخب کیے گئے پرامپٹس نے 0.92 سے 0.94 کے ارتباط کے ساتھ مکمل بینچ مارک رینکنگ کو دوبارہ پیش کیا اور پرامپٹس کی تعداد کو 97–99% تک کم کر دیا۔ ٹیسٹ بجٹ بڑھنے کے ساتھ فائدہ کم ہوتا گیا۔

کمپریشن صرف بے ترتیب نمونے نہیں ہے۔ آئٹم رسپانس تھیوری کا اندازہ لگایا جاتا ہے کہ ہر پرامپٹ کتنا مشکل ہے اور یہ مختلف ردعمل کے نمونوں کے ساتھ ماڈلز کو کتنی اچھی طرح سے الگ کرتا ہے، پھر ایسی اشیاء کو منتخب کرتا ہے جو بڑے ٹیسٹ کی ساخت کو محفوظ رکھتی ہیں۔ مصنفین نے انکولی انتخاب کے ساتھ مقررہ مختصر شکلوں کا موازنہ کیا اور صرف اشارے کو منتخب کرنے کے لئے استعمال ہونے والے اعداد و شمار کی پیمائش کرنے کے بجائے تشخیصات کا انعقاد کیا۔ یہ ڈیزائن اس تنگ دعوے کی حمایت کرتا ہے کہ کچھ موجودہ بینچ مارک درجہ بندی کو مؤثر طریقے سے دوبارہ پیش کیا جا سکتا ہے۔ یہ ظاہر نہیں کرتا ہے کہ 10- یا 25-آئٹم ٹیسٹ مکمل طور پر ایک نیا ناکامی موڈ دریافت کر سکتا ہے۔

ماخذ کی تفصیلات: Rivera and colleagues' research paper on arXiv ↗

یہ کیوں اہمیت رکھتا ہے۔

مطالعہ سے پتہ چلتا ہے کہ بہتر طور پر منتخب کردہ اشارے بار بار اے آئی سیفٹی چیک کو سستا بنا سکتے ہیں یہ بہانہ کیے بغیر کہ ہر بینچ مارک ایک یونیورسل سیفٹی سکور کی پیمائش کرتا ہے۔

سستے ٹیسٹ سے ڈویلپرز، چھوٹی لیبارٹریز، اور آزاد تشخیص کاروں کو ٹریننگ، فائن ٹیوننگ، کوانٹائزیشن، اور سسٹم میں فوری تبدیلیوں کے دوران مزید ماڈل ورژن چیک کرنے کا موقع مل سکتا ہے۔ نتیجہ موجودہ بینچ مارک کی پیمائش کو مؤثر طریقے سے دوبارہ تیار کرنے کے بارے میں ہے، نہ کہ ان معیارات کا پتہ لگانے کے بارے میں۔

عنصر کا تجزیہ اسکورنگ ٹریڈ آف کو بھی ظاہر کرتا ہے۔ بینچ مارکس جو انعام سے انکار کرتے ہیں ایک دوسرے کے ساتھ اوورلیپ ہو سکتے ہیں، جبکہ غیر ضروری انکار سے بچنے کے لیے ایک بینچ مارک مخالف رویے کا بدلہ دیتا ہے۔ وزن کی وضاحت کیے بغیر ان کا اوسط چھپا سکتا ہے کہ آیا کوئی ماڈل زیادہ محفوظ، محض زیادہ پابندی والا، یا سومی درخواستوں پر کم مفید ہے۔

اس مقالے میں بلیک باکس آڈٹ کے طریقوں کا بھی جان بوجھ کر اشارہ کیا گیا سینڈ بیگنگ کے رویے پر کیا گیا۔ جوابی نمونہ کی جانچ نے منتخب کم کارکردگی کو پکڑا لیکن زیادہ تر یکساں کم کارکردگی سے محروم رہ گیا۔ تاریخی قابلیت کی جانچ کو شامل کرنے سے نقلی مقدمات میں مشترکہ کھوج کو 94-97% تک بڑھا دیا گیا۔ یہ کسی ایک سکور پر انحصار کرنے کے بجائے پرتوں والے آڈٹ کی حمایت کرتا ہے۔

ڈویلپرز کے لیے آپریشنل ویلیو فریکوئنسی ہے۔ ہر بار مکمل بینچ مارک کے بجٹ کو استعمال کیے بغیر نظام کی فوری تبدیلی، کوانٹائزیشن پاس، فائن ٹیون، ٹول اپ ڈیٹ، یا حفاظتی پالیسی پر نظرثانی کے بعد ایک چھوٹا جائزہ دوبارہ چلایا جا سکتا ہے۔ لیکن نتیجہ صرف اس وقت کارآمد ہوتا ہے جب ٹیمیں اصل سوٹ کو وقتاً فوقتاً آڈٹ کے طور پر رکھیں، ہولڈ آؤٹ پرامپٹس کو گھمائیں، اور کمپریسڈ ٹیسٹ کے لیے براہ راست بہتر بنانے کے بجائے حیران کن تبدیلیوں کی چھان بین کریں۔ بصورت دیگر سستا چیک اوور فٹنگ کا ایک اور ہدف بن سکتا ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
انٹرایکٹو تصور چیک+10 Points
What is AI? Quiz

Which description best fits "narrow AI", the kind of AI in use today?

آگے کیا دیکھنا ہے۔

آزاد نقل، مستقبل کے ماڈل فیملیز کی توثیق، اور اس ثبوت کے لیے دیکھیں کہ مختصر کیے گئے ٹیسٹ ان معیارات سے باہر رویے کی پیش گوئی کرتے ہیں جنہیں دوبارہ پیش کرنے کے لیے ڈیزائن کیا گیا تھا۔

یہ ایک نیا پری پرنٹ ہے، مکمل ہم مرتبہ نظرثانی کا فیصلہ نہیں۔ اویکت ساخت کے تجزیے میں 134 ماڈلز کا استعمال کیا گیا، جو مصنفین نوٹ کرتے ہیں کہ روایتی سائیکو میٹرک معیارات کے لحاظ سے چھوٹے ہیں، اور ایک متبادل نکالنے کا طریقہ تین کے بجائے دو عوامل کو برقرار رکھتا ہے۔ عنصر کے نام تجرباتی خلاصے ہیں، حفاظت کی توثیق شدہ تعریفیں نہیں۔

ہر ماڈل نے OpenRouter کے ذریعے فی دستیاب پرامپ ایک جواب تیار کیا، اور ہر بینچ مارک نے اپنے مقرر کردہ خودکار جج کا استعمال کیا۔ نتیجے میں آنے والے مختصر ٹیسٹ اصل اشارے، اسکورنگ کے قواعد، زبان کی کوریج، اور ججوں میں خامیاں پیدا کر سکتے ہیں۔ مصنفین واضح طور پر کہتے ہیں کہ کمپریشن یہ ظاہر نہیں کرتا ہے کہ ایک بینچ مارک تعیناتی کی حفاظت کی پیش گوئی کرتا ہے یا مستقبل کے ماڈلز کے لیے معلوماتی رہتا ہے۔

سینڈ بیگنگ ٹیسٹوں میں جانچ سے بچنے کے لیے عمدہ ماڈلز کے بجائے پرامپٹ ماڈل آرگنزم کا استعمال کیا گیا، جس کا پتہ لگانا آسان ہو سکتا ہے۔ API چیکس رویے کا تسلسل قائم کرتے ہیں، نہ کہ چھپے ہوئے ماڈل وزن کی شناخت، اور مطالعہ نے آڈٹ کے طریقوں کو شکست دینے کے لیے خاص طور پر تربیت یافتہ مخالف کی جانچ نہیں کی۔

کاغذ کی سب سے اہم حد پیمائش کی کارکردگی اور حفاظت کی یقین دہانی کے درمیان ہے۔ ایک مختصر شکل اصل بینچ مارک میں موجود پوشیدہ عوامل کا اندازہ لگا سکتی ہے، لیکن یہ اس بینچ مارک کی زبان، جج، پرامپٹ فریمنگ، اور بلائنڈ اسپاٹس کو وراثت میں ملتی ہے۔ مستقبل کے تجزیوں میں کثیر لسانی اشارے، ٹول سے چلنے والے ایجنٹوں، طویل گفتگو، مخالفانہ طور پر ٹھیک بنائے گئے ماڈلز، اور آزاد انسانی فیصلوں کی جانچ ہونی چاہیے۔ جب کوئی کمپریسڈ سکور غیر مستحکم ہو جائے تو انہیں اس کی اطلاع بھی دینی چاہیے، کیونکہ ہولڈ آؤٹ ڈیٹا پر ایک صاف ارتباط اگلے ماڈل فیملی کی ناکامی کو چھپا سکتا ہے۔

ایک عملی اپنانے کا قاعدہ ان حدود کی پیروی کرتا ہے: کمپریسڈ ٹیسٹ کو سینٹینلز کے طور پر استعمال کریں، فیصلوں کی نہیں۔ ٹیمیں رجعت کو پکڑنے کے لیے انہیں کثرت سے چلا سکتی ہیں، پھر مکمل بینچ مارک اور انسانی جائزے میں تبدیلی کو بڑھا سکتی ہیں جب مختصر شکل غیر متوقع طور پر حرکت میں آتی ہے۔ مطالعہ کے اپنے شواہد اس تہہ دار ورک فلو کی حمایت کرتے ہیں کیونکہ فیکٹر ڈھانچہ مخصوص اشارے، ججز، اور ماڈل آؤٹ پٹ سے اخذ کیا گیا تھا۔ منتخب کردہ آئٹمز، سلیکشن کوڈ، ہولڈ آؤٹ نتائج، اور ورژن کی سرگزشت کو شائع کرنے سے آزاد تشخیص کاروں کو یہ جانچنے کا موقع ملے گا کہ آیا مختصر ٹیسٹ ڈیولپرز کے دیکھنے کے بعد اور نئے ماڈل فیملیز کے جوابات کی تقسیم کو تبدیل کرنے کے بعد معلوماتی رہتے ہیں۔

جب کسی ماڈل کو اپ ڈیٹ کیا جاتا ہے تو وہی شفافیت اہمیت رکھتی ہے۔ ایک نسل پر کیلیبریٹ کردہ ایک مختصر ٹیسٹ بہت آسان، بہت تنگ، یا حادثاتی طور پر نئے سسٹم پرامپٹ کے ساتھ منسلک ہو سکتا ہے۔ ٹیموں کو پہلے کے ورژنز کو محفوظ رکھنا چاہیے، جب کوئی آئٹم یا جج تبدیل ہوتا ہے تو اس کا انکشاف کرنا چاہیے، اور کمپریسڈ رینکنگ کو درست حفاظتی سکور کے طور پر پیش کرنے کے بجائے اعتماد کے وقفوں کی اطلاع دینا چاہیے۔ یہ طرز عمل کاغذ کی کارکردگی کے نتائج کو قابل سماعت مانیٹرنگ پروگرام میں بدل دیتے ہیں جبکہ اصل بینچ مارک کو گہرے جائزے کے لیے دستیاب رکھتے ہیں۔

متعلقہ گائیڈز اور کوئزز

AI کیا ہے؟ChatGPT اور ایل ایل ایماے آئی اخلاقیاتآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ریگولیشن ٹریکر پر عمل کریں۔
یہ مفید پایا؟