کیا ہوا؟
5 اگست کو پوسٹ کیا گیا ایک تحقیقی مقالہ تعلیمی جانچ سے ایک طریقہ کا اطلاق کرتا ہے جس سے اندازہ لگایا جاسکتا ہے کہ AI حفاظتی معیارات کیا حاصل کرتے ہیں، مفید اشارے کے چھوٹے سیٹ منتخب کرتے ہیں، اور ماڈل کے رویے میں تبدیلیوں کا آڈٹ کرتے ہیں۔
دو آزاد محققین اور UK AI سیکورٹی انسٹی ٹیوٹ سے وابستہ دو محققین نے آٹھ معیارات پر 192 چیٹ ماڈلز کا جائزہ لیا جس میں نقصان دہ درخواست سے انکار، بے نظیر درخواستوں سے زیادہ انکار، متعلقہ نقصانات اور سچائی کا احاطہ کیا گیا ہے۔ مکمل سویٹ میں پری پروسیسنگ سے پہلے 5,255 پرامپٹس تھے۔ تجزیہ نے 5,067 کو برقرار رکھا غیر اسکور شدہ جوابات اور آئٹمز کو ہٹانے کے بعد جو ٹیسٹ شدہ ماڈلز میں فرق نہیں کرتے تھے۔
ٹیم نے ماڈلز کو ٹیسٹ لینے والوں اور بینچ مارک پرامپٹس کو ٹیسٹ آئٹمز کے طور پر سمجھا، آئٹم رسپانس تھیوری کا استعمال کرتے ہوئے اس بات کا اندازہ لگایا کہ کون سے اشارے مشکل تھے اور کون سے بہترین الگ الگ ماڈل۔ اس کے بنیادی عنصر کے تجزیے میں، ایک تین عنصری حل — جس کا خلاصہ انکار سختی، سچائی، اور سیاق و سباق کے نقصان کے طور پر کیا گیا — نے ماڈل کی صلاحیتوں میں 77٪ تغیرات کی وضاحت کی، اس کے مقابلے میں ایک عنصر کے لیے 47٪۔
منعقدہ 20 جائزوں میں، تین فکسڈ 25-پرامپٹ ٹیسٹوں نے ان تینوں عوامل کو بازیافت کیا جو سوٹ کے 2% سے بھی کم استعمال کرتے ہیں۔ HarmBench، SORRY-Bench، اور OR-Bench-Hard کے لیے، تقریباً 10 انکولی طور پر منتخب کیے گئے پرامپٹس نے 0.92 سے 0.94 کے ارتباط کے ساتھ مکمل بینچ مارک رینکنگ کو دوبارہ پیش کیا اور پرامپٹس کی تعداد کو 97–99% تک کم کر دیا۔ ٹیسٹ بجٹ بڑھنے کے ساتھ فائدہ کم ہوتا گیا۔
کمپریشن صرف بے ترتیب نمونے نہیں ہے۔ آئٹم رسپانس تھیوری کا اندازہ لگایا جاتا ہے کہ ہر پرامپٹ کتنا مشکل ہے اور یہ مختلف ردعمل کے نمونوں کے ساتھ ماڈلز کو کتنی اچھی طرح سے الگ کرتا ہے، پھر ایسی اشیاء کو منتخب کرتا ہے جو بڑے ٹیسٹ کی ساخت کو محفوظ رکھتی ہیں۔ مصنفین نے انکولی انتخاب کے ساتھ مقررہ مختصر شکلوں کا موازنہ کیا اور صرف اشارے کو منتخب کرنے کے لئے استعمال ہونے والے اعداد و شمار کی پیمائش کرنے کے بجائے تشخیصات کا انعقاد کیا۔ یہ ڈیزائن اس تنگ دعوے کی حمایت کرتا ہے کہ کچھ موجودہ بینچ مارک درجہ بندی کو مؤثر طریقے سے دوبارہ پیش کیا جا سکتا ہے۔ یہ ظاہر نہیں کرتا ہے کہ 10- یا 25-آئٹم ٹیسٹ مکمل طور پر ایک نیا ناکامی موڈ دریافت کر سکتا ہے۔
ماخذ کی تفصیلات: Rivera and colleagues' research paper on arXiv ↗
یہ کیوں اہمیت رکھتا ہے۔
مطالعہ سے پتہ چلتا ہے کہ بہتر طور پر منتخب کردہ اشارے بار بار اے آئی سیفٹی چیک کو سستا بنا سکتے ہیں یہ بہانہ کیے بغیر کہ ہر بینچ مارک ایک یونیورسل سیفٹی سکور کی پیمائش کرتا ہے۔
سستے ٹیسٹ سے ڈویلپرز، چھوٹی لیبارٹریز، اور آزاد تشخیص کاروں کو ٹریننگ، فائن ٹیوننگ، کوانٹائزیشن، اور سسٹم میں فوری تبدیلیوں کے دوران مزید ماڈل ورژن چیک کرنے کا موقع مل سکتا ہے۔ نتیجہ موجودہ بینچ مارک کی پیمائش کو مؤثر طریقے سے دوبارہ تیار کرنے کے بارے میں ہے، نہ کہ ان معیارات کا پتہ لگانے کے بارے میں۔
عنصر کا تجزیہ اسکورنگ ٹریڈ آف کو بھی ظاہر کرتا ہے۔ بینچ مارکس جو انعام سے انکار کرتے ہیں ایک دوسرے کے ساتھ اوورلیپ ہو سکتے ہیں، جبکہ غیر ضروری انکار سے بچنے کے لیے ایک بینچ مارک مخالف رویے کا بدلہ دیتا ہے۔ وزن کی وضاحت کیے بغیر ان کا اوسط چھپا سکتا ہے کہ آیا کوئی ماڈل زیادہ محفوظ، محض زیادہ پابندی والا، یا سومی درخواستوں پر کم مفید ہے۔
اس مقالے میں بلیک باکس آڈٹ کے طریقوں کا بھی جان بوجھ کر اشارہ کیا گیا سینڈ بیگنگ کے رویے پر کیا گیا۔ جوابی نمونہ کی جانچ نے منتخب کم کارکردگی کو پکڑا لیکن زیادہ تر یکساں کم کارکردگی سے محروم رہ گیا۔ تاریخی قابلیت کی جانچ کو شامل کرنے سے نقلی مقدمات میں مشترکہ کھوج کو 94-97% تک بڑھا دیا گیا۔ یہ کسی ایک سکور پر انحصار کرنے کے بجائے پرتوں والے آڈٹ کی حمایت کرتا ہے۔
ڈویلپرز کے لیے آپریشنل ویلیو فریکوئنسی ہے۔ ہر بار مکمل بینچ مارک کے بجٹ کو استعمال کیے بغیر نظام کی فوری تبدیلی، کوانٹائزیشن پاس، فائن ٹیون، ٹول اپ ڈیٹ، یا حفاظتی پالیسی پر نظرثانی کے بعد ایک چھوٹا جائزہ دوبارہ چلایا جا سکتا ہے۔ لیکن نتیجہ صرف اس وقت کارآمد ہوتا ہے جب ٹیمیں اصل سوٹ کو وقتاً فوقتاً آڈٹ کے طور پر رکھیں، ہولڈ آؤٹ پرامپٹس کو گھمائیں، اور کمپریسڈ ٹیسٹ کے لیے براہ راست بہتر بنانے کے بجائے حیران کن تبدیلیوں کی چھان بین کریں۔ بصورت دیگر سستا چیک اوور فٹنگ کا ایک اور ہدف بن سکتا ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
آگے کیا دیکھنا ہے۔
آزاد نقل، مستقبل کے ماڈل فیملیز کی توثیق، اور اس ثبوت کے لیے دیکھیں کہ مختصر کیے گئے ٹیسٹ ان معیارات سے باہر رویے کی پیش گوئی کرتے ہیں جنہیں دوبارہ پیش کرنے کے لیے ڈیزائن کیا گیا تھا۔
یہ ایک نیا پری پرنٹ ہے، مکمل ہم مرتبہ نظرثانی کا فیصلہ نہیں۔ اویکت ساخت کے تجزیے میں 134 ماڈلز کا استعمال کیا گیا، جو مصنفین نوٹ کرتے ہیں کہ روایتی سائیکو میٹرک معیارات کے لحاظ سے چھوٹے ہیں، اور ایک متبادل نکالنے کا طریقہ تین کے بجائے دو عوامل کو برقرار رکھتا ہے۔ عنصر کے نام تجرباتی خلاصے ہیں، حفاظت کی توثیق شدہ تعریفیں نہیں۔
ہر ماڈل نے OpenRouter کے ذریعے فی دستیاب پرامپ ایک جواب تیار کیا، اور ہر بینچ مارک نے اپنے مقرر کردہ خودکار جج کا استعمال کیا۔ نتیجے میں آنے والے مختصر ٹیسٹ اصل اشارے، اسکورنگ کے قواعد، زبان کی کوریج، اور ججوں میں خامیاں پیدا کر سکتے ہیں۔ مصنفین واضح طور پر کہتے ہیں کہ کمپریشن یہ ظاہر نہیں کرتا ہے کہ ایک بینچ مارک تعیناتی کی حفاظت کی پیش گوئی کرتا ہے یا مستقبل کے ماڈلز کے لیے معلوماتی رہتا ہے۔
سینڈ بیگنگ ٹیسٹوں میں جانچ سے بچنے کے لیے عمدہ ماڈلز کے بجائے پرامپٹ ماڈل آرگنزم کا استعمال کیا گیا، جس کا پتہ لگانا آسان ہو سکتا ہے۔ API چیکس رویے کا تسلسل قائم کرتے ہیں، نہ کہ چھپے ہوئے ماڈل وزن کی شناخت، اور مطالعہ نے آڈٹ کے طریقوں کو شکست دینے کے لیے خاص طور پر تربیت یافتہ مخالف کی جانچ نہیں کی۔
کاغذ کی سب سے اہم حد پیمائش کی کارکردگی اور حفاظت کی یقین دہانی کے درمیان ہے۔ ایک مختصر شکل اصل بینچ مارک میں موجود پوشیدہ عوامل کا اندازہ لگا سکتی ہے، لیکن یہ اس بینچ مارک کی زبان، جج، پرامپٹ فریمنگ، اور بلائنڈ اسپاٹس کو وراثت میں ملتی ہے۔ مستقبل کے تجزیوں میں کثیر لسانی اشارے، ٹول سے چلنے والے ایجنٹوں، طویل گفتگو، مخالفانہ طور پر ٹھیک بنائے گئے ماڈلز، اور آزاد انسانی فیصلوں کی جانچ ہونی چاہیے۔ جب کوئی کمپریسڈ سکور غیر مستحکم ہو جائے تو انہیں اس کی اطلاع بھی دینی چاہیے، کیونکہ ہولڈ آؤٹ ڈیٹا پر ایک صاف ارتباط اگلے ماڈل فیملی کی ناکامی کو چھپا سکتا ہے۔
ایک عملی اپنانے کا قاعدہ ان حدود کی پیروی کرتا ہے: کمپریسڈ ٹیسٹ کو سینٹینلز کے طور پر استعمال کریں، فیصلوں کی نہیں۔ ٹیمیں رجعت کو پکڑنے کے لیے انہیں کثرت سے چلا سکتی ہیں، پھر مکمل بینچ مارک اور انسانی جائزے میں تبدیلی کو بڑھا سکتی ہیں جب مختصر شکل غیر متوقع طور پر حرکت میں آتی ہے۔ مطالعہ کے اپنے شواہد اس تہہ دار ورک فلو کی حمایت کرتے ہیں کیونکہ فیکٹر ڈھانچہ مخصوص اشارے، ججز، اور ماڈل آؤٹ پٹ سے اخذ کیا گیا تھا۔ منتخب کردہ آئٹمز، سلیکشن کوڈ، ہولڈ آؤٹ نتائج، اور ورژن کی سرگزشت کو شائع کرنے سے آزاد تشخیص کاروں کو یہ جانچنے کا موقع ملے گا کہ آیا مختصر ٹیسٹ ڈیولپرز کے دیکھنے کے بعد اور نئے ماڈل فیملیز کے جوابات کی تقسیم کو تبدیل کرنے کے بعد معلوماتی رہتے ہیں۔
جب کسی ماڈل کو اپ ڈیٹ کیا جاتا ہے تو وہی شفافیت اہمیت رکھتی ہے۔ ایک نسل پر کیلیبریٹ کردہ ایک مختصر ٹیسٹ بہت آسان، بہت تنگ، یا حادثاتی طور پر نئے سسٹم پرامپٹ کے ساتھ منسلک ہو سکتا ہے۔ ٹیموں کو پہلے کے ورژنز کو محفوظ رکھنا چاہیے، جب کوئی آئٹم یا جج تبدیل ہوتا ہے تو اس کا انکشاف کرنا چاہیے، اور کمپریسڈ رینکنگ کو درست حفاظتی سکور کے طور پر پیش کرنے کے بجائے اعتماد کے وقفوں کی اطلاع دینا چاہیے۔ یہ طرز عمل کاغذ کی کارکردگی کے نتائج کو قابل سماعت مانیٹرنگ پروگرام میں بدل دیتے ہیں جبکہ اصل بینچ مارک کو گہرے جائزے کے لیے دستیاب رکھتے ہیں۔