کیا ہوا؟
محققین کی ایک ٹیم نے رپورٹ کیا ہے کہ زبان کے ماڈل کے سیاق و سباق میں حساس معلومات بصورت دیگر سومی ردعمل میں پوشیدہ ارتباط پیدا کر سکتی ہیں۔ آٹھ ملکیتی ماڈلز پر مشتمل کنٹرول شدہ تجربات میں، مصنفین کا کہنا ہے کہ دو ہندسوں کے رازوں کو تقریباً کامل درستگی کے ساتھ دوبارہ تشکیل دیا گیا تھا اور چار ہندسوں کے رازوں نے عام، غیر مخالفانہ درخواستوں کے جوابات سے 82 فیصد درست مماثلت کی شرح حاصل کی تھی۔ مقالے میں ان حملوں کی بھی وضاحت کی گئی ہے جو صارف کی یادوں کے بارے میں حقیقی حقائق کا اندازہ لگاتے ہیں اور پروڈکشن طرز کے ایجنٹ سے مکمل سوشل سیکیورٹی نمبر نکالتے ہیں۔
بنیادی ماخذ 20 اگست 2026 کو جمع کرائے گئے ایک ورژن-ون پیپر کے لیے ایک arXiv خلاصہ ہے۔ مصنفین — جیدن فیروز، نیل منگاوکر، کمالیکا چوہدری، سنجم گرگ اور سعید محلوجیفر — لینگویج ماڈل سسٹم میں ایک مخصوص مسئلہ کا مطالعہ کرتے ہیں: چاہے صرف سیاق و سباق رکھنے سے صارف کے سیاق و سباق کو ماڈل کے اندر تبدیل کر دیا جائے۔ خلاصہ نام کیلنڈرز، اسناد، صحت کے ریکارڈز اور مالیاتی ڈیٹا کو سیاق و سباق کی مثالوں کے طور پر جو AI ایجنٹس کے پاس ہو سکتا ہے۔ اس کا کہنا ہے کہ ماڈل معلومات کو لیک کر سکتا ہے یہاں تک کہ جب وہ راز کو نکالنے کی براہ راست درخواست کو صحیح طریقے سے مسترد کر دیتا ہے۔ ماخذ ثابت کرتا ہے کہ محققین نے یہ دعوے کیے ہیں اور رپورٹ کیے گئے تجربات کو بیان کیا ہے۔ یہ یہاں دستیاب مواد میں آزاد تصدیق فراہم نہیں کرتا ہے۔
رپورٹ شدہ پیمائش سیاق و سباق میں سرایت شدہ مختصر رازوں سے متعلق ہے۔ آٹھ ملکیتی ماڈلز میں، مصنفین کا کہنا ہے کہ دو ہندسوں کے سیاق و سباق کے رازوں کو تقریباً کامل درستگی کے ساتھ دوبارہ تشکیل دیا گیا تھا اور خلاصہ کے مطابق، عام، غیر مخالفانہ درخواستوں کے جوابات سے 82 فیصد عین مطابق مماثلت کی شرح کے ساتھ چار ہندسوں کے راز برآمد کیے گئے تھے۔ اہم تفصیل یہ ہے کہ خلاصہ کے مطابق، یہ نتائج عام، غیر مخالفانہ درخواستوں کے جواب میں پیدا ہونے والے نتائج سے آئے ہیں۔ اس مقالے میں ایک مخالف کا بھی مطالعہ کیا گیا ہے جو فعال طور پر انجینئرز اثر کو بڑھانے کا اشارہ کرتا ہے، ماڈل کو معلومات کے لیے ایک خفیہ کیریئر کے طور پر پیش کرتا ہے۔ خلاصہ آٹھ ماڈلز کی شناخت نہیں کرتا، ٹرائلز کی تعداد کو ظاہر نہیں کرتا، درست اشارے بیان کرتا ہے، یہ بتاتا ہے کہ راز مصنوعی تھے یا حقیقی صارفین سے تیار کیے گئے تھے، یا رپورٹ شدہ نتائج کے لیے غیر یقینی اندازے پیش کرتے ہیں۔
پری پرنٹ دو عملی حملے کے راستے بیان کرتا ہے۔ سب سے پہلے، یہ ایک تربیت یافتہ درجہ بندی کی اطلاع دیتا ہے جو صارف کی یادوں کے بارے میں معنوی پیشین گوئیوں کا اندازہ لگاتا ہے — مثال کے طور پر، چاہے صارف کی صحت کی حالت ہو یا کسی مالیاتی واقعے کا تجربہ ہو — معمول کی قدرتی زبان کے نتائج سے۔ یہ بنیادی متن کو ضروری طور پر دوبارہ پیش کرنے کے بجائے کسی زمرے یا حقیقت کے بارے میں اندازہ ہے۔ دوسرا، مصنفین ایک RL تربیت یافتہ مخالف کی اطلاع دیتے ہیں جو پروڈکشن طرز کے ایجنٹ سے مکمل سوشل سیکیورٹی نمبر نکالتا ہے۔ "پروڈکشن طرز" ماخذ کی تفصیل ہے۔ خلاصہ کسی تعینات سروس کی شناخت نہیں کرتا ہے یا یہ ظاہر نہیں کرتا ہے کہ حقیقی دنیا کی مصنوعات سے سمجھوتہ کیا گیا تھا۔ اس میں حملے کی کامیابی کی شرح، تعاملات کی مطلوبہ تعداد، یا جانچ شدہ ایجنٹ میں موجود حفاظتی اقدامات کی بھی وضاحت نہیں کی گئی ہے۔
یہ کیوں اہمیت رکھتا ہے۔
تلاش، اگر آزادانہ طور پر نقل کی جائے تو، AI ایجنٹوں کی رازداری کے خطرے کو براہ راست فوری نکالنے سے آگے بڑھے گی۔ وہ سسٹم جو کیلنڈرز، اسناد، صحت کے ریکارڈ یا مالیاتی ڈیٹا کو سیاق و سباق کے طور پر استعمال کرتے ہیں، ممکنہ طور پر معمول کی مدد کے ذریعے بالواسطہ طور پر معلومات کا انکشاف کر سکتے ہیں۔ ماخذ ایک ورژن-ون arXiv پری پرنٹ ہے، تاہم، اور اس بات کا تعین نہیں کرتا ہے کہ متعین کردہ نظاموں میں کتنی بار اثر ہوتا ہے، کون سے ماڈل متاثر ہوتے ہیں، یا کون سے دفاع موثر ہوتے ہیں۔
AI ایجنٹس تیزی سے ایک مشترکہ سیاق و سباق پر انحصار کرتے ہیں جس میں ایسی معلومات ہوتی ہیں جو روایتی چیٹ بوٹ کو شاید کبھی موصول نہ ہوں۔ اگر مصنفین کا نتیجہ عام ہو جاتا ہے، تو کوئی نظام واضح راز افشا کرنے والا جواب پیش کیے بغیر حساس معلومات کا انکشاف کر سکتا ہے۔ ایک صارف شیڈول، خلاصہ یا کسی اور معمول کے کام میں مدد طلب کر سکتا ہے، جب کہ ایک مبصر پوشیدہ سیاق و سباق کے بارے میں سگنلز کے جواب کے الفاظ کا تجزیہ کرتا ہے۔ یہ عام آؤٹ پٹ پرائیویسی سے متعلقہ بنا دے گا یہاں تک کہ جب رسائی کے کنٹرول اور انکار کے اصول کام کرتے دکھائی دیں۔ ماخذ یہ قائم نہیں کرتا ہے کہ اس طرح کا رساو وسیع ہے، لیکن یہ ایک ایسے طریقہ کار کی نشاندہی کرتا ہے جس سے روایتی براہ راست نکالنے کے ٹیسٹ چھوٹ سکتے ہیں۔
خلاصہ کہتا ہے کہ زیادہ قابل ماڈل زیادہ لیک ہوتے ہیں کیونکہ مضبوط ہدایات کے بعد سیاق و سباق کے رازوں کی حساسیت بڑھ جاتی ہے۔ مصنفین اس کی تشریح اس ثبوت کے طور پر کرتے ہیں کہ یہ سلوک ایک مجرد بگ کے بجائے صلاحیت کا ایک ضمنی نتیجہ ہو سکتا ہے جسے ایک پیچ سے ہٹایا جا سکتا ہے۔ اگر مکمل مطالعہ کی حمایت کی جاتی ہے، تو یہ مصنوعات کے ڈیزائن کو پیچیدہ بنا دے گا: ایک ماڈل کی اہم ہدایات پر عمل کرنے کی صلاحیت کو بہتر بنانے سے یہ جانچنے کی ضرورت میں بھی اضافہ ہو سکتا ہے کہ اس کے نتائج نجی سیاق و سباق کے ساتھ کیسے جڑے ہوئے ہیں۔ یہ کاغذ کے مصنفین کا دعویٰ ہے، نہ کہ آزادانہ طور پر قائم کردہ اسکیلنگ قانون۔ ماخذ کوئی ماڈل بہ ماڈل نتائج، صلاحیت کی پیمائش، بیس لائن موازنہ یا ثبوت فراہم نہیں کرتا ہے جس سے یہ ظاہر ہوتا ہے کہ آیا فائن ٹیوننگ، سسٹم پرامپٹس یا سیاق و سباق کا فن تعمیر اثر کو تبدیل کرتا ہے۔
عملی خطرہ تعیناتی کی تفصیلات پر منحصر ہے کہ خلاصہ حل نہیں ہوا ہے۔ اس میں یہ نہیں کہا گیا ہے کہ آیا حملہ آور کو پہلے سے ہی ایک مجاز صارف ہونا چاہیے، آیا حملے کو ایک علیحدہ ایپلیکیشن یا ایجنٹ ٹول کے ذریعے نصب کیا جا سکتا ہے، کتنے آؤٹ پٹ کی ضرورت ہے، یا کیا شرح کی حد اور نگرانی اس کا پتہ لگائے گی۔ یہ سیاق و سباق کو کم کرنے، کمپارٹمنٹلائزیشن یا آؤٹ پٹ فلٹرنگ جیسے طریقوں کے ساتھ دفاع، تدارک کے تجربات یا موازنہ کی بھی اطلاع نہیں دیتا ہے۔ وہ نامعلوم عوامی اثرات کے لیے اہمیت رکھتے ہیں۔ لیبارٹری نکالنے کا ایک حیرت انگیز نتیجہ سنگین نمائش، ایک تنگ ناکامی موڈ، یا دونوں کی نمائندگی کر سکتا ہے۔ صرف ذریعہ ہی اس کے پھیلاؤ، دکانداروں میں استحصال یا حقیقی صارفین کو ہونے والے نقصان کا تعین نہیں کر سکتا۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').What is the best response when AI Models Explained makes a mistake in production?
آگے کیا دیکھنا ہے۔
اہم سوالات یہ ہیں کہ آیا رپورٹ شدہ حملے مصنفین کی کنٹرول شدہ ترتیبات کے باہر دوبارہ پیدا ہوتے ہیں، آیا راز اور صارف کی یادیں مصنوعی تھیں یا حقیقی، اور حملہ آور کو کتنی رسائی یا تربیت کی ضرورت ہے۔ مکمل کاغذ نمونے کے سائز، اعتماد کے وقفوں، اشارے، ماڈل کی شناخت اور رپورٹ کردہ سوشل سیکورٹی نمبر نکالنے کے پیچھے کی شرائط کو بھی واضح کر سکتا ہے۔ ڈویلپرز اور آڈیٹرز کو تنہائی، نگرانی اور تشخیص کے طریقوں کے بارے میں ثبوت کی ضرورت ہوگی جو صرف براہ راست انکار کی ناکامیوں کے بجائے بالواسطہ رساو کو دور کرتے ہیں۔
پہلی توثیق کی ترجیح طریقہ کار کی تفصیل ہے۔ قارئین کو مکمل کاغذ کے خفیہ تعمیراتی طریقہ کار، سیاق و سباق کی لمبائی، مثالوں کی تعداد، آزمائشی شمار، حملے کے بجٹ اور شماریاتی غیر یقینی صورتحال کو تلاش کرنا چاہیے۔ آٹھ ملکیتی ماڈلز کی شناخت اور ورژن اس بات کا تعین کرنے میں مدد کریں گے کہ آیا اثر ماڈل فیملیز پر محیط ہے یا خاص فن تعمیرات یا سرونگ کنفیگریشنز میں مرکوز ہے۔ یہ بھی ضروری ہے کہ عام درخواستوں کے ذریعے پیدا ہونے والے بنیادی رساو کو مخالف کے فعال طور پر انجینئرز کے اشارے کے بعد حاصل ہونے والے مضبوط نتائج سے الگ کیا جائے۔ خلاصہ دونوں ترتیبات کی اطلاع دیتا ہے لیکن ان کی نسبتہ کارکردگی کی مقدار نہیں بتاتا۔
دعوی کردہ سوشل سیکورٹی نمبر نکالنے کے لیے خاص طور پر محتاط جانچ پڑتال کی ضرورت ہے۔ پورے کاغذ میں یہ واضح ہونا چاہیے کہ آیا نمبر فرضی ٹیسٹ سٹرنگ تھے، انہیں ایجنٹ کے سیاق و سباق میں کیسے داخل کیا گیا، "پروڈکشن اسٹائل" کا کیا مطلب ہے، اور کیا مخالف کو ایجنٹ یا اس کی گفتگو کی تاریخ تک مراعات یافتہ رسائی کی ضرورت ہے۔ الگ الگ ماڈلز کا استعمال کرتے ہوئے آزاد ٹیموں کے ذریعہ دوبارہ پیدا کرنے سے یہ جانچنے میں مدد ملے گی کہ آیا نتیجہ لینگویج ماڈل سسٹم کی عمومی خاصیت کی عکاسی کرتا ہے۔ دستیاب ماخذ میں کوئی بیرونی نقل، وینڈر کا ردعمل، واقعہ کی رپورٹ یا ثبوت نہیں ہے کہ کسی بھی نامزد تجارتی پروڈکٹ نے حقیقی صارف کے ریکارڈ کو بے نقاب کیا ہو۔
ڈویلپرز اور تشخیص کاروں کے لیے، اگلا عملی سوال یہ ہے کہ "راز افشا کریں" جیسی براہ راست درخواستوں پر انحصار کیے بغیر بالواسطہ رساو کی جانچ کیسے کی جائے۔ آڈٹ کو اس بات کی پیمائش کرنے کی ضرورت پڑ سکتی ہے کہ آیا جب محفوظ سیاق و سباق میں تبدیلی آتی ہے، بشمول جب صارف غیر متعلقہ سوالات پوچھتا ہے۔ ماخذ کسی مخصوص تخفیف کی سفارش نہیں کرتا ہے، اس لیے ممکنہ حفاظتی تدابیر اور ان کی تاثیر نامعلوم ہے۔ اس لیے عوامی رپورٹنگ کو پری پرنٹ کو ثبوت کے طور پر استعمال کرنے سے گریز کرنا چاہیے کہ تمام AI ایجنٹس سوشل سیکیورٹی نمبر لیک کرتے ہیں۔ یہاں جو کچھ قائم کیا گیا ہے وہ کم ہے: مصنفین سیاق و سباق سے منسلک رساو کے کنٹرول شدہ شواہد اور حملے کے دو طریقوں کی اطلاع دیتے ہیں جو ان کے بقول اس کا فائدہ اٹھا سکتے ہیں۔