ماڈل نکالنا اور چوری کے حملے
ماڈل نکالنے کے حملے ایک مخالف کو صرف اس کے عوامی API سے استفسار کرکے اور جوابات پر کاپی کیٹ کی تربیت دے کر ایک ملکیتی AI ماڈل کو کلون کرنے دیتے ہیں۔
جائزہ
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
گہرا غوطہ
ایک ماڈل نکالنے (یا ماڈل چوری) حملہ ایک تعینات ماڈل کو اوریکل کے طور پر پیش کرتا ہے۔ حملہ آور ان پٹ بھیجتا ہے، آؤٹ پٹس کو ریکارڈ کرتا ہے، اور رویے کی نقل کرنے کے لیے متبادل ماڈل کی تربیت دیتا ہے۔ چونکہ ٹارگٹ ماڈل بذات خود آؤٹ پٹس کے لیے ایک سیکھا ہوا فنکشن میپنگ ان پٹ ہے، اس لیے کافی ان پٹ آؤٹ پٹ جوڑوں کو کاپی کرنے سے اصل وزن یا تربیتی ڈیٹا کو دیکھے بغیر قریب قریب کی تشکیل نو ہوسکتی ہے۔ محققین نے تصویری درجہ بندی کے فیصلے کی حدود کو چرا لیا ہے اور یہاں تک کہ چھوٹی تہوں کے صحیح وزن بھی برآمد کر لیے ہیں۔ 2024 میں، ایک ٹیم نے دکھایا کہ OpenAI اور Google پروڈکشن ماڈل ایمبیڈنگ لیئرز کو چند سو ڈالر سے کم میں نکالا جا سکتا ہے۔ چوری شدہ کاپیاں ادا شدہ خدمات کو کم کرتی ہیں، حفاظتی فلٹرز کو نظرانداز کرتی ہیں، اور مزید وائٹ باکس حملوں کو فعال کرتی ہیں جیسے کہ مخالفانہ مثالیں تیار کرنا۔
تکنیکی بصیرت
API کا جواب جتنا امیر ہوگا، چوری اتنی ہی سستی ہوگی۔ مکمل امکانی ویکٹرز یا لاگٹس کو واپس کرنے سے فی سوال ایک واحد ٹاپ-1 لیبل سے کہیں زیادہ معلومات لیک ہو جاتی ہیں، اس لیے حملہ آور کم سوالات کے ساتھ حدود کو دوبارہ تشکیل دیتے ہیں۔ فعال سیکھنے کی حکمت عملی فیصلہ کی حدود کے قریب انتہائی معلوماتی سوالات کا انتخاب کرتی ہے۔ ایک تاریخی نتیجہ سے پتہ چلتا ہے کہ صرف آؤٹ پٹ ڈائمینشن گنتی پر استفسار کرنے سے لکیری الجبرا کے ذریعے قطعی لکیری پروجیکشن پرت کو بحال کیا جاسکتا ہے، کیونکہ یہ پرت مؤثر طریقے سے ردعمل کے دورانیے کا میٹرکس ہے۔
اسٹریٹجک اثر
خطرہ اور حفاظت
تباہ کن اور روزمرہ کے AI نقصانات دونوں کا انحصار اس بات پر ہے کہ کون خطرات کو سمجھتا ہے اور کون عمل کر سکتا ہے۔
واضح فیصلے
عوامی اور پیشہ ورانہ خواندگی یہ تشکیل دیتی ہے کہ آیا مضبوط حفاظتی پالیسی سیاسی طور پر ممکن ہے۔
ہائپ کے ذریعے کاٹنا
واضح وضاحتیں ہائپ، لیب پی آر، اور مبہم اخلاقیات تھیٹر کے ذریعے کیپچر کو کم کرتی ہیں۔
ماڈل نکالنے اور چوری کرنے والے حملوں کا مستقبل
دفاع بلاک کرنے سے پتہ لگانے اور انحطاط کی طرف منتقل ہو رہے ہیں: شرح کو محدود کرنا، گول یا صرف ٹاپ 1 آؤٹ پٹ واپس کرنا، کیلیبریٹڈ شور شامل کرنا، واٹر مارکنگ ماڈل کا برتاؤ تاکہ چوری شدہ کاپیوں کو فنگر پرنٹ کیا جا سکے، اور نکالنے والے دستخطوں کے لیے استفسار کے نمونوں کی نگرانی۔ ریگولیشن اور لائسنسنگ شرائط کی توقع کریں جو نکالنے کو چوری کے طور پر مانتے ہیں، نیز ممکنہ طور پر مشکل سے نکالنے والے فن تعمیرات میں فعال تحقیق۔ جیسے جیسے ماڈل بڑے ہوتے جاتے ہیں، مکمل نکالنا مہنگا رہتا ہے، لیکن قیمتی اجزاء کا جزوی نکالنا اور ڈسٹلیشن طرز کی کلوننگ ایک مستقل تجارتی اور سیکورٹی خطرہ رہے گا۔
حقیقی دنیا کا نفاذ
ایک سٹارٹ اپ ایک مدمقابل کے ادا شدہ امیج ریکگنیشن API سے ہزاروں بار استفسار کرتا ہے اور ایک مفت کلون کو تربیت دیتا ہے جو اس کی درستگی کو نقل کرتا ہے۔
سیکیورٹی محققین صرف چند سو ڈالر کی لاگت سے احتیاط سے تیار کردہ API استفسارات کا استعمال کرتے ہوئے پروڈکشن لینگویج ماڈل کی حتمی ایمبیڈنگ پروجیکشن پرت کو نکالتے ہیں۔
ایک حملہ آور مقامی طور پر سپیم یا فراڈ کی درجہ بندی کرنے والے کو کلون کرتا ہے تاکہ وہ اس کی آف لائن تحقیقات کر سکے اور ایسے آدانوں کو تیار کر سکے جو قابل اعتماد طریقے سے پتہ لگانے سے بچ جاتے ہیں۔
ایک کلاؤڈ وینڈر استفسار کی شرح کی نگرانی کا اضافہ کرتا ہے جو ایک ایسے اکاؤنٹ کو جھنڈا لگاتا ہے جس کا ایکسیس پیٹرن فعال سیکھنے کے اخراج سے میل کھاتا ہے اور اس کے جوابات کو تھروٹل کرتا ہے۔
خطرات اور گارڈریلز
قابلیت کے مرکبات کے دوران وجودی خطرے کا سائنس فائی کے طور پر علاج کرنا۔
اعلی خود مختاری کے تحت سیدھ کے ساتھ سطح کی مصنوعات کی حفاظت کو الجھا دینا۔
غیر انگریزی اور غیر ماہر سامعین کو صرف کم معیار کے ذرائع کے ساتھ چھوڑنا۔
نفاذ کا روڈ میپ
الگ الگ مصنوعات کے نقصانات، غلط استعمال، اور نقصان کے کنٹرول / غلط خطوط کے خطرات۔
پوچھیں کہ کون سے ثبوت ٹائم لائنز اور شدت کے بارے میں آپ کے نظریہ کو بدل دیں گے۔
مارکیٹنگ کے دعووں پر بنیادی ذرائع اور ٹھوس ایولز کو ترجیح دیں۔
ایک عمل کے راستے کی شناخت کریں: کیریئر، پالیسی، فنڈنگ، یا مہارتیں - نہ صرف آگاہی۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
ممبرشپ انفرنس حملے
اکثر پوچھے گئے سوالات
What is Model Extraction and Stealing Attacks?
ماڈل نکالنے کے حملے ایک مخالف کو صرف اس کے عوامی API سے استفسار کرکے اور جوابات پر کاپی کیٹ کی تربیت دے کر ایک ملکیتی AI ماڈل کو کلون کرنے دیتے ہیں۔ یہ اہمیت رکھتا ہے کیونکہ کمپنیاں لاکھوں ٹریننگ ماڈلز خرچ کرتی ہیں جن کا اندازہ چند ہزار API کالز کی قیمت سے لگایا جا سکتا ہے۔
ماڈل نکالنے کے حملے کے پیچھے بنیادی خیال کیا ہے؟
ایکسٹریکشن تعینات کردہ ماڈل کو ایک اوریکل کے طور پر پیش کرتا ہے: حملہ آور ان پٹ آؤٹ پٹ جوڑے جمع کرتا ہے اور اصل وزن تک رسائی حاصل کیے بغیر، رویے کی نقل کرنے کے لیے کاپی کیٹ ماڈل کو تربیت دیتا ہے۔
مکمل امکانی ویکٹر کی واپسی صرف ٹاپ-1 لیبل کو واپس کرنے سے نکالنے کو آسان کیوں بناتی ہے؟
ہر مکمل امکانی ویکٹر ماڈل کے اندرونی فیصلے کی سطح کے بارے میں ایک لیبل سے کہیں زیادہ ظاہر کرتا ہے، حملہ آور کو کم سوالات کے ساتھ باؤنڈری کو دوبارہ بنانے دیتا ہے۔
کونسی دفاعی تکنیک فی سوال لیک ہونے والی معلومات کو براہ راست کم کرتی ہے؟
موٹے آؤٹ پٹس، مثال کے طور پر صرف ٹاپ لیبل یا گول امکانات کو واپس کرنا، ہر ردعمل سے حملہ آور کو ملنے والے سگنل کو کم کرتا ہے، جس سے نکالنے کی لاگت بڑھ جاتی ہے۔
2024 کے نتائج سے پتہ چلتا ہے کہ حملہ آور پروڈکشن لینگویج ماڈل کے کس حصے کو سستے میں ٹھیک کر سکتے ہیں؟
محققین نے یہ ظاہر کیا کہ آخری لکیری پروجیکشن پرت کو چند سو ڈالر میں بالکل ٹھیک کیا جا سکتا ہے، کیونکہ اس کے ردعمل ایک قابل بازیافت میٹرکس پر محیط ہیں۔
چوری شدہ متبادل ماڈل صرف کھوئی ہوئی آمدنی سے زیادہ خطرناک کیوں ہے؟
ایک بار حملہ آوروں کے پاس مقامی کاپی ہو جانے کے بعد، وہ مخالفانہ ان پٹ یا چوری کے حملوں کو ڈیزائن کرنے کے لیے آزادانہ طور پر اس کی چھان بین کر سکتے ہیں جو اصل تعینات کردہ نظام کو بھی بے وقوف بناتے ہیں۔