دليل المجتمع

هجمات استنتاج العضوية

يحاول هجوم استنتاج العضوية تحديد ما إذا كانت بيانات شخص معين قد تم استخدامها لتدريب نموذج، فقط عن طريق التحقق من النموذج.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

هذا مهم لأن التأكد من أن شخصًا ما كان في مجموعة تدريب طبي أو مالي يمكن أن يشكل في حد ذاته انتهاكًا خطيرًا للخصوصية.

الغوص العميق

يستغل استنتاج العضوية حدسًا بسيطًا: تميل النماذج إلى التصرف بشكل مختلف بناءً على البيانات التي حفظتها أثناء التدريب مقارنة بالبيانات التي لم ترها من قبل. أدى الهجوم الأساسي الذي شنه شكري وزملاؤه في عام 2017 إلى تدريب "نماذج الظل" التي تحاكي الهدف، ثم تدريب أحد المصنفين على التعرف على أنماط ثقة الأعضاء مقابل غير الأعضاء. العديد من الهجمات اللاحقة تكون أبسط: غالبًا ما يؤدي مثال العضو إلى خسارة أقل أو ثقة أعلى من مثيله من غير الأعضاء. يؤدي الإفراط في التجهيز إلى تضخيم هذه الفجوة، لذا تكون السجلات النادرة أو التي يتم حفظها بشكل كبير أكثر عرضة للخطر. الخطر سياقي. إذا تم تدريب النموذج فقط على المرضى الذين لديهم تشخيص معين، فإن إثبات العضوية يكشف التشخيص. هذه الهجمات هي الاختبار التجريبي القياسي لمعرفة ما إذا كان النموذج يسرب بيانات التدريب.

البصيرة الفنية

تقوم أقوى الهجمات الحديثة، مثل هجوم نسبة الاحتمال (LiRA)، بمعايرة الصعوبة لكل مثال من خلال مقارنة خسارة النموذج المستهدف في السجل مقابل توزيع الخسارة من العديد من النماذج التي تم تدريبها باستخدام هذا السجل وبدونه. تعمل هذه المعايرة على إزالة التشويش من الأمثلة السهلة أو الصعبة، مما يزيد من حدة الإشارة بين الأعضاء مقابل غير الأعضاء ويرفع بشكل كبير المعدلات الإيجابية الحقيقية بمعدلات إيجابية كاذبة منخفضة.

التأثير الاستراتيجي

المخاطر والسلامة

تعتمد الأضرار الكارثية واليومية التي يسببها الذكاء الاصطناعي على من يفهم المخاطر ومن يستطيع التصرف.

قرارات أوضح

إن المعرفة العامة والمهنية تحدد ما إذا كانت سياسة السلامة القوية ممكنة من الناحية السياسية.

تجاوز الضجة

إن التفسيرات الواضحة تقلل من الاستيلاء على الضجيج والعلاقات العامة المعملية والمسرح الأخلاقي الغامض.

مستقبل هجمات استدلال العضوية

ومع تدريب النماذج على المزيد من البيانات الشخصية، أصبح استنتاج العضوية بمثابة تدقيق مطلوب، وليس فضولًا أكاديميًا. يتعامل المنظمون الذين يفسرون اللائحة العامة لحماية البيانات والقوانين المماثلة بشكل متزايد مع بيانات التدريب المحفوظة على أنها بيانات شخصية، وبالتالي فإن الهجمات تتضاعف باعتبارها اختبارات امتثال. يوفر الدفاع الرئيسي، وهو الخصوصية التفاضلية، حدودًا يمكن إثباتها ولكنه يكلف الدقة، مما يدفع البحث نحو مراعاة خصوصية أكثر صرامة، وحماية انتقائية للسجلات النادرة، والتعلم الآلي لإزالة الأفراد عند الطلب.

التنفيذ في العالم الحقيقي

مراجعة النموذج التشخيصي للمستشفى للتحقق مما إذا كان من الممكن تحديد سجلات المرضى الفردية كبيانات تدريب

إظهار التسرب المتعلق باللائحة العامة لحماية البيانات (GDPR) من خلال إظهار نموذج محفوظ لسجلات مستخدم محددة

تشكيل نموذج لغة كفريق أحمر لاختبار ما إذا كانت رسائل البريد الإلكتروني أو المستندات الخاصة موجودة في مجموعة التدريب الخاصة به

تقييم ما إذا كان التدريب على الخصوصية التفاضلية قد أغلق بالفعل الفجوة بين الأعضاء وغير الأعضاء

المخاطر والدرابزين

التعامل مع المخاطر الوجودية باعتبارها خيالًا علميًا ومركبات القدرة.

الخلط بين سلامة المنتج السطحي والمحاذاة في ظل الاستقلالية العالية.

ترك الجماهير غير الإنجليزية وغير الخبراء مع مصادر منخفضة الجودة فقط.

خارطة طريق التنفيذ

1

فصل أضرار المنتج، وسوء الاستخدام، ومخاطر فقدان السيطرة/اختلال المحاذاة.

2

اسأل عن الأدلة التي من شأنها أن تغير وجهة نظرك بشأن الجداول الزمنية وشدتها.

3

تفضيل المصادر الأولية والتقييمات الملموسة على المطالبات التسويقية.

4

حدد مسار عمل واحد: المهنة، أو السياسة، أو التمويل، أو المهارات - وليس الوعي فقط.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Membership Inference Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

هجمات الحقن الفوري

الأسئلة المتداولة

ما هي هجمات استنتاج العضوية؟

يحاول هجوم استنتاج العضوية تحديد ما إذا كانت بيانات شخص معين قد تم استخدامها لتدريب نموذج، فقط عن طريق التحقق من النموذج. هذا مهم لأن التأكد من أن شخصًا ما كان في مجموعة تدريب طبي أو مالي يمكن أن يشكل في حد ذاته انتهاكًا خطيرًا للخصوصية.

ما هو الهجوم الاستدلالي للعضوية الذي يحاول تحديده؟

يستنتج الهجوم العضوية: ما إذا تم استخدام نقطة بيانات معينة لتدريب النموذج، والذي يمكن أن يؤدي في حد ذاته إلى تسريب معلومات حساسة.

ما هي الخاصية النموذجية التي تزيد من قابلية التعرض لهذه الهجمات؟

يؤدي الإفراط في التجهيز إلى توسيع الفجوة السلوكية بين أعضاء التدريب والبيانات غير المرئية، مما يجعل اكتشاف العضوية أسهل.

ما هي التقنية التي قام بها شكري وآخرون 2017 الأصلي. يعتمد الهجوم على؟

لقد قاموا بتدريب نماذج الظل التي تحاكي الهدف لإنشاء سلوك مسمى للأعضاء/غير الأعضاء لمصنف الهجوم.

لماذا يمكن أن يكون استنتاج العضوية ضارًا حتى بدون الكشف عن محتويات السجل؟

إذا تم تعريف مجموعة بيانات بواسطة سمة حساسة، فإن مجرد تأكيد وجود شخص ما يكشف عن تلك السمة.

ما الذي يجعل هجوم نسبة الاحتمال (LiRA) أقوى من عتبة الخسارة الساذجة؟

تقارن LiRA الخسارة المستهدفة بالتوزيعات من النماذج التي تم تدريبها مع كل سجل وبدونه، مما يؤدي إلى إزالة ضوضاء الصعوبة لكل مثال.