تسمم البيانات والهجمات الخلفية
يؤدي تسميم البيانات إلى إفساد النموذج من خلال التلاعب ببيانات التدريب الخاصة به، وتخفي الهجمات الخلفية محفزًا سريًا يجعل النموذج يسيء التصرف بناءً على الأوامر.
نظرة عامة
They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.
الغوص العميق
تنقسم هجمات التسمم إلى هدفين عريضين. تهدف هجمات التوفر إلى تقليل الدقة الإجمالية عن طريق حقن أمثلة ذات عناوين خاطئة أو تالفة. تعد الهجمات المستهدفة والهجمات الخلفية أكثر تسللًا: يعمل النموذج بشكل مثالي على المدخلات العادية ولكنه ينتج مخرجات يختارها المهاجم كلما ظهر مشغل مخفي، مثل تصحيح بكسل صغير، أو عبارة محددة، أو علامة مائية غير مرئية. أظهر عمل BadNets مُصنِّفًا لعلامات التوقف يقرأ علامة تحمل علامة لاصقة باسم "الحد الأقصى للسرعة". يتم الكشف عن الأنظمة الحديثة لأنها تتدرب على البيانات على نطاق الويب. أثبت الباحثون أن شراء النطاقات منتهية الصلاحية خلف جزء صغير من عناوين URL لمجموعة البيانات يمكن أن يسمم مجموعات بيانات الصور الشائعة مقابل بضع مئات من الدولارات. يمكن أيضًا أن يتم اختراق النماذج اللغوية من خلال بيانات الضبط الدقيق المسمومة أو أمثلة التعليمات.
البصيرة الفنية
يعد الباب الخلفي للملصقات النظيفة خطيرًا بشكل خاص: فالعينات المسمومة تحتفظ بالملصقات الصحيحة وتبدو طبيعية للمراجعين البشريين، ومع ذلك فهي تتضمن ميزة تحفيز يتعلم النموذج ربطها بالفئة المستهدفة. عند الاستدلال، يؤدي تقديم المشغل إلى قلب التنبؤ بينما تظل الدقة النظيفة عالية، لذلك لا يتمكن التحقق من الصحة القياسي من اكتشافه أبدًا. تشمل الدفاعات تجميع التنشيط، والتوقيعات الطيفية، وإعادة بناء الزناد، والتحقق من مصدر البيانات.
التأثير الاستراتيجي
المخاطر والسلامة
تعتمد الأضرار الكارثية واليومية التي يسببها الذكاء الاصطناعي على من يفهم المخاطر ومن يستطيع التصرف.
قرارات أوضح
إن المعرفة العامة والمهنية تحدد ما إذا كانت سياسة السلامة القوية ممكنة من الناحية السياسية.
تجاوز الضجة
إن التفسيرات الواضحة تقلل من الاستيلاء على الضجيج والعلاقات العامة المعملية والمسرح الأخلاقي الغامض.
مستقبل تسمم البيانات والهجمات الخلفية
وبما أن سلاسل التوريد تعتمد على البيانات المستخرجة، والأوزان المدربة مسبقا، والضبط الدقيق من قبل طرف ثالث، فإن التسمم يتحول من النظرية إلى تهديد حقيقي لسلسلة التوريد. توقع معايير توقيع مجموعة البيانات ومصدرها، والتدريب المعتمد على المتانة الذي يحد من الضرر الناتج عن عدد ثابت من النقاط المسمومة، والمسح الخلفي المستمر للنماذج قبل النشر. بدأت الهيئات التنظيمية والأطر الأمنية مثل MITRE ATLAS في التعامل مع التسمم باعتباره خطرًا من الدرجة الأولى للتعلم الآلي.
التنفيذ في العالم الحقيقي
نموذج رؤية للسيارات ذاتية القيادة يخطئ في قراءة علامة التوقف كعلامة حد للسرعة عند وجود مشغل ملصق صغير
تسميم مجموعة بيانات الصور العامة بتكلفة زهيدة عن طريق الاستيلاء على النطاقات منتهية الصلاحية التي تستضيف جزءًا من عناوين URL للصور الخاصة بها
الباب الخلفي لنموذج إكمال التعليمات البرمجية بحيث تؤدي عبارة المطالبة المخفية إلى إدخال تعليمات برمجية غير آمنة
إتلاف التعليقات التدريبية المجمعة لمرشح البريد العشوائي بحيث تتسلل رسائل بريد إلكتروني ضارة محددة
المخاطر والدرابزين
التعامل مع المخاطر الوجودية باعتبارها خيالًا علميًا ومركبات القدرة.
الخلط بين سلامة المنتج السطحي والمحاذاة في ظل الاستقلالية العالية.
ترك الجماهير غير الإنجليزية وغير الخبراء مع مصادر منخفضة الجودة فقط.
خارطة طريق التنفيذ
فصل أضرار المنتج، وسوء الاستخدام، ومخاطر فقدان السيطرة/اختلال المحاذاة.
اسأل عن الأدلة التي من شأنها أن تغير وجهة نظرك بشأن الجداول الزمنية وشدتها.
تفضيل المصادر الأولية والتقييمات الملموسة على المطالبات التسويقية.
حدد مسار عمل واحد: المهنة، أو السياسة، أو التمويل، أو المهارات - وليس الوعي فقط.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Poisoning and Backdoor Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
البيانات الاصطناعية
الأسئلة المتداولة
What is Data Poisoning and Backdoor Attacks?
يؤدي تسميم البيانات إلى إفساد النموذج من خلال التلاعب ببيانات التدريب الخاصة به، وتخفي الهجمات الخلفية محفزًا سريًا يجعل النموذج يسيء التصرف بناءً على الأوامر. إنها مهمة لأن النماذج تتعلم بشكل متزايد من البيانات المجمعة التي يمكن للمهاجمين تلويثها بهدوء.
ما الذي يميز هجوم الباب الخلفي عن هجوم التسمم العام؟
تعمل النماذج ذات الأبواب الخلفية بشكل طبيعي على المدخلات النظيفة وتنتج المخرجات المستهدفة للمهاجم فقط عندما يظهر المشغل المخفي.
لماذا يصعب اكتشاف الهجمات الخلفية ذات العلامة النظيفة؟
نظرًا لأن الأمثلة المسمومة تحتوي على تسميات صحيحة وتبدو عادية، فإن المراجعة البشرية ودقة التحقق القياسية لا تحددها.
ما الذي أثبتته أبحاث BadNets بشكل مشهور؟
وأظهرت شبكة BadNets أداة تصنيف لإشارات المرور ذات باب خلفي، والتي تخطئ في قراءة علامات التوقف المميزة بملصق صغير.
كيف أظهر الباحثون أن مجموعات البيانات على نطاق الويب يمكن أن يتم تسميمها بتكلفة زهيدة؟
نظرًا لأن مجموعات البيانات تشير إلى الصور بواسطة عنوان URL، فإن شراء النطاقات المنقضية يتيح للمهاجمين التحكم في تلك الصور مقابل تكلفة بسيطة.
أي مما يلي يعد وسيلة دفاع معترف بها ضد هجمات الأبواب الخلفية؟
تقوم الدفاعات بتحليل عمليات التنشيط الداخلية لفصل الأمثلة المسمومة عن الأمثلة النظيفة، من بين طرق الكشف الأخرى.