دليل المجتمع

استخراج النماذج وهجمات السرقة

تسمح هجمات استخراج النماذج للخصم باستنساخ نموذج ذكاء اصطناعي مملوك فقط عن طريق الاستعلام عن واجهة برمجة التطبيقات العامة الخاصة به وتدريب مقلد على الإجابات.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

الغوص العميق

يتعامل هجوم استخراج النموذج (أو سرقة النموذج) مع النموذج المنشور باعتباره أوراكل. يرسل المهاجم المدخلات، ويسجل المخرجات، ويدرب نموذجًا بديلاً لتقليد السلوك. نظرًا لأن النموذج المستهدف نفسه عبارة عن وظيفة متعلمة تقوم بتعيين المدخلات إلى المخرجات، فإن نسخ ما يكفي من أزواج المدخلات والمخرجات يمكن أن يعيد بناء تقريب قريب دون رؤية الأوزان الأصلية أو بيانات التدريب على الإطلاق. لقد سرق الباحثون حدود القرار الخاصة بمصنفات الصور، بل واستعادوا الأوزان الدقيقة للطبقات الصغيرة. في عام 2024، أظهر فريق أن أجزاء من نموذج الإنتاج OpenAI وGoogle يمكن استخراج طبقات تضمينها بأقل من بضع مئات من الدولارات. تؤدي النسخ المسروقة إلى تقويض الخدمات المدفوعة، وتجاوز مرشحات الأمان، وتمكين المزيد من هجمات المربع الأبيض مثل صياغة الأمثلة العدائية.

البصيرة الفنية

كلما كانت استجابة واجهة برمجة التطبيقات (API) أكثر ثراءً، كانت السرقة أرخص. تؤدي إرجاع المتجهات أو السجلات الاحتمالية الكاملة إلى تسرب معلومات أكثر بكثير لكل استعلام مقارنة بتصنيف واحد من أعلى 1، لذلك يقوم المهاجمون بإعادة بناء الحدود باستخدام استعلامات أقل. تختار استراتيجيات التعلم النشط الاستفسارات الأكثر إفادة بالقرب من حدود القرار. وأظهرت نتيجة بارزة أن الاستعلام عن عدد أبعاد المخرجات يمكن أن يستعيد طبقة الإسقاط الخطي النهائية تمامًا عبر الجبر الخطي، نظرًا لأن تلك الطبقة هي في الواقع مصفوفة تمتد الاستجابات.

التأثير الاستراتيجي

المخاطر والسلامة

تعتمد الأضرار الكارثية واليومية التي يسببها الذكاء الاصطناعي على من يفهم المخاطر ومن يستطيع التصرف.

قرارات أوضح

إن المعرفة العامة والمهنية تحدد ما إذا كانت سياسة السلامة القوية ممكنة من الناحية السياسية.

تجاوز الضجة

إن التفسيرات الواضحة تقلل من الاستيلاء على الضجيج والعلاقات العامة المعملية والمسرح الأخلاقي الغامض.

مستقبل استخراج النماذج وهجمات السرقة

تتحول الدفاعات من الحظر إلى الاكتشاف والتدهور: تحديد المعدل، وإرجاع المخرجات الدائرية أو أعلى 1 فقط، وإضافة ضوضاء معايرة، وسلوك نموذج العلامة المائية حتى يمكن أخذ بصمات الأصابع على النسخ المسروقة، ومراقبة أنماط الاستعلام لاستخراج التوقيعات. توقع شروط التنظيم والترخيص التي تتعامل مع الاستخراج باعتباره سرقة، بالإضافة إلى البحث النشط في البنى التي يصعب استخراجها. ومع زيادة حجم النماذج، يظل الاستخراج الكامل مكلفًا، لكن الاستخراج الجزئي للمكونات القيمة والاستنساخ بأسلوب التقطير سيظل يمثل تهديدًا تجاريًا وأمنيًا مستمرًا.

التنفيذ في العالم الحقيقي

تقوم شركة ناشئة بالاستعلام عن واجهة برمجة تطبيقات التعرف على الصور المدفوعة الخاصة بأحد المنافسين آلاف المرات وتدريب نسخة مجانية تكرر دقتها.

يستخرج الباحثون الأمنيون طبقة التضمين والإسقاط النهائية لنموذج لغة الإنتاج باستخدام استعلامات واجهة برمجة التطبيقات المصممة بعناية والتي لا تكلف سوى بضع مئات من الدولارات.

يقوم المهاجم باستنساخ مصنف البريد العشوائي أو الاحتيال محليًا حتى يتمكن من التحقق منه دون الاتصال بالإنترنت وصياغة مدخلات تتجنب اكتشافها بشكل موثوق.

يضيف بائع السحابة مراقبة معدل الاستعلام الذي يضع علامة على الحساب الذي يتطابق نمط وصوله مع استخراج التعلم النشط ويخنق استجاباته.

المخاطر والدرابزين

التعامل مع المخاطر الوجودية باعتبارها خيالًا علميًا ومركبات القدرة.

الخلط بين سلامة المنتج السطحي والمحاذاة في ظل الاستقلالية العالية.

ترك الجماهير غير الإنجليزية وغير الخبراء مع مصادر منخفضة الجودة فقط.

خارطة طريق التنفيذ

1

فصل أضرار المنتج، وسوء الاستخدام، ومخاطر فقدان السيطرة/اختلال المحاذاة.

2

اسأل عن الأدلة التي من شأنها أن تغير وجهة نظرك بشأن الجداول الزمنية وشدتها.

3

تفضيل المصادر الأولية والتقييمات الملموسة على المطالبات التسويقية.

4

حدد مسار عمل واحد: المهنة، أو السياسة، أو التمويل، أو المهارات - وليس الوعي فقط.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

هجمات استنتاج العضوية

الأسئلة المتداولة

What is Model Extraction and Stealing Attacks?

تسمح هجمات استخراج النماذج للخصم باستنساخ نموذج ذكاء اصطناعي مملوك فقط عن طريق الاستعلام عن واجهة برمجة التطبيقات العامة الخاصة به وتدريب مقلد على الإجابات. إنه أمر مهم لأن الشركات تنفق الملايين من نماذج التدريب التي يمكن تقريبها بسعر بضعة آلاف من استدعاءات واجهة برمجة التطبيقات (API).

ما هي الفكرة الأساسية وراء هجوم استخراج النموذج؟

يعامل الاستخراج النموذج المنشور باعتباره أوراكل: يجمع المهاجم أزواج المدخلات والمخرجات ويدرب نموذجًا مقلدًا لتقليد السلوك، دون الوصول إلى الأوزان الأصلية على الإطلاق.

لماذا تجعل إرجاع متجهات الاحتمالية الكاملة عملية الاستخراج أسهل من إرجاع علامة أعلى 1 فقط؟

يكشف كل متجه احتمالي كامل عن سطح القرار الداخلي للنموذج أكثر بكثير من مجرد تسمية واحدة، مما يسمح للمهاجم بإعادة بناء الحدود باستخدام عدد أقل من الاستعلامات.

ما هي التقنية الدفاعية التي تقلل بشكل مباشر المعلومات المتسربة لكل استعلام؟

يؤدي تضييق المخرجات، على سبيل المثال، إرجاع التسمية العليا أو الاحتمالات الدائرية فقط، إلى تقليل الإشارة التي تعطيها كل استجابة للمهاجم، مما يزيد من تكلفة الاستخراج.

أظهرت نتيجة عام 2024 أن المهاجمين يمكنهم استرداد أي جزء من نموذج لغة الإنتاج بتكلفة زهيدة؟

أثبت الباحثون أن طبقة الإسقاط الخطي النهائية يمكن استردادها مقابل بضع مئات من الدولارات، لأن استجاباتها تمتد عبر مصفوفة قابلة للاسترداد.

لماذا يعتبر النموذج البديل المسروق خطيرًا بما يتجاوز مجرد خسارة الإيرادات؟

وبمجرد حصول المهاجمين على نسخة محلية، يمكنهم فحصها بحرية لتصميم مدخلات عدائية أو هجمات مراوغة تخدع أيضًا النظام المنشور الأصلي.