دليل الأساسيات

الخسارة الثلاثية والتعلم المتري

تُعلِّم الخسارة الثلاثية الشبكة العصبية وضع العناصر المتشابهة بالقرب من بعضها البعض والعناصر المختلفة بعيدًا عن بعضها البعض في مساحة التضمين.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

إنه الأساس وراء أنظمة التعرف على الوجوه، والبحث عن الصور، والتوصية التي تحتاج إلى مقارنة الأشياء بدلا من مجرد تصنيفها.

الغوص العميق

يقوم التعلم المتري بتدريب النموذج على إنتاج التضمينات والمتجهات التي تعكس فيها المسافة التشابه. تقوم الخسارة الثلاثية بذلك باستخدام ثلاثة مدخلات في المرة الواحدة: مرساة، وموجبة (نفس فئة المرساة)، وسالبة (فئة مختلفة). الهدف يدفع المرساة أقرب إلى الإيجابية من السلبية بهامش ثابت على الأقل. رسميًا، الخسارة هي الحد الأقصى (0، d(a,p) - d(a,n) + هامش)، حيث d عادة ما تكون المسافة الإقليدية. Google قامت FaceNet لعام 2015 بنشر هذا النهج، حيث تعلمت تضمينات الوجه ذات 128 بُعدًا مباشرةً. بمجرد التدريب، يمكنك مقارنة أي عنصرين عن طريق حساب المسافة، دون الحاجة إلى إعادة التدريب للحصول على هويات جديدة. هذه الإمكانية المفتوحة هي السبب وراء صعوبة التعامل مع قوى التعلم المتري وتصنيف مهام التحقق والاسترجاع بسهولة.

البصيرة الفنية

الهامش هو ما يجعل الخسارة الثلاثية ناجحة. بدونها، يمكن للنموذج أن ينهار جميع التضمينات إلى نقطة واحدة، مما يجعل كل مسافة صفرًا والترتيب بلا معنى. يفرض الهامش حاجزًا: يجب أن يكون الهامش السالب على الأقل أبعد من الهامش الموجب قبل أن تصل الخسارة إلى الصفر. عادةً ما يتم تسوية التضمينات باستخدام L2 في وحدة الكرة الفائقة، بحيث تظل المسافات محدودة وقابلة للمقارنة. يؤدي اختيار الهامش (غالبًا ما يكون حوالي 0.2) إلى تغيير مدى إحكام تجمع الفئات ضد الفصل بينها.

التأثير الاستراتيجي

قرارات أوضح

يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.

التكلفة والميزانية

يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.

الفريق وسير العمل

تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.

مستقبل الخسارة الثلاثية والتعلم المتري

يتم استبدال الخسارة الثلاثية الخالصة بشكل متزايد بأهداف على مستوى الدُفعة مثل التشابه المتعدد والمرساة الوكيلة والخسائر المتباينة (InfoNCE) التي تقارن العديد من الأزواج في كل خطوة وتتقارب بشكل أسرع. تُظهر أساليب الإشراف الذاتي مثل SimCLR أن التعلم المتري يمكن أن يعمل بدون تسميات من خلال التعامل مع طرق العرض المعززة على أنها إيجابية. مع تزايد قواعد البيانات المتجهة وتوليد الاسترجاع المعزز، تدعم التضمينات المستفادة البحث الدلالي على نطاق مليار عنصر، وبالتالي فإن الفكرة الأساسية المتمثلة في المسافة باعتبارها تشابه أصبحت أكثر مركزية، حتى مع تلاشي الصياغة الثلاثية المحددة.

التنفيذ في العالم الحقيقي

التحقق من الوجه بأسلوب FaceNet: تؤكد الهواتف وبوابات جواز السفر الهوية عن طريق التحقق مما إذا كانت حشوتا الوجه تقعان ضمن عتبة المسافة.

البحث المرئي عن المنتجات: تتيح مواقع التجارة الإلكترونية للمتسوقين تحميل صورة واسترداد العناصر المشابهة بصريًا عن طريق البحث عن التضمين الأقرب.

التحقق من المتحدث: يقوم المساعدون الصوتيون بتضمين عينة صوتية ومقارنتها بملف تعريف مسجل للتأكد من المتحدث.

التحقق من التوقيع والكتابة اليدوية: تقوم البنوك بتضمين التوقيعات المرجعية والاستعلام عنها ووضع علامة على التزوير عندما تتجاوز المسافة الهامش المكتسب.

المخاطر والدرابزين

قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.

يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.

غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.

خارطة طريق التنفيذ

1

ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.

2

اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.

3

قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.

4

قم بالتوثيق حيث يساعد فقدان الثلاثي والتعلم المتري وأين تكون الطرق الأبسط أفضل.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Triplet Loss and Metric Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

الشبكات السيامية والخسارة الثلاثية

الأسئلة المتداولة

ما هو فقدان الثلاثي والتعلم المقياسي؟

تُعلِّم الخسارة الثلاثية الشبكة العصبية وضع العناصر المتشابهة بالقرب من بعضها البعض والعناصر المختلفة بعيدًا عن بعضها البعض في مساحة التضمين. إنه الأساس وراء أنظمة التعرف على الوجوه والبحث عن الصور والتوصية التي تحتاج إلى مقارنة الأشياء بدلاً من مجرد تصنيفها.

ما هي المدخلات الثلاثة التي تشكل ثلاثية في خسارة ثلاثية؟

يتكون الثلاثي من مرساة، وإيجابية تشترك في فئة المرساة، وسالبة من فئة مختلفة.

لماذا تتضمن الخسارة الثلاثية مصطلح الهامش؟

بدون هامش، يمكن للنموذج تعيين كل شيء إلى نفس النقطة، مما يجعل جميع المسافات صفرًا ويرضي الخسارة بشكل تافه. الهامش يفرض الانفصال الحقيقي.

ما هو النظام الشهير لعام 2015 الذي شاع فقدان الثلاثي للتعرف على الوجوه؟

استخدم FaceNet الخاص بـ Google فقدانًا ثلاثيًا لتعلم تضمينات الوجه المضغوطة ووضع معيار في التحقق من الوجه.

ما الذي يخرجه نموذج التعلم المتري المُدرب لكل مدخل؟

يقوم النموذج بتعيين المدخلات لتضمين المتجهات؛ ثم تقوم بمقارنة العناصر عن طريق قياس المسافة بين تضميناتها.

لماذا يعد التعلم المتري مناسبًا تمامًا للمشكلات المفتوحة مثل إضافة وجوه جديدة؟

نظرًا لأن التعرف يعتمد على مسافة التضمين، يمكنك تسجيل هوية جديدة ببساطة عن طريق تخزين تضمينها، دون الحاجة إلى إعادة تدريب النموذج.