نمذجة اللغة المقنعة
تقوم نمذجة اللغة المقنعة بتعليم الذكاء الاصطناعي كيفية ملء الكلمات المخفية عمدًا باستخدام السياق المحيط الكامل، على اليسار واليمين.
نظرة عامة
It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.
الغوص العميق
في نمذجة اللغة المقنعة (MLM)، يمكنك أخذ جملة، وإخفاء حوالي 15% من رموزها بشكل عشوائي باستخدام رمز [MASK] خاص، وتدريب النموذج على تخمين النسخ الأصلية. نظرًا لأن النموذج يرى الكلمات على جانبي كل فراغ، فإنه يبني فهمًا ثنائي الاتجاه للسياق. BERT، الذي قدمته Google في عام 2018، شاع هذا الأمر. تفاصيل ذكية: من المواضع المقنعة، يتحول 80% تقريبًا إلى [MASK]، ويتم تبديل 10% لكلمة عشوائية، ويتم ترك 10% دون تغيير. وهذا يمنع النموذج من توقع رمز [MASK] فقط في وقت التنبؤ ويفرض المتانة. بعد هذا التدريب المسبق، يتم ضبط النموذج بدقة لمهام مثل التصنيف والإجابة على الأسئلة والتعرف على الكيان المسمى.
البصيرة الفنية
تستخدم الامتيازات والرهون البحرية برنامج تشفير محول مع اهتمام ذاتي ثنائي الاتجاه، بحيث يهتم كل رمز مميز بجميع الرموز الأخرى في وقت واحد. يتم حساب الخسارة فقط على المواضع المقنعة باستخدام الإنتروبيا المتقاطعة مقابل معرفات الرمز المميز الحقيقية. نظرًا لأن الانتباه غير سببي (لا يوجد إخفاء مستقبلي)، فإن تمثيل كل كلمة يدمج السياق الأيسر والأيمن في متجه واحد كثيف. إن ثنائية الاتجاه هي بالضبط ما تتخلى عنه نماذج الرمز المميز التالي للقدرة على إنشائها.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل نمذجة اللغة المقنعة
لقد تم تجاوز Pure MLM جزئيًا من خلال نماذج فك التشفير التوليدية لروبوتات الدردشة، لكنها تظل مهيمنة على عمليات التضمين والاسترجاع والتصنيف حيث يتفوق الفهم على التوليد. تستمر المتغيرات مثل RoBERTa، واكتشاف الرموز المميزة المستبدلة من ELECTRA، وDeBERTa في تعزيز الدقة والكفاءة. توقع أن تظل أدوات التشفير ذات نمط الامتيازات والرهونات البحرية مركزية في البحث والتشابه الدلالي وكمكونات خفيفة الوزن داخل أنظمة استرجاع أكبر ومتعددة الوسائط حيث يكون الفهم السريع والعميق أكثر أهمية من النص الحر.
التنفيذ في العالم الحقيقي
تشغيل Google فهم البحث المستند إلى BERT لاستعلامات المحادثة لعرض المزيد من الصفحات ذات الصلة.
إنشاء تضمينات الجملة للبحث الدلالي وأنظمة استرجاع المستندات.
ضبط BERT لتحليل المشاعر بشأن مراجعات المنتجات أو تذاكر الدعم.
التعرف على الكيان المسمى الذي يستخرج الأشخاص والمنظمات والتواريخ من النص القانوني أو الطبي.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
نمذجة اللغة
الأسئلة المتداولة
What is Masked Language Modeling?
تقوم نمذجة اللغة المقنعة بتعليم الذكاء الاصطناعي كيفية ملء الكلمات المخفية عمدًا باستخدام السياق المحيط الكامل، على اليسار واليمين. إنها خدعة التدريب وراء BERT والسبب الذي يجعل النماذج قادرة على فهم معنى الجملة بعمق بدلاً من مجرد التنبؤ بما سيأتي بعد ذلك.
ما هي مهمة التدريب الأساسية في نمذجة اللغة المقنعة؟
تقوم الامتيازات والرهون البحرية بإخفاء جزء من الرموز المميزة وتدريب النموذج على استعادتها باستخدام السياق الأيسر والأيمن.
ما هي النسبة المئوية تقريبًا للرموز المميزة التي يخفيها BERT عادةً أثناء التدريب المسبق؟
يخفي BERT ما يقرب من 15% من رموز الإدخال، وهو توازن بين إعطاء إشارة كافية وترك سياق كافٍ.
لماذا تعطي الامتيازات والرهون البحرية فهمًا نموذجيًا ثنائي الاتجاه؟
يستخدم برنامج تشفير Transformer الاهتمام الذاتي غير السببي، بحيث يمكن لكل رمز مميز رؤية جميع الرموز الأخرى على كلا الجانبين.
في مخطط إخفاء BERT، ماذا يحدث لحوالي 10% من المواضع المحددة بدلاً من أن تصبح [MASK]؟
لتحسين المتانة، يتم تبديل 10% من المواضع المقنعة برمز عشوائي ويتم ترك 10% دون تغيير.
في أي المواقف يتم حساب خسارة الامتيازات والرهون البحرية؟
يتم تطبيق خسارة الإنتروبيا المتقاطعة فقط على المواضع المقنعة، ومقارنة التنبؤات بمعرفات الرمز المميز الأصلية.