آليات الانتباه
يتيح الانتباه للنموذج تحديد الكلمات الأخرى في الجملة الأكثر أهمية عند تفسير كل كلمة.
نظرة عامة
It is the core idea that made the transformer — and therefore modern AI like ChatGPT — possible.
الغوص العميق
الانتباه يجيب على سؤال بسيط لكل كلمة: ما هي الكلمات الأخرى التي يجب أن أنظر إليها لفهم هذه الكلمة؟ قدمت ورقة عام 2017 بعنوان "الانتباه هو كل ما تحتاجه" التي أعدها فاسواني وزملاؤه في Google المحول، الذي يستخدم الانتباه كمحرك رئيسي له ويسقط التصميمات المتكررة القديمة. يتم تحويل كل رمز إلى ثلاثة نواقل: استعلام (ما الذي أبحث عنه؟)، مفتاح (ماذا أقدم؟)، وقيمة (المعلومات التي أحملها). تتم مقارنة استعلام الرمز المميز مع كل مفتاح رمز مميز آخر لإنتاج أوزان الانتباه، والتي تقوم بعد ذلك بدمج القيم معًا. يقوم الاهتمام الذاتي بذلك ضمن تسلسل واحد بحيث تتمكن كل كلمة من الاهتمام مباشرة بكل كلمة أخرى. ويجري الاهتمام متعدد الرؤوس العديد من هذه المقارنات بالتوازي، حيث يركز كل منها على أنماط مختلفة.
البصيرة الفنية
يتم قياس الرياضيات باهتمام المنتج النقطي: softmax(QK^T / √d_k) V. يسجل المنتج النقطي للاستعلامات والمفاتيح مدى ملاءمة كل زوج؛ القسمة على الجذر التربيعي للبعد الرئيسي (√d_k) تمنع هذه الدرجات من النمو بشكل كبير جدًا؛ يحولها softmax إلى أوزان مجموعها واحد؛ والضرب بـ V ينتج مزيجًا مرجحًا من القيم. نظرًا لأن كل رمز مميز يتم مقارنته ببعضه البعض، فإن التكلفة تنمو مع مربع طول التسلسل - O(n²) - وهذا هو سبب ارتفاع تكلفة المدخلات الطويلة ووجود تحسينات مثل FlashAttention.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل آليات الاهتمام
الاهتمام موجود ليبقى، لكن تكلفته التربيعية تدفع إلى إجراء أبحاث مكثفة. جعل FlashAttention الاهتمام القياسي أسرع بكثير وأكثر كفاءة في الذاكرة من خلال إعادة ترتيب العمليات الحسابية. تتضمن الاتجاهات الأحدث الاهتمام المتناثر والخطي، والاهتمام المجمع والمتعدد الاستعلامات لتقليص الذاكرة أثناء الإنشاء، والتصميمات الهجينة التي تمزج الانتباه مع نماذج مساحة الحالة مثل Mamba لمدخلات طويلة جدًا. توقع أن تحافظ الأنظمة المستقبلية على مرونة الاهتمام مع ثني منحنى التكلفة بحيث تصبح معالجة المدخلات بطول الكتاب أو المدخلات متعددة المستندات أمرًا روتينيًا وبأسعار معقولة.
التنفيذ في العالم الحقيقي
الترجمة الآلية، حيث يهتم النموذج بالكلمات المصدر ذات الصلة عند إنتاج كل كلمة مترجمة.
التلخيص، حيث يساعد الاهتمام النموذج على التركيز على أهم الجمل في المقال الطويل.
مساعدو التعليمات البرمجية الذين يعودون إلى تعريفات المتغيرات السابقة عند التنبؤ بالسطر التالي.
إجابة السؤال عبر مستند، حيث يتم ربط كلمات السؤال بالفقرة التي تحتوي على الإجابة.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Attention Mechanisms quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
انزلاق النافذة الاهتمام
الأسئلة المتداولة
What is Attention Mechanisms?
يتيح الانتباه للنموذج تحديد الكلمات الأخرى في الجملة الأكثر أهمية عند تفسير كل كلمة. إنها الفكرة الأساسية التي جعلت المحول – وبالتالي الذكاء الاصطناعي الحديث مثل ChatGPT – ممكنًا.
في جملة واحدة، ما الذي تفعله آلية الانتباه؟
يحسب الانتباه الأوزان التي تحدد المقدار الذي يجب أن يرسمه كل رمز مميز على الرموز المميزة الأخرى عند تشكيل تمثيله.
ما هي الورقة التاريخية لعام 2017 التي قدمت بنية المحولات؟
"الانتباه هو كل ما تحتاجه" (فاسواني وآخرون، 2017) اقترح المحول الذي يعتمد على الاهتمام بدلا من التكرار.
ما هي المتجهات الثلاثة المحسوبة لكل رمز مميز في الاهتمام؟
ينتج كل رمز استعلامًا ومفتاحًا وقيمة؛ تتم مطابقة الاستعلامات مع المفاتيح لترجيح القيم.
في الصيغة softmax(QK^T / √d_k) V، لماذا القسمة على √d_k؟
يؤدي القياس حسب الجذر التربيعي للبعد الرئيسي إلى منع منتجات النقاط الكبيرة التي قد تدفع softmax إلى تدرجات صغيرة، مما يحافظ على استقرار التدريب.
لماذا يصبح الاهتمام الذاتي القياسي مكلفًا بالنسبة للمدخلات الطويلة جدًا؟
يهتم كل رمز بكل رمز مميز آخر، وبالتالي فإن عدد المقارنات يبلغ n²، مما يجعل التسلسلات الطويلة مكلفة في الوقت والذاكرة.