RWKV الاهتمام الخطي
RWKV عبارة عن بنية تتدرب مثل المحولات ولكنها تقوم بتشغيل الاستدلال مثل الشبكة المتكررة، مما يوفر توليد ذاكرة ثابتة في الوقت الخطي.
نظرة عامة
It reformulates attention so there is no quadratic cost and no growing key-value cache.
الغوص العميق
RWKV (تُنطق "RwaKuv") تعني التلقي، والوزن، والمفتاح، والقيمة، وعناصرها الأساسية الأربعة. تم إنشاؤه إلى حد كبير كمشروع مفتوح يقوده المجتمع بقيادة Bo Peng. الهدف هو الحفاظ على إمكانية التدريب الموازي للمحولات مع التخلص من الاستدلال الباهظ الثمن. يخزن الاهتمام القياسي ذاكرة تخزين مؤقت ذات قيمة رئيسية تنمو مع كل رمز مميز وتقارن كل رمز مميز جديد بجميع الرموز السابقة. بدلاً من ذلك، يقوم RWKV بنقل حالة مخفية صغيرة ذات حجم ثابت إلى الأمام، وتحديثها بقاعدة الاضمحلال الزمني حتى تتلاشى المعلومات القديمة بسلاسة. أثناء التدريب، يمكن فرده بشكل موازٍ؛ أثناء الإنشاء، تعمل كشبكة RNN تنتج رمزًا مميزًا واحدًا في كل مرة وبتكلفة ثابتة. وهذا يجعلها جذابة للسياقات الطويلة والنشر المحدود للموارد.
البصيرة الفنية
يستبدل RWKV انتباه منتج النقطة softmax بتكرار نمط الانتباه الخطي. يتحكم وزن الانحلال الزمني المكتسب لكل قناة (W) في مدى سرعة فقدان المفاتيح السابقة لتأثيرها، وتقرر بوابة الاستقبال (R) مقدار الحالة المتراكمة التي سيتم قراءتها، وتغذي متجهات المفتاح/القيمة مجموعًا مرجحًا جاريًا. نظرًا لأن كل خطوة تعتمد فقط على الحالة السابقة، تظل الذاكرة ثابتة ولا ينمو العمل لكل رمز مع طول التسلسل.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل الاهتمام الخطي RWKV
تم تكرار RWKV بسرعة من خلال الإصدارات (v4، v5 Eagle، v6 Finch وما بعده)، مما أدى إلى تضييق فجوة الجودة مع Transformers مع الحفاظ على التكلفة الخطية. توقع النمو المستمر في النماذج المفتوحة متعددة اللغات، ونشر وحدة المعالجة المركزية (CPU) والحافة حيث تكون الذاكرة الثابتة مهمة، والتصميمات المختلطة. الاستدلال المتكرر بالكامل يجعله مرشحًا قويًا لتطبيقات التدفق والسياقات الطويلة جدًا حيث قد تنفجر ذاكرات التخزين المؤقت ذات القيمة الرئيسية.
التنفيذ في العالم الحقيقي
تشغيل نماذج دردشة مفتوحة المصدر قادرة على وحدات المعالجة المركزية (CPU) أو الأجهزة ذات الذاكرة المنخفضة مع ذاكرة ثابتة لكل رمز مميز
إنشاء نص متدفق حيث يتم إنتاج الرموز المميزة واحدًا تلو الآخر دون الحاجة إلى ذاكرة تخزين مؤقت متزايدة
معالجة المستندات الطويلة حيث تكون ذاكرة التخزين المؤقت لقيمة المفتاح الخاصة بالمحول كبيرة جدًا
المشاريع النموذجية المجتمعية ومتعددة اللغات التي تحتاج إلى بنية فعالة ومرخصة بشكل مفتوح
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the RWKV Linear Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
الاهتمام الخطي ونواة الأداء
الأسئلة المتداولة
What is RWKV Linear Attention?
RWKV عبارة عن بنية تتدرب مثل المحولات ولكنها تقوم بتشغيل الاستدلال مثل الشبكة المتكررة، مما يوفر توليد ذاكرة ثابتة في الوقت الخطي. إنه يعيد صياغة الاهتمام بحيث لا توجد تكلفة تربيعية ولا توجد ذاكرة تخزين مؤقت ذات قيمة رئيسية متزايدة.
ما هي الخاصية الرئيسية لـ RWKV؟
هدف تصميم RWKV هو التدريب الموازي على نمط المحولات جنبًا إلى جنب مع الاستدلال المتكرر والتكلفة الثابتة.
ماذا تعني الحروف في RWKV؟
تمت تسمية RWKV على اسم مكوناته الأربعة: الاستلام والوزن والمفتاح والقيمة.
كيف يحافظ RWKV على ثبات الذاكرة أثناء عملية الإنشاء؟
مثل RNN، يقوم RWKV بتحديث حالة ذات حجم ثابت في كل خطوة، لذلك لا تنمو الذاكرة مع طول التسلسل.
ما الدور الذي يلعبه وزن الاضمحلال الزمني (W)؟
يحدد وزن الاضمحلال المكتسب لكل قناة مدى سرعة تلاشي المفاتيح السابقة في حالة التشغيل.
بالمقارنة مع انتباه softmax، ما الذي يتجنبه تكرار الانتباه الخطي لـ RWKV؟
باستخدام التكرار، يتجنب RWKV مقارنة كل رمز مميز بكل رمز مميز آخر، مما يؤدي إلى إزالة التكلفة التربيعية.