YaRN وامتداد طول السياق
YaRN (امتداد RoPE آخر) هو أسلوب فعال لتمديد نافذة السياق القابلة للاستخدام للنموذج إلى ما هو أبعد مما تم تدريبه عليه.
نظرة عامة
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
الغوص العميق
تقوم معظم برامج LLM الحديثة بتشفير مواضع الرموز المميزة باستخدام RoPE (Rotary Position Embeddings)، والتي تقوم بتدوير الاستعلام والمتجهات الرئيسية حسب الزوايا المرتبطة بالموضع. عندما تقوم بتغذية تسلسلات أطول من مدة التدريب، تدخل هذه الدورات في نطاقات غير مرئية وينهار النموذج. تعمل YaRN، التي تم تقديمها في عام 2023 بواسطة Bowen Peng والمتعاونين معه، على إصلاح هذه المشكلة من خلال الاستيفاء المدرك لـ NTK المطبق لكل تردد: فهو يترك أبعاد التردد العالي (التي تلتقط العلاقات المحلية قصيرة المدى) دون تغيير في الغالب أثناء استيفاء أبعاد التردد المنخفض (التي تتتبع الموضع بعيد المدى). تضيف YaRN أيضًا تعديلًا لدرجة الحرارة إلى الانتباه لمواجهة تغيرات الإنتروبيا التي تأتي من سياقات أطول. والنتيجة هي أداء قوي طويل السياق بعد الضبط الدقيق لجزء صغير فقط من البيانات والخطوات التي تتطلبها الأساليب الساذجة.
البصيرة الفنية
يقوم RoPE بتعيين تردد دوران لكل بُعد من أبعاد التضمين. يضغط الاستيفاء الخطي الساذج جميع الترددات بالتساوي، مما يضر بأبعاد التردد العالي التي تشفر التفاصيل المحلية الدقيقة. تستخدم YaRN وظيفة منحدر لاستكمال أبعاد التردد المنخفض (الطول الموجي الطويل) فقط مع الحفاظ على أبعاد التردد العالي، بالإضافة إلى مقياس درجة حرارة الانتباه 1/sqrt(t) الذي يحافظ على استقرار حدة softmax مع نمو طول التسلسل. يعمل نهج NTK-by-parts هذا على توسيع السياق مع تدهور أقل بكثير.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل الغزل وامتداد طول السياق
أصبح امتداد السياق الآن ممارسة قياسية: تقوم النماذج المفتوحة بشكل روتيني بشحن متغيرات YaRN الممتدة التي تصل إلى 128 ألف رمز مميز أو أكثر. تتجه الأبحاث نحو الأساليب التي توسع السياق بضبط دقيق صفر أو قريب من الصفر، وتجمع بين إعادة قياس RoPE وحيل نمط الانتباه، وتحافظ على الجودة عبر النافذة الكاملة بدلاً من النهايات فقط. توقع تكاملًا أكثر إحكامًا لهذه التقنيات في التدريب المسبق بحيث يكون السياق أصليًا وليس مُعدلًا.
التنفيذ في العالم الحقيقي
توسيع نموذج سياق 4K مفتوح إلى 32K أو 128K للإجابة على أسئلة المستندات الطويلة مع ضبط دقيق موجز
تمكين أنظمة الاسترجاع المعززة من استيعاب العديد من المقاطع المتسلسلة دون اقتطاع
تشغيل مساعدي التعليمات البرمجية الذين يحتاجون إلى ملف مستودع كبير كامل أو ملفات متعددة في موجه واحد
تكييف نموذج أساسي للمحادثات الطويلة متعددة المنعطفات التي تتراكم سجلات الدردشة الكبيرة
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
استيفاء الموضع لتمديد السياق
الأسئلة المتداولة
What is YaRN and Context Length Extension?
YaRN (امتداد RoPE آخر) هو أسلوب فعال لتمديد نافذة السياق القابلة للاستخدام للنموذج إلى ما هو أبعد مما تم تدريبه عليه. إنه يعيد قياس تضمينات الموضع الدوار بذكاء بحيث يمكن للنموذج الذي تم تدريبه على رموز 4K، على سبيل المثال، التعامل مع 32K أو أكثر بأقل قدر من الضبط الدقيق.
ما هي طريقة ترميز الموضع التي تقوم YaRN بتعديلها لتوسيع السياق؟
تعمل YaRN، التي يعني اسمها امتدادًا آخر للحبل، على إعادة قياس موضع التضمين الدوار المستخدم في معظم شهادات LLM الحديثة.
ما الخطأ الذي يحدث عندما يرى نموذج RoPE تسلسلات أطول من طول التدريب الخاص به؟
تنتج الأوضاع التي تتجاوز التدريب زوايا دوران لم يسبق للنموذج رؤيتها، لذلك يتدهور سلوك الانتباه بشكل حاد.
كيف تتعامل YaRN مع أبعاد تردد RoPE المختلفة؟
يستخدم YaRN منحدر NTK-by-parts الذي يقحم الخفتات ذات التردد المنخفض ذات الطول الموجي الطويل ويترك الخفتات عالية التردد قصيرة المدى سليمة في الغالب.
إلى جانب إعادة قياس الترددات، ما هو التعديل الإضافي الذي تطبقه YaRN؟
يضيف YaRN مقياسًا لدرجة الحرارة إلى سجلات الانتباه لمواجهة تحولات الإنتروبيا التي تحدث مع نمو السياق.
ما هي الميزة العملية الرئيسية لـ YaRN على الاستيفاء الساذج؟
تحقق YaRN جودة قوية للسياق الطويل بعد الضبط الدقيق لجزء صغير من البيانات التي تتطلبها الأساليب الساذجة.