استيفاء الموضع لتمديد السياق
إن استيفاء الموضع (PI) هو أسلوب يعمل على توسيع نافذة السياق القابلة للاستخدام لنموذج اللغة إلى ما هو أبعد من طول التدريب الخاص به عن طريق إعادة قياس المؤشرات الموضعية بدلاً من استقراءها.
نظرة عامة
It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.
الغوص العميق
تستخدم معظم برامج LLM الحديثة التضمين الموضعي الدوار (RoPE)، الذي يقوم بتشفير الموضع كزوايا دوران مطبقة على الاستعلام والمتجهات الرئيسية. إذا قمت ببساطة بتغذية تسلسلات أطول، فإن النموذج يرى المواضع وزوايا الدوران التي لم يتدرب عليها مطلقًا، وينهار الأداء لأن الانتباه يستقر بشكل سيئ على الترددات خارج النطاق. يتجنب استيفاء الموضع الاستقراء: للتمديد من الطول L إلى الطول L'، فإنه يقسم كل مؤشر موضع على العامل L'/L، ويضغط النطاق الجديد مرة أخرى في الفاصل الزمني المدرب. النموذج الآن لا يرى سوى زوايا التوزيع الداخلية، فقط متباعدة بشكل أكثر كثافة. يتيح الضبط الدقيق القصير (في كثير من الأحيان بضع مئات إلى آلاف الخطوات) التكيف مع المسافات الدقيقة، مما يؤدي إلى سلوك مستقر طويل السياق بجزء صغير من تكلفة التدريب المسبق.
البصيرة الفنية
يقوم RoPE بتدوير أزواج الأبعاد بترددات تتراوح بين الدقيقة والخشنة. يقوم PI بإعادة قياس الموضع من m إلى m/s حيث s = L'/L، لذا تظل زوايا الدوران ضمن النطاق المدرب بدلاً من الاستقراء. تذهب المتغيرات المدركة للترددات مثل NTK-aware Scaling وYaRN إلى أبعد من ذلك: فهي تعمل على قياس الترددات المنخفضة بشكل أقل والترددات العالية بشكل أكبر (أو يتم استيفاءها حسب الطول الموجي)، مما يحافظ على التفاصيل المحلية عالية التردد مع توسيع نطاق الوصول بعيد المدى منخفض التردد.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل استيفاء الموضع لتمديد السياق
امتداد السياق يتحرك بسرعة. إن طرقًا مثل تحجيم RoPE المدرك لـ NTK وYaRN وديناميكي/طويل RoPE تدفع الآن النوافذ إلى مئات الآلاف أو حتى ملايين الرموز المميزة، وأحيانًا مع القليل من الضبط الدقيق أو بدون ضبط. توقع أن يتم دمج حيل القياس هذه مع الاهتمام الفعال وضغط ذاكرة التخزين المؤقت KV، وأن تصبح مقابض قياسية في تكوينات النموذج. يستمر البحث في الحفاظ على الدقة العالية عبر النافذة الكاملة بحيث تكون السياقات الطويلة قابلة للاستخدام بشكل حقيقي، وليس فقط مدعومة اسميًا.
التنفيذ في العالم الحقيقي
توسيع نموذج LLaMA المدرب بدقة 4K إلى سياق 32K لتلخيص المستندات الطويلة بعد الضبط الدقيق القصير.
تحميل قاعدة تعليمات برمجية كاملة أو عقد قانوني كبير في موجه واحد للإجابة على الأسئلة عبر الملفات.
استخدام مقياس NTK أو YaRN لإطالة السياق مع الحد الأدنى من التدريب الإضافي أو بدونه.
خدمة تواريخ الدردشة الطويلة دون اقتطاع عن طريق إعادة قياس مواضع RoPE في وقت الاستدلال.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Position Interpolation for Context Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
YaRN وامتداد طول السياق
الأسئلة المتداولة
What is Position Interpolation for Context Extension?
إن استيفاء الموضع (PI) هو أسلوب يعمل على توسيع نافذة السياق القابلة للاستخدام لنموذج اللغة إلى ما هو أبعد من طول التدريب الخاص به عن طريق إعادة قياس المؤشرات الموضعية بدلاً من استقراءها. فهو يتيح للنموذج الذي تم تدريبه على، على سبيل المثال، 2K أو 4K من الرموز المميزة التعامل مع 32K أو أكثر مع الضبط الدقيق للضوء فقط.
ما هي الفكرة الأساسية للاستيفاء الموقف؟
يقوم PI بتقسيم مؤشرات الموضع على عامل الامتداد، مما يؤدي إلى تعيين التسلسل الأطول مرة أخرى في نطاق التوزيع الذي تعلمه النموذج بالفعل.
ما هو نظام التشفير الموضعي الذي يرتبط به استيفاء الموضع بشكل أكبر؟
تم تعميم PI للنماذج المستندة إلى RoPE، مما أدى إلى إعادة قياس زوايا الدوران بحيث تظل ضمن الترددات المدربة.
لماذا يميل الاستقراء الساذج للسياقات الأطول إلى الفشل؟
تؤدي تغذية تسلسلات أطول إلى تعريض النموذج لزوايا خارج النطاق لم يتدرب عليها مطلقًا، مما يتسبب في انخفاض الانتباه والأداء بشكل حاد.
في حالة تمديد طول السياق من L إلى L'، ما هو عامل إعادة القياس الذي ينطبق عليه PI الأساسي على الموضع m؟
يقوم PI بتعيين m إلى m مقسومًا على العامل s = L'/L، مما يضغط النطاق الأطول في الفاصل الزمني المدرب الأصلي.
كيف يمكن تحسين القياس المدرك لـ NTK وYaRN على الاستيفاء الموضعي العادي؟
تقوم هذه الأساليب بقياس الترددات المنخفضة والعالية بشكل مختلف، مع الاحتفاظ بالتفاصيل الموضعية المحلية الدقيقة مع الاستمرار في الوصول إلى سياقات أطول.