دليل اللغة AI

تحجيم نافذة سياق YaRN

YaRN (امتداد RoPE آخر) هي تقنية تعمل على توسيع نافذة السياق القابلة للاستخدام للمحول إلى ما هو أبعد بكثير مما تم تدريبه عليه، مع الحد الأدنى من الضبط الدقيق.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it lets existing models handle much longer documents without retraining from scratch.

الغوص العميق

تقوم معظم برامج LLM الحديثة بتشفير مواضع الكلمات باستخدام Rotary Position Embeddings (RoPE)، والتي تعمل بشكل جيد فقط حتى الطول الذي شاهده النموذج أثناء التدريب. قم بالتغذية بتسلسل أطول وسيتدهور النموذج بشكل سيئ. تحل YaRN هذه المشكلة عن طريق إعادة قياس ترددات دوران RoPE بطريقة تراعي التردد: تُترك أبعاد التردد العالي (التي تلتقط العلاقات المحلية والقريبة) دون تغيير في الغالب، في حين يتم استيفاء أبعاد التردد المنخفض (التي تلتقط موضعًا بعيد المدى). كما أنه يضيف تعديلًا لدرجة الحرارة إلى الاهتمام للحفاظ على حسن التصرف على المدى الطويل. النتيجة، الموضحة في نماذج LLaMA، توسع السياق من 4K إلى 64K-128K من الرموز المميزة باستخدام حوالي 0.1% فقط من بيانات التدريب الأصلية وبضع مئات من خطوات الضبط الدقيق.

البصيرة الفنية

يقوم RoPE بتدوير الاستعلام والمتجهات الرئيسية بزاوية تتناسب مع الموضع والتردد لكل بُعد. يؤدي الاستيفاء الخطي الساذج (استيفاء الموضع) إلى سحق جميع الترددات بالتساوي، مما يضر بالتفاصيل المحلية. بدلًا من ذلك، يطبق YaRN تقنية NTK-by-parts: فهو يقوم باستيفاء أبعاد التردد المنخفض (الطول الموجي الطويل) فقط، ويترك الأبعاد ذات التردد العالي بمفردها، وينتقل بينها. يعوض مقياس درجة حرارة الانتباه تغير الإنتروبيا، مما يحافظ على الدقة عند الأطوال الممتدة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل تحجيم نافذة سياق YaRN

أصبح الامتداد المدرك للتردد على نمط YaRN مكونًا افتراضيًا لشحن النماذج ذات السياق الطويل؛ تستمر المتغيرات والخلفاء في الظهور بينما تتجه المختبرات نحو نوافذ تحتوي على مليون رمز مميز. توقع تكاملًا أكثر إحكامًا مع الاهتمام الفعال وضغط ذاكرة التخزين المؤقت KV والقياس الديناميكي الذي يتم ضبطه بسرعة لكل طلب. الاتجاه الأوسع هو فصل "مدة تدريب النموذج" عن "المدة التي يمكن أن يقرأها بشكل مفيد"، مما يجعل السياق الطويل ميزة رخيصة بعد التدريب بدلاً من التزام معماري باهظ الثمن.

التنفيذ في العالم الحقيقي

توسيع نموذج LLaMA مفتوح من 4K إلى 128K من الرموز المميزة حتى يتمكن من استيعاب قاعدة تعليمات برمجية كاملة أو عقد طويل في تمريرة واحدة

السماح لبرنامج الدردشة الآلية بالاحتفاظ بسجلات محادثة طويلة جدًا دون اقتطاع المنعطفات السابقة

تلخيص المستندات بطول الكتاب أو النصوص متعددة الساعات التي تتجاوز النافذة الأصلية للنموذج الأساسي

التكيف بتكلفة منخفضة مع نموذج تم تدريبه مسبقًا لمهام استرجاع السياق الطويل باستخدام عملية ضبط دقيقة صغيرة فقط

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is YaRN Context Window Scaling?

YaRN (امتداد RoPE آخر) هي تقنية تعمل على توسيع نافذة السياق القابلة للاستخدام للمحول إلى ما هو أبعد بكثير مما تم تدريبه عليه، مع الحد الأدنى من الضبط الدقيق. إنه أمر مهم لأنه يتيح للنماذج الحالية التعامل مع مستندات أطول بكثير دون إعادة التدريب من البداية.

ما هو نظام ترميز الموضع الذي تقوم YaRN بتعديله لتوسيع طول السياق؟

يرمز YaRN إلى "Yet Another RoPE extensioN" ويعمل عن طريق إعادة قياس ترددات الدوران المستخدمة في Rotary Position Embeddings.

كيف تتعامل YaRN مع أبعاد RoPE ذات التردد العالي مقابل التردد المنخفض؟

يحافظ نهج "NTK-by-parts" الخاص بشركة YaRN على أبعاد التردد العالي (المحلي) بينما يقوم باستيفاء أبعاد التردد المنخفض (طويل المدى) لتجنب الإضرار بالتفاصيل المحلية.

ما هي ميزة الكفاءة الرئيسية لـ YaRN مقارنة بتدريب نموذج طويل السياق من البداية؟

يمكن لـ YaRN توسيع السياق باستخدام ما يقرب من 0.1% من بيانات التدريب الأصلية وعدد صغير من خطوات الضبط الدقيق، وهو أرخص بكثير من إعادة التدريب.

إلى جانب إعادة قياس الترددات، ما هو التعديل الإضافي الذي تطبقه YaRN للحفاظ على استقرار الانتباه بعيد المدى؟

يقوم YaRN بتعديل درجة حرارة الانتباه للتعويض عن تحول الإنتروبيا/اللوغاريتم الذي يحدث عندما تصبح التسلسلات أطول بكثير.

ما هي المشكلة التي تحدث إذا قمت بتغذية تسلسلات نموذج RoPE لفترة أطول بكثير مما تم تدريبه عليه، دون أي قياس؟

يتم تعميم RoPE بشكل سيئ على المراكز الطويلة غير المرئية، لذلك تنهار الجودة ما لم يتم إعادة قياس الترددات.