تحسين ذاكرة التخزين المؤقت KV
تقوم ذاكرة التخزين المؤقت KV بتخزين المفاتيح والقيم التي قام المحول بحسابها بالفعل، لذلك لا يعيد العمل لكل رمز مميز جديد - ولكن يمكن أن يتضخم ليصل إلى الجيجابايت.
نظرة عامة
KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.
الغوص العميق
في المحول، كل رمز مميز جديد يعتني بجميع الرموز المميزة السابقة عبر مفاتيح الانتباه (K) والقيم (V). إن إعادة حساب K وV للتسلسل بأكمله في كل خطوة سيكون أمرًا تربيعيًا ومهدرًا، لذلك تقوم النماذج بتخزينهما مؤقتًا: ذاكرة التخزين المؤقت KV. الجانب السلبي هو الحجم. تنمو ذاكرة التخزين المؤقت خطيًا مع طول التسلسل وحجم الدفعة والطبقات والرؤوس، لذلك يمكن أن يستهلك طلب السياق الطويل ذاكرة GPU أكبر من وزن النموذج نفسه. يعالج التحسين هذا الأمر من عدة زوايا: تقوم الذاكرة المقسمة إلى صفحات (PagedAttention الخاصة بـ vLLM) بتخزين ذاكرة التخزين المؤقت في كتل غير متجاورة لإزالة التجزئة وتمكين المشاركة؛ يخزن التكميم K وV في 8 بت أو 4 بت؛ والتغييرات المعمارية مثل تنبيه الاستعلامات المجمعة (GQA) وانتباه الاستعلامات المتعددة (MQA) تتيح للعديد من رؤوس الاستعلام مشاركة عدد أقل من رؤوس المفاتيح/القيم، مما يؤدي إلى خفض حجم ذاكرة التخزين المؤقت في المصدر.
البصيرة الفنية
يستعير PagedAttention ترحيل صفحات الذاكرة الافتراضية من أنظمة التشغيل: تعيش ذاكرة التخزين المؤقت في كتل ذات حجم ثابت تم تعيينها من خلال جدول بحث، لذلك تستخدم الطلبات فقط الكتل التي تحتاجها ويمكن للبادئات المتطابقة (مثل مطالبة النظام المشتركة) أن تشير إلى نفس الكتل. يقوم نظام الانتباه الكامن متعدد الرؤوس (MLA)، المستخدم في نماذج DeepSeek، بضغط K وV في ناقل كامن مشترك صغير، مما يؤدي إلى قطع الذاكرة بشكل كبير مع الحفاظ على الدقة.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل تحسين ذاكرة التخزين المؤقت KV
مع امتداد نوافذ السياق إلى مئات الآلاف أو الملايين من الرموز المميزة، تصبح ذاكرة التخزين المؤقت KV هي التكلفة السائدة للخدمة. توقع ضغطًا قويًا لذاكرة التخزين المؤقت وإزالتها (إسقاط الرموز المميزة منخفضة الاهتمام)، ومشاركة بادئة الطلب المتبادل كإعداد افتراضي، وتفريغ ذاكرة التخزين المؤقت الباردة إلى وحدة المعالجة المركزية (CPU) أو NVMe، وتصبح بنيات مثل MLA وGQA قياسية. ستشبه إدارة ذاكرة التخزين المؤقت بشكل متزايد التسلسل الهرمي الكامل للذاكرة مع الطبقات والجلب المسبق الذكي.
التنفيذ في العالم الحقيقي
يخدم PagedAttention الخاص بـ vLLM العديد من جلسات الدردشة المتزامنة عن طريق تعبئة كتل KV دون تجزئة الذاكرة
يؤدي الاهتمام بالاستعلام المجمع في نماذج Llama إلى تقليل حجم ذاكرة التخزين المؤقت KV بحيث تتناسب السياقات الأطول مع ذاكرة GPU
تحديد حجم ذاكرة التخزين المؤقت KV إلى 8 بت (KV8) لخفض ذاكرة التخزين المؤقت إلى النصف تقريبًا أثناء تلخيص المستندات الطويلة
التخزين المؤقت للبادئة الذي يعيد استخدام كتل KV لموجه النظام المشترك عبر الآلاف من طلبات API
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
ذاكرة التخزين المؤقت كيلو فولت
الأسئلة المتداولة
What is KV Cache Optimization?
تقوم ذاكرة التخزين المؤقت KV بتخزين المفاتيح والقيم التي قام المحول بحسابها بالفعل، لذلك لا يعيد العمل لكل رمز مميز جديد - ولكن يمكن أن يتضخم ليصل إلى الجيجابايت. يعمل تحسين ذاكرة التخزين المؤقت KV على تقليص تلك الذاكرة وإدارتها بحيث تخدم النماذج سياقات أطول لعدد أكبر من المستخدمين في وقت واحد.
ماذا تخزن ذاكرة التخزين المؤقت KV ولماذا؟
يؤدي التخزين المؤقت للمفاتيح والقيم من الرموز المميزة السابقة إلى تجنب إعادة حساب الانتباه على كل رمز مميز جديد، مما يوفر الوقت.
لماذا يمكن أن تصبح ذاكرة التخزين المؤقت KV مشكلة في الذاكرة؟
يتم قياس حجم ذاكرة التخزين المؤقت مع طول السياق والتزامن، بحيث يمكن للطلبات الطويلة استخدام كميات هائلة من ذاكرة وحدة معالجة الرسومات.
ما هو مفهوم نظام التشغيل الذي يستعيره PagedAttention؟
يقوم PagedAttention بتخزين ذاكرة التخزين المؤقت في كتل غير متجاورة ذات حجم ثابت يتم تعيينها من خلال جدول، تمامًا مثل ترحيل صفحات نظام التشغيل.
كيف يمكن للاستعلام المجمع والانتباه للاستعلام المتعدد تقليل حجم ذاكرة التخزين المؤقت لـ KV؟
إن مشاركة رؤوس المفاتيح/القيمات عبر رؤوس استعلام متعددة تعني عددًا أقل بكثير من متجهات K وV التي سيتم تخزينها.
ما هي إحدى فوائد مشاركة البادئة في ذاكرة التخزين المؤقت KV؟
ينتج عن موجه النظام المشترك إدخالات KV متطابقة، بحيث يمكن للطلبات المتعددة الإشارة إلى نفس الكتل بدلاً من تكرارها.