ذاكرة التخزين المؤقت كيلو فولت
تقوم ذاكرة التخزين المؤقت KV بتخزين متجهات المفتاح والقيمة التي قام المحول بحسابها بالفعل للرموز المميزة السابقة، لذلك لا يتعين عليه إعادة حسابها لكل كلمة جديدة يقوم بإنشائها.
نظرة عامة
It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.
الغوص العميق
تقوم المحولات بإنشاء رمز نصي واحد في كل مرة، وتحتاج كل طبقة انتباه لرمز مميز جديد إلى المقارنة مع كل رمز مميز سابق. تعمل آلية الانتباه على تحويل كل رمز مميز إلى استعلام ومفتاح ومتجه قيمة. بدون التخزين المؤقت، فإن إنشاء الرمز المميز رقم 1000 يعني إعادة حساب المفاتيح والقيم لجميع الرموز المميزة الـ 999 السابقة في كل خطوة - وهو عمل تربيعي ومهدر. تقوم ذاكرة التخزين المؤقت KV بحفظ متجهات المفاتيح والقيم هذه بعد حسابها لأول مرة وإعادة استخدامها، لذا فإن كل خطوة جديدة تحسب فقط المتجهات لأحدث رمز مميز وتهتم بذاكرة التخزين المؤقت المخزنة. يؤدي هذا إلى تقليص تكلفة كل رمز مميز من التوسع بطول التسلسل إلى ثابت تقريبًا. المقايضة هي الذاكرة: تنمو ذاكرة التخزين المؤقت خطيًا مع طول السياق، وعدد الطبقات، ورؤوس الانتباه، وغالبًا ما تصبح مستهلك الذاكرة المهيمن في خدمة السياق الطويل.
البصيرة الفنية
أثناء مرحلة "التعبئة المسبقة"، يقوم النموذج بمعالجة الموجه بالكامل ويملأ ذاكرة التخزين المؤقت؛ أثناء "فك التشفير"، يتم إلحاق K/V لرمز مميز واحد في كل خطوة وإعادة الحضور. يتم قياس حجم ذاكرة التخزين المؤقت على شكل 2 (K وV) × طبقات × رؤوس × رأس_ديم × طول_تسلسل × دفعة، بالدقة المختارة. لترويض ذلك، تستخدم النماذج الحديثة استعلامًا مجمعًا أو استعلامًا متعددًا لمشاركة المفاتيح/القيم عبر الرؤوس، وتستخدم أنظمة الخدمة مثل vLLM PagedAttention لتخصيص ذاكرة التخزين المؤقت في كتل غير متجاورة، مما يقلل التجزئة والنفايات.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل ذاكرة التخزين المؤقت KV
مع امتداد نوافذ السياق إلى مئات الآلاف من الرموز المميزة، تصبح ذاكرة التخزين المؤقت KV هي عنق الزجاجة المركزي، لذلك يكون الابتكار شرسًا: تكميم ذاكرة التخزين المؤقت إلى 8 أو 4 بتات، وسياسات الإخلاء التي تسقط الرموز المميزة منخفضة الأهمية، ومشاركة بادئة الطلب المتبادل، والتفريغ إلى وحدة المعالجة المركزية أو القرص. التحولات المعمارية مثل الاهتمام الكامن متعدد الرؤوس تضغط على ذاكرة التخزين المؤقت نفسها. توقع استمرار التصميم المشترك لمتغيرات الانتباه وأنظمة الذاكرة التي تهدف إلى خدمة سياقات طويلة جدًا بسعر رخيص وبإنتاجية عالية.
التنفيذ في العالم الحقيقي
تسريع ردود chatbot عن طريق إعادة استخدام المفاتيح/القيم المخزنة مؤقتًا من سجل المحادثة بدلاً من إعادة معالجتها في كل دورة.
يقوم التخزين المؤقت للبادئة بمشاركة ذاكرة التخزين المؤقت لمطالبة نظام طويلة عبر العديد من المستخدمين، مما يقلل التكلفة ووقت الاستجابة.
يقوم PagedAttention الخاص بـ vLLM بإدارة ذاكرة التخزين المؤقت KV في كتل لخدمة العديد من الطلبات المتزامنة على وحدة معالجة رسومات واحدة بكفاءة.
تحديد حجم ذاكرة التخزين المؤقت KV لتقليل الدقة لتناسب السياقات الأطول في ذاكرة GPU المحدودة.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحسين ذاكرة التخزين المؤقت KV
الأسئلة المتداولة
What is KV Cache?
تقوم ذاكرة التخزين المؤقت KV بتخزين متجهات المفتاح والقيمة التي قام المحول بحسابها بالفعل للرموز المميزة السابقة، لذلك لا يتعين عليه إعادة حسابها لكل كلمة جديدة يقوم بإنشائها. هذا هو السبب الأكبر الذي يجعل إنشاء النص سريعًا - والشيء الرئيسي الذي يستهلك ذاكرة وحدة معالجة الرسومات الخاصة بك أثناء المحادثات الطويلة.
ماذا تخزن ذاكرة التخزين المؤقت KV؟
تحتفظ ذاكرة التخزين المؤقت KV بالمفتاح ومتجهات القيمة من الرموز المميزة السابقة حتى يتمكن الاهتمام من إعادة استخدامها بدلاً من إعادة الحساب.
ما هي المشكلة التي تحلها ذاكرة التخزين المؤقت KV بشكل أساسي؟
بدون التخزين المؤقت، سيتطلب كل رمز مميز جديد إعادة حساب K/V لكل رمز مميز سابق، وهو أمر مهدر؛ تجعل ذاكرة التخزين المؤقت تكلفة كل رمز ثابتًا تقريبًا.
ما هو الجانب السلبي الرئيسي لذاكرة التخزين المؤقت KV؟
تنمو ذاكرة التخزين المؤقت مع طول التسلسل والطبقات والرؤوس، وغالبًا ما تصبح المستهلك المهيمن لذاكرة وحدة معالجة الرسومات في خدمة السياق الطويل.
ما هي التقنية التي تقلل حجم ذاكرة التخزين المؤقت KV من خلال مشاركة المفاتيح والقيم عبر رؤوس الانتباه؟
يتيح الاستعلام المجمع والاستعلام المتعدد لرؤوس الاستعلامات المتعددة مشاركة عدد أقل من مجموعات المفاتيح/القيم، مما يؤدي إلى تقليص ذاكرة التخزين المؤقت بشكل كبير.
ما هي مرحلتي استدلال المحولات بالنسبة لذاكرة التخزين المؤقت KV؟
التعبئة المسبقة تملأ ذاكرة التخزين المؤقت بـ K/V الخاص بالموجه؛ يقوم فك التشفير بإلحاق K/V لرمز مميز جديد في كل خطوة ويعيد الانتباه إلى ذاكرة التخزين المؤقت.