الدليل الفني

PagedAttention وvLLM

PagedAttention عبارة عن تقنية لإدارة الذاكرة تقوم بتخزين ذاكرة التخزين المؤقت للانتباه لنموذج اللغة في كتل صغيرة قابلة لإعادة الاستخدام بدلاً من قطعة واحدة كبيرة متجاورة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

الغوص العميق

عندما يقوم نموذج لغة بإنشاء نص، فإنه يحتفظ بـ "ذاكرة تخزين مؤقت KV" (متجهات المفاتيح والقيمة) لكل رمز مميز يراه حتى يتمكن الرمز المميز التالي من حضور السياق الكامل. تقليديًا، يحجز كل طلب لوحًا واحدًا كبيرًا متجاورًا من ذاكرة وحدة معالجة الرسومات (GPU) بحجم مناسب لأقصى طول ممكن، مما يؤدي إلى إهدار كميات هائلة عندما تكون التسلسلات أقصر أو متنوعة في الطول. يستعير PagedAttention، الذي تم تقديمه في ورقة vLLM لعام 2023 من جامعة كاليفورنيا في بيركلي، فكرة ترحيل صفحات الذاكرة الافتراضية من أنظمة التشغيل: فهو يقسم ذاكرة التخزين المؤقت KV إلى كتل ذات حجم ثابت يمكن أن تعيش في أي مكان في الذاكرة ويتم تخصيصها عند الطلب. يقوم جدول البحث بتعيين مواضع الرموز المنطقية للكتل الفعلية. يؤدي هذا إلى القضاء على تجزئة الذاكرة تقريبًا ويتيح مشاركة الكتل، على سبيل المثال عبر مخرجات متعددة من نفس الموجه.

البصيرة الفنية

يتم تقسيم ذاكرة التخزين المؤقت KV إلى صفحات ذات حجم ثابت، تحتوي كل منها على المفاتيح والقيم لعدد محدد من الرموز المميزة. يقوم جدول الكتل لكل تسلسل بتعيين المواضع المنطقية لمواقع الصفحات الفعلية، لذلك لا يلزم أن تكون ذاكرة التخزين المؤقت للتسلسل متجاورة. نظرًا لأن البادئات المتطابقة (موجه النظام المشترك، أو فروع بحث الحزمة) يمكن أن تشير إلى نفس الصفحات الفعلية عبر النسخ عند الكتابة، تتم إعادة استخدام الذاكرة بدلاً من تكرارها، مما يؤدي إلى خفض النفايات من أكثر من 60% إلى نسبة قليلة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل PagedAttention وvLLM

أصبح vLLM العمود الفقري الافتراضي للاستدلال مفتوح المصدر، وتظهر أفكار PagedAttention الآن عبر معظم مجموعات الخدمة. توقع تخزينًا مؤقتًا أعمق للبادئات (إعادة استخدام مطالبات النظام المخزنة مؤقتًا عبر المستخدمين)، والتعبئة المسبقة وفك التشفير على أجهزة منفصلة، ​​وسياسات إخلاء أكثر ذكاءً، وتكاملًا محكمًا مع القياس الكمي وفك التشفير التخميني. مع نمو نوافذ السياق إلى ملايين الرموز المميزة، تصبح إدارة KV المقسمة إلى صفحات أكثر أهمية للحفاظ على الخدمة بأسعار معقولة.

التنفيذ في العالم الحقيقي

استضافة واجهة برمجة تطبيقات LLM مفتوحة المصدر حيث يخدم vLLM العديد من مستخدمي الدردشة المتزامنين من وحدة معالجة رسومات واحدة بإنتاجية عالية

مشاركة موجه نظام طويل عبر آلاف الطلبات عبر التخزين المؤقت للبادئة بحيث تتم معالجتها مرة واحدة، وليس بشكل متكرر

تشغيل بحث الشعاع أو عمليات إكمال العينات المتعددة التي تشترك في كتل KV للموجه المشترك عبر النسخ عند الكتابة

قطع نفايات ذاكرة وحدة معالجة الرسومات (GPU) الناتجة عن التجزئة حتى يتمكن المزود من حزم المزيد من الجلسات المتزامنة على نفس الجهاز

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

الخصوصية التفاضلية

الأسئلة المتداولة

What is PagedAttention and vLLM?

PagedAttention عبارة عن تقنية لإدارة الذاكرة تقوم بتخزين ذاكرة التخزين المؤقت للانتباه لنموذج اللغة في كتل صغيرة قابلة لإعادة الاستخدام بدلاً من قطعة واحدة كبيرة متجاورة. إنه يعمل على تشغيل vLLM، وهو محرك تقديم مفتوح المصدر يعزز بشكل كبير عدد الطلبات التي يمكن لوحدة معالجة الرسومات الواحدة التعامل معها.

ما الذي تخزنه "ذاكرة التخزين المؤقت KV" أثناء إنشاء النص؟

تحتفظ ذاكرة التخزين المؤقت KV بمتجهات المفتاح والقيمة لكل رمز مميز سابق، مما يسمح للنموذج بحضور السياق الكامل دون إعادة حسابه في كل خطوة.

ما هو مفهوم نظام التشغيل الذي ألهم PagedAttention؟

يستعير PagedAttention ترحيل صفحات الذاكرة الافتراضية: يتم تقسيم ذاكرة التخزين المؤقت KV إلى صفحات ذات حجم ثابت يمكن أن تعيش في أي مكان، ويتم تعيينها بواسطة جدول كتلة.

ما هي مشكلة تخصيص ذاكرة التخزين المؤقت التقليدية لـ KV التي يحلها PagedAttention؟

يؤدي حجز لوح واحد كبير متجاور لكل طلب، بحجم يناسب الحد الأقصى للطول، إلى إهدار كميات هائلة من ذاكرة وحدة معالجة الرسومات. يخصص الترحيل كتلًا صغيرة حسب الطلب، مما يقلل من النفايات.

كيف يسمح PagedAttention لمخرجات متعددة بمشاركة الذاكرة لمطالبة مشتركة؟

تشير البادئات المتطابقة (المطالبات المشتركة أو فروع بحث الحزمة) إلى نفس صفحات KV الفعلية، ولا يتم نسخها إلا عندما يتباعد الفرع.

أين تم تطوير vLLM وPagedAttention في الأصل؟

خرجت vLLM وخوارزمية PagedAttention من جامعة كاليفورنيا في بيركلي في ورقة بحثية عام 2023 وسرعان ما أصبحت محرك خدمة مفتوح المصدر مستخدمًا على نطاق واسع.