الدليل الفني

الخلط المستمر

التجميع المستمر هو أسلوب تقديم يضيف الطلبات ويزيلها من رمز مميز دفعة واحدة قيد التشغيل، بدلاً من انتظار انتهاء دفعة ثابتة كاملة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.

الغوص العميق

تكون وحدات معالجة الرسومات هي الأسرع عندما تقوم بمعالجة العديد من الطلبات معًا دفعة واحدة. النهج الساذج، التجميع الثابت، يجمع مجموعة ثابتة من الطلبات، ويشغلها جميعًا حتى الاكتمال، ثم يبدأ الدفعة التالية. المشكلة: تختلف مخرجات نموذج اللغة بشكل كبير في الطول، لذا تنتهي الطلبات القصيرة مبكرًا وتظل فتحاتها في وضع الخمول بينما تنتظر الدفعة أطولها، مما يؤدي إلى إهدار دورات GPU وتأخير الوافدين الجدد. يعمل التجميع المستمر (يُسمى أيضًا التجميع على متن الطائرة أو على مستوى التكرار، والذي اشتهر بواسطة ورقة Orca ويستخدم في vLLM، وTensorRT-LLM، وTGI) بدقة خطوة واحدة لفك التشفير. بعد إنشاء كل رمز مميز، تخرج التسلسلات النهائية من الدفعة ويتم إدراج الطلبات التي وصلت حديثًا على الفور. يؤدي هذا إلى إبقاء الدفعة ممتلئة ووحدة معالجة الرسومات مشبعة، وغالبًا ما يؤدي ذلك إلى زيادة الإنتاجية عدة مرات مع زمن وصول أقل للمستخدمين المنتظرين.

البصيرة الفنية

التحول الرئيسي هو من تجميع الطلبات بأكملها إلى تجميع التكرارات الفردية. في كل خطوة فك تشفير، يقوم المجدول ببناء المجموعة النشطة: فهو يقوم بتشغيل تمريرة أمامية واحدة عبر جميع التسلسلات أثناء الرحلة، ويصدر رمزًا مميزًا واحدًا لكل منها، ويطرد أي رمز يصل إلى رمز نهاية التسلسل أو حد الطول، ويعترف بالطلبات الموضوعة في قائمة الانتظار لملء الفتحات المحررة. إن إقران هذا مع ذاكرة KV المرنة الخاصة بـ PagedAttention يجعل إدراج وإزالة التسلسلات في منتصف الرحلة رخيصًا، نظرًا لأن ذاكرة التخزين المؤقت لكل تسلسل تعيش في كتل مستقلة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل الخلط المستمر

أصبح التجميع المستمر الآن معيارًا قياسيًا في خدمة الإنتاج LLM. يعمل العمل المستقبلي على تحسين المجدول: فصل مرحلة التعبئة المسبقة ذات الحوسبة الثقيلة عن مرحلة فك التشفير الأخف (التفصيل)، والتعبئة المسبقة المقسمة لتجنب توقف فك التشفير، وسياسات الأولوية والعدالة لأحمال العمل المختلطة، والاقتران الأكثر إحكامًا مع فك التشفير التخميني بحيث يتم التحقق من صحة رموز المسودة المتعددة في كل خطوة. الهدف هو الضغط على الحد الأقصى من الرموز المميزة في الثانية لكل وحدة معالجة رسومات مع الحفاظ على زمن استجابة الاستجابة الفردية منخفضًا ويمكن التنبؤ به.

التنفيذ في العالم الحقيقي

واجهة برمجة تطبيقات للدردشة تقبل رسائل المستخدم التي وصلت حديثًا إلى الدفعة الجاري تشغيلها على الفور بدلاً من وضعها في قائمة الانتظار للدفعة التالية

طرد إجابة قصيرة مكتملة في منتصف الدفعة وإعادة ملء الفتحة الخاصة بها حتى لا تتوقف وحدة معالجة الرسومات أبدًا عن الانتظار لجيل طويل

الجمع بين الدفع المستمر مع PagedAttention الخاص بـ vLLM لإدراج وإزالة التسلسلات بسعر رخيص في كل خطوة من خطوات فك التشفير

خدمة إكمال التعليمات البرمجية التي تحافظ على الرموز المميزة العالية في الثانية في ظل حركة مرور متقطعة ومتغيرة الطول عن طريق الحفاظ على الدفعة ممتلئة

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Continuous Batching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

Kubernetes لأحمال عمل ML

الأسئلة المتداولة

What is Continuous Batching?

التجميع المستمر هو أسلوب تقديم يضيف الطلبات ويزيلها من رمز مميز دفعة واحدة قيد التشغيل، بدلاً من انتظار انتهاء دفعة ثابتة كاملة. إنه يبقي وحدة معالجة الرسومات مشغولة باستمرار ويزيد بشكل كبير من عدد المستخدمين الذين يمكن لنموذج الذكاء الاصطناعي خدمتهم في وقت واحد.

ما هي نقطة الضعف الرئيسية في الدفعات الثابتة (الثابتة) لخدمة LLM؟

ونظرًا لاختلاف أطوال المخرجات، تبقى التسلسلات النهائية في وضع الخمول حتى يكتمل التسلسل الأبطأ، مما يؤدي إلى إهدار دورات وحدة معالجة الرسومات وتأخير الطلبات الجديدة.

ما هي التفاصيل التي يضيفها الدفع المستمر للطلبات ويزيلها؟

تعمل الدفعات المستمرة (على مستوى التكرار) على تحديث المجموعة النشطة بعد كل خطوة فك تشفير واحدة، بحيث تعمل رمزًا مميزًا بدلاً من كل طلب كامل.

عندما ينتهي التسلسل في منتصف الدفعة في ظل الدفع المستمر، ماذا يحدث للفتحة الخاصة به؟

يتم إخلاء التسلسلات النهائية ويتم إدراج طلبات الانتظار على الفور، مما يؤدي إلى إبقاء الدفعة ممتلئة ووحدة معالجة الرسومات مشغولة.

ما هي التقنية التي تتزاوج بشكل طبيعي مع الدفع المستمر لجعل عملية إدراج/إزالة التسلسلات رخيصة؟

يقوم PagedAttention بتخزين ذاكرة التخزين المؤقت KV لكل تسلسل في كتل مستقلة، لذا فإن إضافة تسلسل أو إزالته في منتصف الرحلة لا يؤدي إلى إزعاج ذاكرة الآخرين.

ما هي الورقة البحثية التي يُنسب إليها عادة تعميم التجميع على مستوى التكرار (المستمر)؟

قدمت ورقة Orca الجدولة على مستوى التكرار، وتم اعتماد الفكرة من خلال أنظمة الخدمة مثل vLLM، وTGI، وTensorRT-LLM.