KServe والعرض النموذجي على Kubernetes
KServe عبارة عن منصة موحدة أصلية من Kubernetes لخدمة نماذج التعلم الآلي على نطاق واسع.
نظرة عامة
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
الغوص العميق
يُعرف KServe سابقًا باسم KFServing ونشأ من مشروع Kubeflow، ويحدد مورد InferenceService المخصص. تكتب ملف YAML قصيرًا يشير إلى نموذج مخزّن في وحدة تخزين الكائنات (S3، GCS، Azure Blob)، ويتولى KServe الباقي. وهو يدعم كلا من الاستدلال التنبئي، وبشكل متزايد، خدمة LLM التوليدية. تقوم KServe بشحن "أوقات تشغيل العرض" المعدة مسبقًا لأطر العمل الشائعة (TensorFlow Serving، وTorchServe، وTriton، وscikit-learn، وXGBoost، وHugging Face) وتدعم الحاويات المخصصة. تم تصميمه استنادًا إلى Knative Serving وطبقة الشبكة (Istio أو ما شابه)، وهو يوفر قياسًا تلقائيًا يعتمد على الطلب بما في ذلك القياس الحقيقي إلى الصفر، لذلك لا تستهلك النماذج الخاملة أي حساب. كما أنه يعمل على توحيد واجهة برمجة تطبيقات التنبؤ حول بروتوكول الاستدلال المفتوح، بحيث يتحدث العملاء مع كل نموذج بنفس الطريقة بغض النظر عن إطار العمل.
البصيرة الفنية
يعتمد القياس التلقائي لـ KServe على Knative، الذي يقيس عدد النسخ المتماثلة بناءً على التزامن أو الطلبات في الثانية ويمكن أن ينخفض إلى صفر نسخ متماثلة عندما تتوقف حركة المرور، ثم يبدأ على البارد عند الطلب. تقوم InferenceService بتجريد خط أنابيب الاستدلال الكامل إلى مكونات التوقع والمحول (ما قبل / ما بعد المعالجة) والشرح. يتم تحميل النماذج من مخزن الكائنات عبر "مهيئات التخزين" التي تسحب العناصر إلى الكبسولة عند بدء التشغيل، مما يؤدي إلى فصل تخزين النموذج عن صورة حاوية التقديم.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل KServe والعرض النموذجي على Kubernetes
تتطور KServe بسرعة نحو الذكاء الاصطناعي التوليدي، مما يضيف مسارًا يركز على LLM مع ميزات مثل التوجيه المدرك لذاكرة التخزين المؤقت لـ KV، والتخزين المؤقت للنموذج، وخدمة التعبئة المسبقة/فك التشفير المفصلة لنماذج اللغات الكبيرة. توقع تكاملًا أعمق مع محركات الاستدلال مثل vLLM، وخدمة أفضل متعددة العقد للنماذج الكبيرة جدًا بالنسبة لوحدة معالجة رسومات واحدة، والتوجيه على مستوى البوابة لموازنة التحميل المستندة إلى الرمز المميز. وباعتباره مشروعًا حاضنًا لـ CNCF، فقد أصبح المعيار المفتوح الفعلي لوضع النماذج خلف Kubernetes، مما يؤدي إلى تضييق الفجوة بين نتائج البحث ونقاط نهاية الإنتاج المرنة.
التنفيذ في العالم الحقيقي
ينشر أحد البنوك نموذج تسجيل الائتمان عن طريق كتابة InferenceService YAML مكون من 10 أسطر يشير إلى النموذج في S3، مع تعامل KServe مع القياس التلقائي والدخول.
يستخدم فريق التجارة الإلكترونية عمليات طرح KServe canary لإرسال 10 بالمائة من حركة المرور إلى نموذج توصية جديد، ثم يرتفع إلى 100 بالمائة بمجرد أن تبدو المقاييس سليمة.
يخدم مختبر الأبحاث العشرات من النماذج التي نادرًا ما تستخدم بمقياس مقياس إلى الصفر، لذلك يتم تشغيل كل نموذج فقط عند وصول الطلب ولا يستهلك أي وحدة معالجة رسومات (GPU) عندما يكون في وضع الخمول.
يستخدم فريق MLOps مكون محول KServe لتشغيل تغيير حجم الصورة وتطبيعها قبل أن يقوم المتنبئ بتشغيل نموذج رؤية يخدمه Triton.
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
التعديلات التأملية لنماذج التعليمات البرمجية
الأسئلة المتداولة
What is KServe and Model Serving on Kubernetes?
KServe عبارة عن منصة موحدة أصلية من Kubernetes لخدمة نماذج التعلم الآلي على نطاق واسع. إنه يمنح الفرق طريقة واحدة معلنة لنشر النماذج ذات القياس التلقائي، وعمليات طرح الكناري، والقياس إلى الصفر، مما يؤدي إلى تجريد معظم أعمال السباكة في Kubernetes.
ما هو الاسم السابق لـ KServe قبل أن يصبح مشروعًا مستقلاً؟
نشأت KServe كـ KFServing ضمن مشروع Kubeflow قبل أن تصبح منصة مستقلة.
ما هو المورد المخصص الأساسي لـ Kubernetes الذي تحدده لنشر نموذج مع KServe؟
أنت تعلن عن مورد InferenceService مخصص، عادةً في YAML، لنشر نموذج معروض وتكوينه.
ما هي الإمكانية التي تسمح لنماذج KServe الخاملة باستهلاك صفر حساب حتى وصول الطلب؟
تم بناء KServe على Knative، وهو يدعم النطاق إلى الصفر، مما يؤدي إلى إسقاط النسخ المتماثلة إلى الصفر عندما لا تكون هناك حركة مرور وبدء بارد عند الطلب.
ما المشروع الأساسي الذي يوفر القياس التلقائي القائم على الطلب لـ KServe؟
يعتمد KServe على Knative Serving، الذي يقوم بقياس النسخ المتماثلة بناءً على التزامن أو معدل الطلب ويتيح إمكانية القياس إلى الصفر.
كيف تقوم KServe عادةً بإدخال القطع الأثرية النموذجية في حجرة التقديم عند بدء التشغيل؟
تقوم أدوات تهيئة التخزين بتنزيل العناصر النموذجية من تخزين الكائنات (مثل S3 أو GCS) إلى الكبسولة، مما يؤدي إلى فصل النماذج عن الصورة.