KServe и обслужване на модели в Kubernetes
KServe е стандартизирана, базирана на Kubernetes платформа за обслужване на модели за машинно обучение в мащаб.
Преглед
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
Дълбоко гмуркане
По-рано известен като KFServing и роден от проекта Kubeflow, KServe дефинира потребителски ресурс на InferenceService. Пишете кратък YAML файл, сочещ към модел, съхранен в обектно хранилище (S3, GCS, Azure Blob), а KServe се справя с останалото. Той поддържа както предсказуеми изводи, така и все по-често генеративно LLM обслужване. KServe доставя предварително изградени „средове за изпълнение“ за общи рамки (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) и поддържа персонализирани контейнери. Изграден върху Knative Serving и мрежов слой (Istio или подобен), той осигурява управлявано от заявка автоматично мащабиране, включително истинско мащабиране до нула, така че неактивните модели не консумират изчисления. Той също така стандартизира API за прогнозиране около Open Inference Protocol, така че клиентите да говорят с всеки модел по един и същи начин, независимо от рамката.
Техническа информация
Автоматичното мащабиране на KServe се основава на Knative, което мащабира броя на репликите въз основа на паралелност или заявки за секунда и може да намали до нула реплики, когато трафикът спре, след което стартира студено при поискване. InferenceService абстрахира пълен конвейер за изводи в компоненти за прогнозиране, трансформатор (предварителна/следваща обработка) и компоненти за обяснение. Моделите се зареждат от обектно хранилище чрез „инициализатори за съхранение“, които изтеглят артефакти в групата при стартиране, отделяйки съхранението на модела от изображението на обслужващия контейнер.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на KServe и обслужването на модели в Kubernetes
KServe бързо се развива към генеративен AI, добавяйки проследяване, фокусирано върху LLM, с функции като маршрутизиране, съобразено с KV-кеша, кеширане на модели и дезагрегирано обслужване на предварително попълване/декодиране за големи езикови модели. Очаквайте по-дълбока интеграция с машини за изводи като vLLM, по-добро обслужване с множество възли за модели, твърде големи за един GPU, и маршрутизиране на ниво шлюз за балансиране на натоварването на базата на токени. Като проект, инкубиращ CNCF, той се превръща в де факто отворен стандарт за поставяне на модели зад Kubernetes, стеснявайки разликата между изследователските артефакти и устойчивите производствени крайни точки.
Внедряване в реалния свят
Банка внедрява модел за кредитно оценяване, като пише 10-редов InferenceService YAML, сочещ към модела в S3, като KServe обработва автоматично мащабиране и вход.
Екип за електронна търговия използва внедряване на KServe canary, за да изпрати 10 процента от трафика към нов модел за препоръки, след което нараства до 100 процента, след като показателите изглеждат здрави.
Изследователска лаборатория обслужва десетки рядко използвани модели с мащаб до нула, така че всеки модел се завърта само когато пристигне заявка и не консумира GPU, докато е неактивен.
Екип на MLOps използва трансформаторен компонент на KServe, за да изпълни преоразмеряване и нормализиране на изображението, преди предикторът да изпълни визуален модел, обслужван от Triton.
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Спекулативни редакции за кодови модели
Frequently asked questions
What is KServe and Model Serving on Kubernetes?
KServe е стандартизирана, базирана на Kubernetes платформа за обслужване на модели за машинно обучение в мащаб. Той дава на екипите един-единствен декларативен начин за внедряване на модели с автоматично мащабиране, канарични разгръщания и мащабиране до нула, като абстрахира повечето от водопровода на Kubernetes.
Какво беше предишното име на KServe, преди да стане самостоятелен проект?
KServe възниква като KFServing в рамките на проекта Kubeflow, преди да стане независима платформа.
Кой е основният персонализиран ресурс на Kubernetes, който дефинирате за внедряване на модел с KServe?
Вие декларирате персонализиран ресурс на InferenceService, обикновено в YAML, за внедряване и конфигуриране на сервиран модел.
Коя възможност позволява на неактивните KServe модели да консумират нула изчисления, докато пристигне заявка?
Изграден върху Knative, KServe поддържа мащабиране до нула, премахване на реплики до нула, когато няма трафик и студено стартиране при поискване.
Кой основен проект осигурява управлявано от заявка автоматично мащабиране на KServe?
KServe се основава на Knative Serving, който мащабира реплики въз основа на едновременност или скорост на заявка и позволява мащабиране до нула.
Как KServe обикновено получава артефактите на модела в обслужваща група при стартиране?
Инициализаторите на хранилище изтеглят артефакти на модели от хранилище на обекти (като S3 или GCS) в групата, отделяйки моделите от изображението.