Техническое РУКОВОДСТВО

KServe и обслуживание моделей в Kubernetes

KServe — это стандартизированная платформа Kubernetes для обслуживания моделей машинного обучения в большом масштабе.

2 минуты чтенияПоследнее обновление

Обзор

Это даёт командам единый, декларативный способ развертывания моделей с автомасштабированием, внедрением Canary и масштабированием до нуля, при этом удаляя большую часть сантехники Kubernetes.

Глубокое погружение

KServe, ранее известный как KFServing и созданный на базе проекта Kubeflow, определяет пользовательский ресурс InferenceService. Вы пишете короткий файл YAML, указывающий на модель, хранящуюся в объектном хранилище (S3, GCS, Azure Blob), а KServe обрабатывает все остальное. Он поддерживает как прогнозирующий вывод, так и, во все большей степени, генеративный сервис LLM. KServe поставляет готовые «среды выполнения» для распространенных платформ (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) и поддерживает пользовательские контейнеры. Построенный на основе Knative Serving и сетевого уровня (Istio или аналогичного), он обеспечивает автоматическое масштабирование на основе запросов, включая истинное масштабирование до нуля, поэтому модели бездействия не потребляют вычислительные ресурсы. Он также стандартизирует API прогнозирования на основе открытого протокола вывода, поэтому клиенты одинаково взаимодействуют с каждой моделью независимо от платформы.

Техническая информация

Автомасштабирование KServe опирается на Knative, который масштабирует количество реплик на основе параллелизма или количества запросов в секунду и может сбрасывать количество реплик до нуля при прекращении трафика, а затем выполнять холодный запуск по требованию. InferenceService абстрагирует полный конвейер вывода на компоненты предиктора, преобразователя (предварительная/постобработка) и объяснителя. Модели загружаются из хранилища объектов через «инициализаторы хранилища», которые при запуске помещают артефакты в модуль, отделяя хранилище модели от образа обслуживающего контейнера.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее KServe и обслуживания моделей в Kubernetes

KServe быстро развивается в сторону генеративного искусственного интеллекта, добавляя трек, ориентированный на LLM, с такими функциями, как маршрутизация с учетом KV-кэша, кэширование моделей и дезагрегированное обслуживание предварительного заполнения/декодирования для больших языковых моделей. Ожидайте более глубокой интеграции с механизмами вывода, такими как vLLM, улучшенным обслуживанием нескольких узлов для моделей, слишком больших для одного графического процессора, а также маршрутизацией на уровне шлюза для балансировки нагрузки на основе токенов. Будучи инкубатором CNCF, он становится де-факто открытым стандартом для использования моделей в Kubernetes, сокращая разрыв между исследовательскими артефактами и устойчивыми конечными точками производства.

Реальная реализация

Банк развертывает модель кредитного скоринга, написав 10-строчный YAML-код InferenceService, указывающий на модель в S3, при этом KServe обрабатывает автоматическое масштабирование и вход.

Команда электронной коммерции использует канареечные развертывания KServe для отправки 10 процентов трафика на новую модель рекомендаций, а затем увеличивает ее до 100 процентов, как только метрики начинают выглядеть нормально.

Исследовательская лаборатория обслуживает десятки редко используемых моделей с масштабированием до нуля, поэтому каждая модель запускается только при поступлении запроса и не потребляет графический процессор во время простоя.

Команда MLOps использует компонент преобразователя KServe для изменения размера и нормализации изображения до того, как предиктор запустит модель зрения, обслуживаемую Triton.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Спекулятивные изменения моделей кода

Часто задаваемые вопросы

Что такое KServe и Model Serving на Kubernetes?

KServe — это стандартизированная платформа Kubernetes для обслуживания моделей машинного обучения в большом масштабе. Он дает командам единый декларативный способ развертывания моделей с автомасштабированием, канареечным развертыванием и масштабированием до нуля, абстрагируя большую часть инфраструктуры Kubernetes.

Как назывался KServe до того, как он стал самостоятельным проектом?

KServe возникла как KFServing в рамках проекта Kubeflow, а затем стала независимой платформой.

Какой основной пользовательский ресурс Kubernetes вы определяете для развертывания модели с помощью KServe?

Вы объявляете пользовательский ресурс InferenceService, обычно в формате YAML, для развертывания и настройки обслуживаемой модели.

Какая возможность позволяет бездействующим моделям KServe потреблять нулевую вычислительную мощность до тех пор, пока не поступит запрос?

KServe, созданный на основе Knative, поддерживает масштабирование до нуля, сбрасывание реплик до нуля при отсутствии трафика и холодный запуск по требованию.

Какой базовый проект обеспечивает автоматическое масштабирование KServe на основе запросов?

KServe основан на Knative Serving, который масштабирует реплики на основе параллелизма или частоты запросов и обеспечивает масштабирование до нуля.

Как KServe обычно передает артефакты модели в обслуживающий модуль при запуске?

Инициализаторы хранилища загружают артефакты модели из хранилища объектов (например, S3 или GCS) в модуль, отделяя модели от изображения.