Технічний КЕРІВНИЦТВО

KServe та моделювання на Kubernetes

KServe — це стандартизована платформа Kubernetes для обслуговування моделей машинного навчання в масштабі.

2 хвилини читанняОстаннє оновлення

Огляд

It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.

Глибоке занурення

Раніше відомий як KFServing і народжений з проекту Kubeflow, KServe визначає спеціальний ресурс InferenceService. Ви пишете короткий файл YAML, який вказує на модель, що зберігається в сховищі об’єктів (S3, GCS, Azure Blob), а KServe обробляє решту. Він підтримує як прогнозний висновок, так і, все частіше, генеративне обслуговування LLM. KServe постачає попередньо зібрані «сервісні середовища» для звичайних фреймворків (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) і підтримує спеціальні контейнери. Побудований на основі Knative Serving і мережевого рівня (Istio або подібного), він забезпечує автомасштабування на основі запитів, включаючи справжнє масштабування до нуля, тому неактивні моделі не споживають обчислення. Він також стандартизує API передбачення на основі відкритого протоколу логічного висновку, тому клієнти взаємодіють з кожною моделлю однаково, незалежно від структури.

Технічне розуміння

Автоматичне масштабування KServe спирається на Knative, який масштабує кількість реплік на основі паралельності або кількості запитів за секунду та може зменшити кількість реплік до нуля, коли трафік зупиняється, а потім запустити холодний за запитом. InferenceService абстрагує повний конвеєр виведення на компоненти предиктора, трансформатора (попередня/після обробки) і пояснювача. Моделі завантажуються зі сховища об’єктів за допомогою «ініціалізаторів сховища», які завантажують артефакти в модуль під час запуску, відокремлюючи сховище моделі від зображення контейнера, що обслуговує.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє KServe та обслуговування моделей на Kubernetes

KServe швидко розвивається в напрямку генеративного штучного інтелекту, додаючи доріжку, орієнтовану на LLM, із такими функціями, як маршрутизація з урахуванням KV-кешу, кешування моделі та дезагрегована служба попереднього заповнення/декодування для великих мовних моделей. Очікуйте глибшої інтеграції з механізмами висновку, як-от vLLM, кращого обслуговування кількох вузлів для моделей, завеликих для одного GPU, і маршрутизації на рівні шлюзу для балансування навантаження на основі маркерів. Будучи інкубаційним проектом CNCF, він де-факто стає відкритим стандартом для розміщення моделей на базі Kubernetes, скорочуючи розрив між дослідницькими артефактами та стійкими кінцевими точками виробництва.

Реалізація в реальному світі

Банк розгортає модель оцінки кредитоспроможності шляхом написання 10-рядкового InferenceService YAML, що вказує на модель у S3, а KServe обробляє автомасштабування та вхід.

Команда електронної комерції використовує розгортання KServe canary, щоб направити 10 відсотків трафіку на нову модель рекомендацій, а потім збільшити до 100 відсотків, коли показники виглядають здоровими.

Дослідницька лабораторія обслуговує десятки рідко використовуваних моделей із масштабуванням до нуля, тому кожна модель запускається лише тоді, коли надходить запит, і не споживає GPU під час простою.

Команда MLOps використовує компонент трансформатора KServe для запуску зміни розміру та нормалізації зображення перед тим, як предиктор запустить модель бачення Triton.

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Спекулятивні редагування для моделей коду

Часті запитання

What is KServe and Model Serving on Kubernetes?

KServe — це стандартизована платформа Kubernetes для обслуговування моделей машинного навчання в масштабі. Це дає командам єдиний декларативний спосіб розгортати моделі з автомасштабуванням, розгортанням Canary та масштабуванням до нуля, абстрагуючись від більшості систем Kubernetes.

Яка була попередня назва KServe до того, як він став окремим проектом?

KServe виникла як KFServing у рамках проекту Kubeflow, перш ніж стати незалежною платформою.

Який основний спеціальний ресурс Kubernetes ви визначаєте для розгортання моделі за допомогою KServe?

Ви оголошуєте спеціальний ресурс InferenceService, як правило, у YAML, щоб розгорнути та налаштувати обслуговувану модель.

Яка можливість дозволяє неактивним моделям KServe споживати нуль обчислень, доки не надійде запит?

Створений на Knative, KServe підтримує масштабування до нуля, скидання реплік до нуля, коли трафік відсутній, і холодний запуск за вимогою.

Який основний проект забезпечує автомасштабування на основі запитів KServe?

KServe базується на Knative Serving, який масштабує репліки на основі паралельності або швидкості запитів і забезпечує масштабування до нуля.

Яким чином KServe зазвичай передає артефакти моделі в пакет обслуговування під час запуску?

Ініціалізатори сховища завантажують артефакти моделі зі сховища об’єктів (наприклад, S3 або GCS) у модуль, відокремлюючи моделі від зображення.