PANDUAN Teknis

KServe dan Penyajian Model di Kubernetes

KServe adalah platform asli Kubernetes yang terstandarisasi untuk menyajikan model pembelajaran mesin dalam skala besar.

2 min readTerakhir diperbarui

Ikhtisar

It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.

Menyelam Lebih Dalam

Sebelumnya dikenal sebagai KFServing dan lahir dari proyek Kubeflow, KServe mendefinisikan sumber daya khusus InferenceService. Anda menulis file YAML pendek yang menunjuk ke model yang disimpan di penyimpanan objek (S3, GCS, Azure Blob), dan KServe akan menangani sisanya. Ini mendukung inferensi prediktif dan, semakin banyak, penyajian LLM generatif. KServe mengirimkan 'runtime penyajian' yang telah dibuat sebelumnya untuk kerangka kerja umum (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) dan mendukung container khusus. Dibangun di atas Knative Serving dan lapisan jaringan (Istio atau serupa), ini menyediakan penskalaan otomatis berdasarkan permintaan termasuk skala-ke-nol yang sebenarnya, sehingga model idle tidak menggunakan komputasi. Ini juga menstandarkan API prediksi seputar Open Inference Protocol, sehingga klien berkomunikasi dengan setiap model dengan cara yang sama, apa pun kerangka kerjanya.

Wawasan Teknis

Penskalaan otomatis KServe bersandar pada Knative, yang menskalakan jumlah replika berdasarkan konkurensi atau permintaan per detik dan dapat turun hingga nol replika saat lalu lintas berhenti, lalu memulai secara dingin sesuai permintaan. InferenceService mengabstraksi alur inferensi penuh ke dalam komponen prediktor, transformator (pra/pasca-pemrosesan), dan penjelasan. Model dimuat dari penyimpanan objek melalui 'inisialisasi penyimpanan' yang menarik artefak ke dalam pod saat startup, memisahkan penyimpanan model dari gambar kontainer yang melayani.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan KServe dan Model Serving di Kubernetes

KServe berkembang pesat menuju AI generatif, menambahkan jalur yang berfokus pada LLM dengan fitur seperti perutean KV-cache-aware, cache model, dan penyajian pra-pengisian/dekode terpilah untuk model bahasa besar. Harapkan integrasi yang lebih mendalam dengan mesin inferensi seperti vLLM, penyajian multi-node yang lebih baik untuk model yang terlalu besar untuk satu GPU, dan perutean tingkat gateway untuk penyeimbangan beban berbasis token. Sebagai proyek inkubasi CNCF, proyek ini secara de facto menjadi standar terbuka untuk menempatkan model di belakang Kubernetes, mempersempit kesenjangan antara artefak penelitian dan titik akhir produksi yang tangguh.

Implementasi Dunia Nyata

Sebuah bank menerapkan model penilaian kredit dengan menulis YAML InferenceService 10 baris yang menunjuk pada model di S3, dengan KServe menangani penskalaan otomatis dan ingress.

Tim e-niaga menggunakan peluncuran canary KServe untuk mengirimkan 10 persen lalu lintas ke model rekomendasi baru, lalu meningkat hingga 100 persen setelah metrik terlihat sehat.

Sebuah laboratorium penelitian menyajikan lusinan model yang jarang digunakan dengan skala hingga nol, sehingga setiap model hanya berputar saat permintaan diterima dan tidak menggunakan GPU saat tidak digunakan.

Tim MLOps menggunakan komponen transformator KServe untuk menjalankan pengubahan ukuran dan normalisasi gambar sebelum prediktor menjalankan model visi yang disajikan Triton.

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pengeditan Spekulatif untuk Model Kode

Pertanyaan yang sering diajukan

What is KServe and Model Serving on Kubernetes?

KServe adalah platform asli Kubernetes yang terstandarisasi untuk menyajikan model pembelajaran mesin dalam skala besar. Hal ini memberi tim satu cara deklaratif untuk menerapkan model dengan penskalaan otomatis, peluncuran canary, dan skala ke nol, sehingga mengabstraksi sebagian besar pipa Kubernetes.

Apa nama KServe sebelumnya sebelum menjadi proyek mandiri?

KServe berasal dari KFServing dalam proyek Kubeflow sebelum menjadi platform independen.

Apa sumber daya khusus Kubernetes utama yang Anda tetapkan untuk menerapkan model dengan KServe?

Anda mendeklarasikan sumber daya kustom InferenceService, biasanya di YAML, untuk menyebarkan dan mengonfigurasi model yang disajikan.

Kemampuan manakah yang memungkinkan model KServe yang menganggur tidak menggunakan komputasi hingga permintaan tiba?

Dibangun di Knative, KServe mendukung skala ke nol, menurunkan replika ke nol saat tidak ada lalu lintas, dan memulai secara cold-start sesuai permintaan.

Proyek dasar manakah yang menyediakan penskalaan otomatis berbasis permintaan KServe?

KServe dibangun di atas Knative Serving, yang menskalakan replika berdasarkan konkurensi atau tingkat permintaan dan memungkinkan penskalaan ke nol.

Bagaimana KServe biasanya memasukkan artefak model ke dalam pod penyajian saat startup?

Penginisialisasi penyimpanan mengunduh artefak model dari penyimpanan objek (seperti S3 atau GCS) ke dalam pod, memisahkan model dari gambar.