PANDUAN Teknikal

KServe dan Model Serving pada Kubernetes

KServe ialah platform asli Kubernetes yang diseragamkan untuk menyediakan model pembelajaran mesin pada skala.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.

Menyelam dalam

Sebelum ini dikenali sebagai KFServing dan dilahirkan daripada projek Kubeflow, KServe mentakrifkan sumber tersuai InferenceService. Anda menulis fail YAML pendek menunjuk pada model yang disimpan dalam storan objek (S3, GCS, Azure Blob) dan KServe mengendalikan yang lain. Ia menyokong kedua-dua inferens ramalan dan, semakin, penyajian LLM generatif. KServe menghantar 'masa tayangan' pra-bina untuk rangka kerja biasa (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) dan menyokong bekas tersuai. Dibina di atas Knative Serving dan lapisan rangkaian (Istio atau serupa), ia menyediakan penskalaan automatik terdorong permintaan termasuk skala-ke-sifar sebenar, jadi model terbiar tidak menggunakan pengiraan. Ia juga menyeragamkan API ramalan sekitar Protokol Inferens Terbuka, jadi pelanggan bercakap dengan setiap model dengan cara yang sama tanpa mengira rangka kerja.

Wawasan Teknikal

Penskalaan automatik KServe bergantung pada Knative, yang menskalakan kiraan replika berdasarkan konkurensi atau permintaan setiap saat dan boleh turun kepada sifar replika apabila trafik berhenti, kemudian mula sejuk atas permintaan. InferenceService merumuskan saluran paip inferens penuh ke dalam komponen peramal, pengubah (pra/pasca pemprosesan), dan penjelas. Model dimuatkan daripada storan objek melalui 'pemula storan' yang menarik artifak ke dalam pod semasa permulaan, menyahgandingkan storan model daripada imej bekas penyajian.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan KServe dan Model Serving di Kubernetes

KServe berkembang pesat ke arah AI generatif, menambahkan runut berfokuskan LLM dengan ciri seperti penghalaan KV-cache-aware, caching model dan siaran praisi/nyahkod yang diagregatkan untuk model bahasa yang besar. Jangkakan penyepaduan yang lebih mendalam dengan enjin inferens seperti vLLM, sajian berbilang nod yang lebih baik untuk model yang terlalu besar untuk satu GPU, dan penghalaan peringkat get laluan untuk pengimbangan beban berasaskan token. Sebagai projek inkubasi CNCF, ia menjadi standard terbuka de facto untuk meletakkan model di belakang Kubernetes, mengecilkan jurang antara artifak penyelidikan dan titik akhir pengeluaran yang berdaya tahan.

Pelaksanaan Dunia Sebenar

Sebuah bank menggunakan model pemarkahan kredit dengan menulis YAML InferenceService 10 baris menunjuk pada model dalam S3, dengan KServe mengendalikan penskalaan automatik dan kemasukan.

Pasukan e-dagang menggunakan pelancaran kenari KServe untuk menghantar 10 peratus trafik kepada model pengesyoran baharu, kemudian meningkat kepada 100 peratus apabila metrik kelihatan sihat.

Makmal penyelidikan menyediakan berpuluh-puluh model yang jarang digunakan dengan skala-ke-sifar, jadi setiap model berputar hanya apabila permintaan tiba dan tidak menggunakan GPU semasa melahu.

Pasukan MLOps menggunakan komponen pengubah KServe untuk menjalankan saiz semula dan penormalan imej sebelum peramal menjalankan model penglihatan yang disediakan Triton.

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Pengeditan Spekulatif untuk Model Kod

Soalan lazim

What is KServe and Model Serving on Kubernetes?

KServe ialah platform asli Kubernetes yang diseragamkan untuk menyediakan model pembelajaran mesin pada skala. Ia memberi pasukan satu cara pengisytiharan untuk menggunakan model dengan penskalaan automatik, pelancaran kenari dan skala kepada sifar, menghilangkan sebahagian besar paip Kubernetes.

Apakah nama KServe sebelum ini sebelum ia menjadi projek kendiri?

KServe berasal sebagai KFServing dalam projek Kubeflow sebelum menjadi platform bebas.

Apakah sumber tersuai Kubernetes utama yang anda tentukan untuk menggunakan model dengan KServe?

Anda mengisytiharkan sumber tersuai InferenceService, biasanya dalam YAML, untuk mengatur dan mengkonfigurasi model yang disediakan.

Keupayaan yang manakah membolehkan model KServe terbiar menggunakan pengiraan sifar sehingga permintaan tiba?

Dibina pada Knative, KServe menyokong skala-ke-sifar, menurunkan replika kepada sifar apabila tiada trafik dan bermula sejuk atas permintaan.

Projek asas manakah yang menyediakan penskalaan automatik terdorong permintaan KServe?

KServe dibina pada Knative Serving, yang menskala replika berdasarkan konkurensi atau kadar permintaan dan mendayakan skala-ke-sifar.

Bagaimanakah KServe biasanya memasukkan artifak model ke dalam pod hidangan pada permulaan?

Pemula storan memuat turun artifak model daripada storan objek (seperti S3 atau GCS) ke dalam pod, menyahgandingkan model daripada imej.