Kubernetes'te KServe ve Model Sunumu
KServe, makine öğrenimi modellerini geniş ölçekte sunmaya yönelik standartlaştırılmış, Kubernetes'te yerel bir platformdur.
Genel Bakış
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
Derin Dalış
Eskiden KFServing olarak bilinen ve Kubeflow projesinden doğan KServe, bir InferenceService özel kaynağı tanımlar. Nesne depolamasında (S3, GCS, Azure Blob) depolanan bir modele işaret eden kısa bir YAML dosyası yazarsınız ve gerisini KServe halleder. Hem tahmine dayalı çıkarımı hem de giderek artan şekilde üretken LLM hizmetini destekler. KServe, ortak çerçeveler (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) için önceden oluşturulmuş 'sunum çalışma zamanları' sunar ve özel konteynerleri destekler. Knative Serving ve bir ağ katmanı (Istio veya benzeri) üzerine inşa edilmiş olup, gerçek sıfıra ölçeklendirme de dahil olmak üzere istek odaklı otomatik ölçeklendirme sağlar, böylece boşta kalan modeller bilgi işlem tüketmez. Ayrıca, tahmin API'sini Açık Çıkarım Protokolü çevresinde standartlaştırır, böylece istemciler çerçeveden bağımsız olarak her modelle aynı şekilde konuşur.
Teknik Bilgi
KServe'in otomatik ölçeklendirmesi, eş zamanlılığa veya saniye başına isteklere göre kopya sayısını ölçeklendiren ve trafik durduğunda kopyaları sıfıra düşürebilen, ardından talep üzerine soğuk başlatabilen Knative'e dayanır. InferenceService, tahmin edici, dönüştürücü (işleme öncesi/sonrası) ve açıklayıcı bileşenlere tam bir çıkarım hattını soyutlar. Modeller, başlangıçta yapıları bölmeye çeken 'depolama başlatıcıları' aracılığıyla nesne deposundan yüklenir ve model depolamayı servis konteyneri görüntüsünden ayırır.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
Kubernetes'te KServe ve Model Sunumunun Geleceği
KServe hızla üretken yapay zekaya doğru evriliyor ve büyük dil modelleri için KV önbellek farkındalığına sahip yönlendirme, model önbelleğe alma ve ayrıştırılmış önceden doldurma/kod çözme hizmeti gibi özelliklere sahip LLM odaklı bir parça ekliyor. vLLM gibi çıkarım motorlarıyla daha derin entegrasyon, tek GPU için fazla büyük modeller için daha iyi çoklu düğüm hizmeti ve belirteç tabanlı yük dengeleme için ağ geçidi düzeyinde yönlendirme bekleyebilirsiniz. CNCF kuluçka projesi olarak, modelleri Kubernetes'in arkasına koymak için fiili açık standart haline geliyor ve araştırma eserleri ile dayanıklı üretim uç noktaları arasındaki boşluğu daraltıyor.
Gerçek Dünya Uygulaması
Bir banka, S3'teki modele işaret eden 10 satırlık bir InferenceService YAML yazarak, KServe otomatik ölçeklendirmeyi ve girişi yöneterek bir kredi puanlama modeli dağıtır.
Bir e-ticaret ekibi, trafiğin yüzde 10'unu yeni bir öneri modeline göndermek için KServe kanarya dağıtımlarını kullanıyor, ardından ölçümler sağlıklı göründüğünde bu oran yüzde 100'e çıkıyor.
Bir araştırma laboratuvarı sıfıra kadar ölçeklendirmeyle nadiren kullanılan düzinelerce modele hizmet verir, böylece her model yalnızca bir istek geldiğinde çalışır ve boştayken GPU tüketmez.
Bir MLOps ekibi, tahminci Triton tarafından sunulan bir görüntü modelini çalıştırmadan önce görüntünün yeniden boyutlandırılmasını ve normalleştirilmesini çalıştırmak için bir KServe transformatör bileşenini kullanıyor.
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Kod Modelleri için Spekülatif Düzenlemeler
Sık sorulan sorular
What is KServe and Model Serving on Kubernetes?
KServe, makine öğrenimi modellerini geniş ölçekte sunmaya yönelik standartlaştırılmış, Kubernetes'te yerel bir platformdur. Ekiplere otomatik ölçeklendirme, kanarya dağıtımları ve sıfıra ölçeklendirme özellikleriyle modelleri dağıtmak için tek ve bildirime dayalı bir yol sunarak Kubernetes tesisatının çoğunu ortadan kaldırır.
KServe'nin bağımsız bir proje haline gelmeden önceki adı neydi?
KServe, bağımsız bir platform olmadan önce Kubeflow projesi kapsamında KFServing olarak ortaya çıktı.
KServe ile bir modeli dağıtmak için tanımladığınız birincil Kubernetes özel kaynağı nedir?
Sunulan bir modeli dağıtmak ve yapılandırmak için genellikle YAML'de bir InferenceService özel kaynağı bildirirsiniz.
Hangi yetenek, boşta kalan KServe modellerinin bir istek gelene kadar sıfır bilgi işlem tüketmesine olanak tanır?
Knative üzerine kurulu KServe, sıfıra ölçeklendirmeyi destekler; trafik olmadığında kopyaları sıfıra düşürür ve talep üzerine soğuk başlatmayı destekler.
Hangi temel proje KServe'nin istek odaklı otomatik ölçeklendirmesini sağlıyor?
KServe, kopyaları eşzamanlılık veya istek hızına göre ölçeklendiren ve sıfıra kadar ölçeklendirmeyi mümkün kılan Knative Serving'i temel alır.
KServe başlangıçta model yapıtlarını genellikle bir sunum bölmesine nasıl alır?
Depolama başlatıcıları, model yapılarını nesne deposundan (S3 veya GCS gibi) bölmeye indirerek modelleri görüntüden ayırır.