KServe és modellszolgáltatás a Kubernetesen
A KServe egy szabványosított, Kubernetes-natív platform a gépi tanulási modellek széles körű kiszolgálására.
Áttekintés
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
Mély merülés
A korábban KFServing néven ismert és a Kubeflow projektből származó KServe egy InferenceService egyéni erőforrást határoz meg. Ír egy rövid YAML-fájlt, amely egy objektumtárolóban tárolt modellre mutat (S3, GCS, Azure Blob), és a KServe kezeli a többit. Támogatja a prediktív következtetést és egyre inkább a generatív LLM kiszolgálást. A KServe előre beépített „kiszolgálási futásidőket” szállít a közös keretrendszerekhez (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face), és támogatja az egyéni konténereket. A Knative Serving és egy hálózati réteg (Istio vagy hasonló) tetejére építve kérésvezérelt automatikus skálázást biztosít, beleértve a valódi nullára skálázást, így a tétlen modellek nem igényelnek számítást. Ezenkívül szabványosítja az előrejelzési API-t az Open Inference Protocol körül, így az ügyfelek minden modellel ugyanúgy beszélnek, függetlenül a keretrendszertől.
Technikai betekintés
A KServe automatikus skálázása a Knative-ra támaszkodik, amely az egyidejűség vagy a másodpercenkénti kérések alapján skálázza a replikák számát, és a forgalom leállásakor nullára csökkenhet, majd igény szerint hidegindítással. Az InferenceService a teljes következtetési folyamatot előrejelző, transzformátor (elő-/utófeldolgozás) és magyarázó komponensekre absztrahálja. A modellek az objektumtárolóból töltődnek be a „tárhelyinicializálókon” keresztül, amelyek indításkor a műtermékeket a podba húzzák, leválasztva a modelltárat a kiszolgáló tárolóképről.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
A KServe és a Kubernetes modellszolgáltatás jövője
A KServe gyorsan fejlődik a generatív mesterséges intelligencia irányába, és hozzáad egy LLM-központú sávot olyan funkciókkal, mint a KV-gyorsítótár-tudatos útválasztás, a modell gyorsítótárazás, valamint a nagy nyelvi modellek bontott előtöltési/dekódolási szolgáltatása. Mélyebb integrációra számíthat az olyan következtetési motorokkal, mint a vLLM, jobb többcsomópontos kiszolgálás az egy GPU-hoz túl nagy modelleknél, és átjárószintű útválasztás a token alapú terheléselosztáshoz. CNCF-inkubáló projektként ez válik de facto nyílt szabványává a modellek Kubernetes mögé helyezésének, csökkentve a szakadékot a kutatási műtermékek és a rugalmas gyártási végpontok között.
Valós megvalósítás
Egy bank egy 10 soros InferenceService YAML-t ír be a hitelminősítési modellbe, amely a modellre mutat S3-ban, és a KServe kezeli az automatikus skálázást és a belépést.
Egy e-kereskedelmi csapat a KServe Canary bevezetését használja, hogy a forgalom 10 százalékát egy új ajánlási modellre irányítsa, majd amint a mutatók egészségesnek tűnnek, 100 százalékra gyorsul.
Egy kutatólaboratórium több tucat ritkán használt modellt szolgál ki nulláig skálázva, így mindegyik modell csak akkor pörög fel, amikor megérkezik a kérés, és nem fogyaszt GPU-t üresjáratban.
Egy MLOps csapat egy KServe transzformátor komponenst használ a kép átméretezésének és normalizálásának futtatására, mielőtt a prediktor egy Triton által kiszolgált látásmodellt futtatna.
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Spekulatív szerkesztések kódmodellekhez
Gyakran ismételt kérdések
What is KServe and Model Serving on Kubernetes?
A KServe egy szabványosított, Kubernetes-natív platform a gépi tanulási modellek széles körű kiszolgálására. Egyetlen, deklaratív módot ad a csapatoknak az automatikus skálázással, a kanári kiterjesztéssel és a nullára skálázással rendelkező modellek üzembe helyezésére, így a Kubernetes vízvezetékek nagy részét elvonatkoztatják.
Mi volt a KServe korábbi neve, mielőtt önálló projektté vált?
A KServe KFServing néven indult a Kubeflow projekten belül, mielőtt független platformmá vált.
Mi az az elsődleges egyéni Kubernetes-erőforrás, amelyet a KServe-vel való modell telepítéséhez határoz meg?
A kiszolgált modell üzembe helyezéséhez és konfigurálásához deklarál egy InferenceService egyéni erőforrást, jellemzően YAML-ben.
Melyik képesség teszi lehetővé, hogy a tétlen KServe modellek nulla számítási felhasználást végezzenek a kérés megérkezéséig?
A Knative-re épített KServe támogatja a nullára méretezést, nullára ejti a replikákat, ha nincs forgalom, és igény szerint hidegindítást.
Melyik mögöttes projekt biztosítja a KServe kérésvezérelt automatikus skálázását?
A KServe a Knative Servingre épül, amely párhuzamosság vagy kérési arány alapján skálázza a replikákat, és lehetővé teszi a nullára skálázást.
Hogyan helyezi el a KServe a modellműtermékeket egy kiszolgáló podba indításkor?
A tárolás inicializálói letöltik a modell melléktermékeit az objektumtárolóból (például S3 vagy GCS) a podba, leválasztva a modelleket a képről.