KServe και Model Serving στο Kubernetes
Το KServe είναι μια τυποποιημένη, εγγενής πλατφόρμα Kubernetes για την εξυπηρέτηση μοντέλων μηχανικής εκμάθησης σε κλίμακα.
Επισκόπηση
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
Βαθιά κατάδυση
Παλαιότερα γνωστό ως KFServing και γεννημένο από το έργο Kubeflow, το KServe ορίζει έναν προσαρμοσμένο πόρο InferenceService. Γράφετε ένα σύντομο αρχείο YAML που δείχνει σε ένα μοντέλο που είναι αποθηκευμένο στην αποθήκευση αντικειμένων (S3, GCS, Azure Blob) και το KServe χειρίζεται τα υπόλοιπα. Υποστηρίζει τόσο προγνωστικά συμπεράσματα όσο και, ολοένα και περισσότερο, γενετική υπηρεσία LLM. Το KServe αποστέλλει προκατασκευασμένους «χρόνους εκτέλεσης εξυπηρέτησης» για κοινά πλαίσια (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) και υποστηρίζει προσαρμοσμένα κοντέινερ. Χτισμένο πάνω από το Knative Serving και ένα επίπεδο δικτύωσης (Istio ή παρόμοιο), παρέχει αυτόματη κλιμάκωση βάσει αιτημάτων, συμπεριλαμβανομένης της πραγματικής κλίμακας έως το μηδέν, έτσι τα μοντέλα σε αδράνεια δεν καταναλώνουν υπολογισμούς. Τυποποιεί επίσης το API πρόβλεψης γύρω από το Πρωτόκολλο Open Inference, έτσι οι πελάτες μιλούν με κάθε μοντέλο με τον ίδιο τρόπο, ανεξάρτητα από το πλαίσιο.
Τεχνική διορατικότητα
Η αυτόματη κλιμάκωση του KServe βασίζεται στο Knative, το οποίο κλιμακώνει τον αριθμό των αντιγράφων με βάση τη συγχρονικότητα ή τα αιτήματα ανά δευτερόλεπτο και μπορεί να πέσει σε μηδενικά αντίγραφα όταν σταματήσει η κυκλοφορία και στη συνέχεια με ψυχρή εκκίνηση κατά παραγγελία. Η υπηρεσία InferenceService αφαιρεί μια πλήρη διοχέτευση συμπερασμάτων σε στοιχεία πρόβλεψης, μετασχηματιστή (προ/μετά-επεξεργασία) και επεξήγηση. Τα μοντέλα φορτώνονται από την αποθήκευση αντικειμένων μέσω «αρχικοποιητών αποθήκευσης» που τραβούν τεχνουργήματα στο pod κατά την εκκίνηση, αποσυνδέοντας την αποθήκευση μοντέλων από την εικόνα του κοντέινερ σερβιρίσματος.
Στρατηγικός αντίκτυπος
Κόστος και προϋπολογισμός
Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.
Σαφέστερες αποφάσεις
Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.
Ελεγχος ποιότητας
Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.
Το μέλλον του KServe και του Model Serving στο Kubernetes
Το KServe εξελίσσεται ταχέως προς τη δημιουργία τεχνητής νοημοσύνης, προσθέτοντας ένα κομμάτι που εστιάζει στο LLM με δυνατότητες όπως δρομολόγηση με επίγνωση της κρυφής μνήμης KV, προσωρινή αποθήκευση μοντέλων και ομαδοποιημένη υπηρεσία προπλήρωσης/αποκωδικοποίησης για μοντέλα μεγάλων γλωσσών. Αναμένετε βαθύτερη ενοποίηση με μηχανές συμπερασμάτων όπως το vLLM, καλύτερη εξυπηρέτηση πολλών κόμβων για μοντέλα πολύ μεγάλα για μία GPU και δρομολόγηση σε επίπεδο πύλης για εξισορρόπηση φορτίου βάσει διακριτικών. Ως έργο επώασης CNCF, γίνεται το de facto ανοιχτό πρότυπο για την τοποθέτηση μοντέλων πίσω από το Kubernetes, μειώνοντας το χάσμα μεταξύ των τεχνουργημάτων έρευνας και των ελαστικών τελικών σημείων παραγωγής.
Υλοποίηση σε πραγματικό κόσμο
Μια τράπεζα αναπτύσσει ένα μοντέλο πιστοληπτικής αξιολόγησης γράφοντας ένα InferenceService YAML 10 γραμμών που δείχνει το μοντέλο στο S3, με το KServe να χειρίζεται την αυτόματη κλιμάκωση και την είσοδο.
Μια ομάδα ηλεκτρονικού εμπορίου χρησιμοποιεί την κυκλοφορία καναρινιών KServe για να στείλει το 10 τοις εκατό της επισκεψιμότητας σε ένα νέο μοντέλο προτάσεων και, στη συνέχεια, να ανεβεί στο 100 τοις εκατό μόλις οι μετρήσεις φαίνονται υγιείς.
Ένα ερευνητικό εργαστήριο εξυπηρετεί δεκάδες μοντέλα που χρησιμοποιούνται σπάνια με κλίμακα έως μηδέν, επομένως κάθε μοντέλο περιστρέφεται μόνο όταν φθάνει ένα αίτημα και δεν καταναλώνει GPU ενώ είναι αδράνεια.
Μια ομάδα MLOps χρησιμοποιεί ένα στοιχείο μετασχηματιστή KServe για να εκτελέσει την αλλαγή μεγέθους και την κανονικοποίηση της εικόνας πριν ο προγνωστικός να εκτελέσει ένα μοντέλο όρασης που εξυπηρετείται από το Triton.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.
Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.
Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.
Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.
Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.
Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Εικαστικές Επεξεργασίες για Μοντέλα Κώδικα
Συχνές ερωτήσεις
What is KServe and Model Serving on Kubernetes?
Το KServe είναι μια τυποποιημένη, εγγενής πλατφόρμα Kubernetes για την εξυπηρέτηση μοντέλων μηχανικής εκμάθησης σε κλίμακα. Δίνει στις ομάδες έναν ενιαίο, δηλωτικό τρόπο ανάπτυξης μοντέλων με αυτόματη κλιμάκωση, διάθεση καναρινιών και κλίμακα έως μηδέν, αφαιρώντας το μεγαλύτερο μέρος των υδραυλικών εγκαταστάσεων Kubernetes.
Ποιο ήταν το προηγούμενο όνομα του KServe πριν γίνει αυτόνομο έργο;
Το KServe ξεκίνησε ως KFServing στο πλαίσιο του έργου Kubeflow πριν γίνει μια ανεξάρτητη πλατφόρμα.
Ποιος είναι ο κύριος προσαρμοσμένος πόρος Kubernetes που ορίζετε για την ανάπτυξη ενός μοντέλου με το KServe;
Δηλώνετε έναν προσαρμοσμένο πόρο του InferenceService, συνήθως σε YAML, για την ανάπτυξη και τη διαμόρφωση ενός μοντέλου που εξυπηρετείται.
Ποια δυνατότητα επιτρέπει στα μοντέλα KServe σε αδράνεια να καταναλώνουν μηδενικούς υπολογισμούς μέχρι να φτάσει ένα αίτημα;
Χτισμένο στο Knative, το KServe υποστηρίζει κλίμακα έως μηδέν, μηδενίζοντας τα αντίγραφα όταν δεν υπάρχει κίνηση και ψυχρή εκκίνηση κατά παραγγελία.
Ποιο υποκείμενο έργο παρέχει την αυτόματη κλιμάκωση βάσει αιτημάτων του KServe;
Το KServe βασίζεται στο Knative Serving, το οποίο κλιμακώνει τα αντίγραφα με βάση τη συγχρονικότητα ή το ποσοστό αιτημάτων και ενεργοποιεί την κλίμακα έως το μηδέν.
Πώς το KServe μεταφέρει συνήθως τα τεχνουργήματα μοντέλων σε μια ομάδα διαφημίσεων κατά την εκκίνηση;
Οι αρχικοποιητές αποθήκευσης πραγματοποιούν λήψη τεχνουργημάτων μοντέλων από την αποθήκευση αντικειμένων (όπως το S3 ή το GCS) στο pod, αποσυνδέοντας μοντέλα από την εικόνα.