Τεχνικός ΟΔΗΓΟΣ

BentoML και Συσκευασία Μοντέλων

Το BentoML είναι ένα πλαίσιο Python ανοιχτού κώδικα που συσκευάζει εκπαιδευμένα μοντέλα μηχανικής εκμάθησης σε τυποποιημένες, αναπτύξιμες μονάδες που ονομάζονται «Bentos».

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It bridges the gap between a model sitting in a notebook and a production service that can actually serve predictions over an API.

Βαθιά κατάδυση

Όταν ένας επιστήμονας δεδομένων ολοκληρώσει την εκπαίδευση ενός μοντέλου, η εισαγωγή του στην παραγωγή συνήθως σημαίνει μη αυτόματη εγγραφή κώδικα εξυπηρέτησης, καρφίτσωμα εξαρτήσεων, δημιουργία εικόνας Docker και καλωδίωση ενός API. Η BentoML αυτοματοποιεί αυτό. Αποθηκεύετε ένα μοντέλο στον τοπικό του χώρο αποθήκευσης μοντέλων και, στη συνέχεια, ορίζετε μια κλάση Service με ένα τελικό σημείο API διακοσμημένο για τη διαχείριση συμπερασμάτων. Η εντολή 'bentoml build' συσκευάζει το μοντέλο, τον κώδικα Python, τις εκδόσεις εξάρτησης και τη διαμόρφωση χρόνου εκτέλεσης σε ένα αυτόνομο Bento με έκδοση. Από εκεί το 'bentoml containerize' παράγει μια εικόνα OCI Docker. Το BentoML υποστηρίζει σχεδόν κάθε πλαίσιο (PyTorch, TensorFlow, scikit-learn, XGBoost, Hugging Face Transformers, ONNX) και προσθέτει προσαρμοστική micro-batching, η οποία ομαδοποιεί αυτόματα τα εισερχόμενα αιτήματα για να μεγιστοποιήσει την απόδοση της GPU χωρίς να αλλάξει τον κώδικά σας.

Τεχνική διορατικότητα

Το BentoML διαχωρίζει το "Runners" (την εκτέλεση μοντέλου με βαρύ υπολογισμό) από τη λογική του διακομιστή API. Οι δρομείς μπορούν να κλιμακωθούν ανεξάρτητα και να εκτελούν τις δικές τους διεργασίες εργασίας, ενώ ο ελαφρύς διακομιστής HTTP/gRPC χειρίζεται δρομολόγηση αιτημάτων και I/O. Η προσαρμοστική παρτίδα του συντονίζει δυναμικά το μέγεθος παρτίδας και ένα παράθυρο λανθάνοντος χρόνου κατά τη διάρκεια της εκτέλεσης, ώστε να απορροφά τις εκρήξεις κυκλοφορίας και να κρατά απασχολημένους τους ακριβούς επιταχυντές. Η τυποποιημένη μορφή Bento ενσωματώνει ένα μανιφέστο, αρχεία μοντέλων και ένα αναπαραγώγιμο περιβάλλον, καθιστώντας τις δομές ντετερμινιστικές σε όλες τις μηχανές.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

Το μέλλον της BentoML και της συσκευασίας μοντέλων

Η BentoML έχει κλίνει σκληρά στο μοντέλο μεγάλων γλωσσών και στην παραγωγική υπηρεσία AI, με το OpenLLM και το BentoCloud να προσφέρουν απαντήσεις διακριτικών ροής, αυτόματη κλιμάκωση και προγραμματισμό με επίγνωση της GPU. Αναμένετε στενότερη ενσωμάτωση με βελτιστοποιητές συμπερασμάτων, όπως το vLLM και το TensorRT-LLM, καλύτερη υποστήριξη για συστήματα σύνθετης τεχνητής νοημοσύνης πολλαπλών μοντέλων και πιο ομαλές διαδρομές από ένα πακέτο Bento σε ανάπτυξη GPU χωρίς διακομιστή. Καθώς οι ομάδες μετακινούνται από μεμονωμένα μοντέλα σε αγωγούς αντιπροσώπων, η BentoML τοποθετείται ως το στρώμα συσκευασίας και εξυπηρέτησης που συνδέει αυτά τα εξαρτήματα μεταξύ τους.

Υλοποίηση σε πραγματικό κόσμο

Μια ομάδα ανίχνευσης απάτης αποθηκεύει ένα μοντέλο XGBoost στο κατάστημα BentoML και δημιουργεί ένα Bento που εκθέτει ένα τελικό σημείο /πρόβλεψη REST για να καλεί η υπηρεσία πληρωμών σε πραγματικό χρόνο.

Μια ομάδα πλατφόρμας ML χρησιμοποιεί το 'bentoml containerize' για να μετατρέψει ένα μοντέλο συναισθήματος Hugging Face σε εικόνα Docker που αναπτύσσεται στο εσωτερικό σύμπλεγμα Kubernetes.

Μια εκκίνηση εξυπηρετεί ένα βελτιστοποιημένο μοντέλο Llama με OpenLLM (χτισμένο σε BentoML), ροή διακριτικών σε μια διεπαφή συνομιλίας με προσαρμοστική παρτίδα διατηρώντας την GPU κορεσμένη.

Μια εταιρεία υπολογιστικής όρασης συσκευάζει έναν ταξινομητή εικόνας PyTorch με τη γραμμή προεπεξεργασίας του σε ένα Bento, έτσι ώστε οι ακριβείς μετασχηματισμοί που χρησιμοποιούνται στην εκπαίδευση να συνοδεύονται από το μοντέλο.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BentoML and Model Packaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Εικαστικές Επεξεργασίες για Μοντέλα Κώδικα

Συχνές ερωτήσεις

What is BentoML and Model Packaging?

Το BentoML είναι ένα πλαίσιο Python ανοιχτού κώδικα που συσκευάζει εκπαιδευμένα μοντέλα μηχανικής εκμάθησης σε τυποποιημένες, αναπτύξιμες μονάδες που ονομάζονται «Bentos». Γεφυρώνει το χάσμα μεταξύ ενός μοντέλου που βρίσκεται σε ένα σημειωματάριο και μιας υπηρεσίας παραγωγής που μπορεί πραγματικά να εξυπηρετήσει προβλέψεις μέσω ενός API.

Ποια είναι η τυποποιημένη, αναπτυσσόμενη μονάδα που παράγει η BentoML;

Η BentoML συσκευάζει ένα μοντέλο, τον κώδικα, τις εξαρτήσεις και τις ρυθμίσεις χρόνου εκτέλεσης σε μια έκδοση, αυτόνομη μονάδα που ονομάζεται Bento.

Τι βελτιώνει κυρίως η προσαρμοστική μικρο-παρτίδα της BentoML;

Η προσαρμοστική παρτίδα ομαδοποιεί τα εισερχόμενα αιτήματα κατά το χρόνο εκτέλεσης για να κρατήσει τις GPU απασχολημένες και να μεγιστοποιήσει την απόδοση χωρίς αλλαγές κώδικα.

Στην αρχιτεκτονική του BentoML, τι χειρίζεται την εκτέλεση του μοντέλου με βαρύ υπολογισμό ξεχωριστά από τον διακομιστή API;

Οι Runners ενσωματώνουν τα συμπεράσματα του μοντέλου και μπορούν να κλιμακωθούν στις δικές τους διαδικασίες εργασίας, αποσυνδεδεμένες από τον ελαφρύ διακομιστή API.

Ποια εντολή μετατρέπει ένα ενσωματωμένο Bento σε εικόνα OCI Docker;

Το 'bentoml containerize' παράγει μια τυπική εικόνα OCI/Docker από ένα Bento για ανάπτυξη.

Ποιο από αυτά είναι ένας βασικός λόγος που η BentoML ενσωματώνει εκδόσεις εξαρτήσεων σε ένα Bento;

Το καρφίτσωμα και η ενσωμάτωση του περιβάλλοντος καθιστά τη συσκευασμένη υπηρεσία αναπαραγώγιμη και συνεπή όπου κι αν εκτελείται.