PRZEWODNIK techniczny

BentoML i opakowanie modelowe

BentoML to platforma Pythona o otwartym kodzie źródłowym, która łączy wyszkolone modele uczenia maszynowego w standardowe, możliwe do wdrożenia jednostki zwane „Bentos”.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It bridges the gap between a model sitting in a notebook and a production service that can actually serve predictions over an API.

Głębokie nurkowanie

Kiedy analityk danych zakończy szkolenie modelu, wprowadzenie go do środowiska produkcyjnego zwykle oznacza ręczne napisanie kodu obsługującego, przypięcie zależności, zbudowanie obrazu Dockera i okablowanie interfejsu API. BentoML automatyzuje to. Zapisujesz model w lokalnym magazynie modeli, a następnie definiujesz klasę usługi z punktem końcowym interfejsu API przystosowanym do obsługi wnioskowania. Polecenie „bentoml build” pakuje model, kod Pythona, wersje zależności i konfigurację środowiska wykonawczego do samodzielnego, wersjonowanego Bento. Stamtąd „bentoml Containerize” tworzy obraz Dockera OCI. BentoML obsługuje prawie każdą platformę (PyTorch, TensorFlow, scikit-learn, XGBoost, Hugging Face Transformers, ONNX) i dodaje adaptacyjne mikro-wsadowe, które automatycznie grupuje przychodzące żądania, aby zmaksymalizować przepustowość procesora graficznego bez zmiany kodu.

Wgląd techniczny

BentoML oddziela „Runners” (wykonanie modelu wymagającego dużej mocy obliczeniowej) od logiki serwera API. Biegacze mogą niezależnie skalować i działać we własnych procesach roboczych, podczas gdy lekki serwer HTTP/gRPC obsługuje routing żądań i operacje we/wy. Jego adaptacyjne przetwarzanie wsadowe dynamicznie dostosowuje wielkość partii i okno opóźnienia w czasie wykonywania, dzięki czemu pochłania impulsy ruchu i utrzymuje zajętość drogich akceleratorów. Standaryzowany format Bento zawiera manifest, pliki modelu i odtwarzalne środowisko, dzięki czemu kompilacje są deterministyczne na różnych maszynach.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość BentoML i opakowań modelowych

BentoML mocno oparł się na modelu dużego języka i generatywnej obsłudze sztucznej inteligencji, a OpenLLM i BentoCloud oferują odpowiedzi na tokeny strumieniowe, automatyczne skalowanie i planowanie uwzględniające GPU. Oczekuj ściślejszej integracji z optymalizatorami wnioskowania, takimi jak vLLM i TensorRT-LLM, lepszej obsługi wielomodelowych złożonych systemów AI i płynniejszych ścieżek od wdrożenia pakietu Bento do bezserwerowego wdrożenia procesora graficznego. W miarę jak zespoły przechodzą od pojedynczych modeli do potoków agentowych, BentoML pozycjonuje się jako warstwa pakowania i obsługi, która łączy te komponenty ze sobą.

Implementacja w świecie rzeczywistym

Zespół ds. wykrywania oszustw zapisuje model XGBoost w sklepie BentoML i tworzy Bento, które udostępnia punkt końcowy /predict REST, aby usługa płatności mogła wywołać go w czasie rzeczywistym.

Zespół zajmujący się platformą ML używa „bentoml Containerize”, aby przekształcić model nastrojów Hugging Face w obraz Dockera, który wdraża się w ich wewnętrznym klastrze Kubernetes.

Startup udostępnia dopracowany model Lamy z OpenLLM (zbudowany na BentoML), przesyłając strumieniowo tokeny do interfejsu czatu z adaptacyjnym przetwarzaniem wsadowym, utrzymującym nasycenie procesora graficznego.

Firma zajmująca się wizją komputerową pakuje klasyfikator obrazu PyTorch wraz z potokiem przetwarzania wstępnego do jednego Bento, dzięki czemu dokładne transformacje użyte w szkoleniu są dostarczane z modelem.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BentoML and Model Packaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Spekulatywne edycje modeli kodu

Często zadawane pytania

What is BentoML and Model Packaging?

BentoML to platforma Pythona o otwartym kodzie źródłowym, która łączy wyszkolone modele uczenia maszynowego w standardowe, możliwe do wdrożenia jednostki zwane „Bentos”. Wypełnia lukę pomiędzy modelem znajdującym się w notatniku a usługą produkcyjną, która może faktycznie udostępniać prognozy za pośrednictwem interfejsu API.

Jaka jest standaryzowana, możliwa do wdrożenia jednostka produkowana przez BentoML?

BentoML pakuje model, jego kod, zależności i konfigurację środowiska wykonawczego w wersjonowaną, samodzielną jednostkę zwaną Bento.

Co przede wszystkim poprawia adaptacyjne mikrodozowanie BentoML?

Adaptacyjne przetwarzanie wsadowe grupuje przychodzące żądania w czasie wykonywania, aby zapewnić zajęcie procesorów graficznych i zmaksymalizować przepustowość bez zmian w kodzie.

Co w architekturze BentoML obsługuje wykonywanie modelu wymagającego dużej mocy obliczeniowej niezależnie od serwera API?

Biegacze hermetyzują wnioskowanie o modelu i mogą skalować je we własnych procesach roboczych, oddzielonych od lekkiego serwera API.

Które polecenie zamienia wbudowane Bento w obraz Dockera OCI?

„bentoml Containerize” tworzy standardowy obraz OCI/Docker z Bento do wdrożenia.

Który z nich jest kluczowym powodem, dla którego BentoML osadza wersje zależności w Bento?

Przypinanie i osadzanie środowiska sprawia, że ​​pakietowa usługa jest odtwarzalna i spójna niezależnie od miejsca jej uruchomienia.