BentoML и упаковка моделей
BentoML — это платформа Python с открытым исходным кодом, которая объединяет обученные модели машинного обучения в стандартизированные развертываемые блоки, называемые «Bentos».
Обзор
It bridges the gap between a model sitting in a notebook and a production service that can actually serve predictions over an API.
Глубокое погружение
Когда специалист по данным заканчивает обучение модели, запуск ее в производство обычно означает написание обслуживающего кода вручную, закрепление зависимостей, создание образа Docker и подключение API. BentoML автоматизирует это. Вы сохраняете модель в локальном хранилище моделей, а затем определяете класс обслуживания с конечной точкой API, предназначенной для обработки вывода. Команда «bentoml build» упаковывает модель, ваш код Python, версии зависимостей и конфигурацию среды выполнения в автономный Bento с поддержкой версий. Оттуда «bentomlContainerize» создает образ OCI Docker. BentoML поддерживает практически все платформы (PyTorch, TensorFlow, scikit-learn, XGBoost, Hugging Face Transformers, ONNX) и добавляет адаптивную микропакетную обработку, которая автоматически группирует входящие запросы для максимизации пропускной способности графического процессора без изменения кода.
Техническая информация
BentoML отделяет «Бегунов» (выполнение модели с большим объемом вычислений) от логики сервера API. Исполнители могут масштабироваться независимо и запускать свои собственные рабочие процессы, а легкий сервер HTTP/gRPC занимается маршрутизацией запросов и вводом-выводом. Его адаптивная пакетная обработка динамически настраивает размер пакета и окно задержки во время выполнения, поэтому он поглощает всплески трафика и сохраняет занятость дорогих ускорителей. Стандартизированный формат Bento включает манифест, файлы моделей и воспроизводимую среду, что делает сборки детерминированными на разных машинах.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее BentoML и модельной упаковки
BentoML активно использует модель большого языка и генеративное обслуживание искусственного интеллекта, а OpenLLM и BentoCloud предлагают потоковую передачу ответов токенов, автоматическое масштабирование и планирование с учетом графического процессора. Ожидайте более тесной интеграции с оптимизаторами вывода, такими как vLLM и TensorRT-LLM, лучшей поддержкой многомодельных составных систем искусственного интеллекта и более плавным путем от пакетного Bento к развертыванию бессерверного графического процессора. По мере того как команды переходят от одиночных моделей к агентным конвейерам, BentoML позиционирует себя как уровень упаковки и обслуживания, который связывает эти компоненты вместе.
Реальная реализация
Команда по обнаружению мошенничества сохраняет модель XGBoost в хранилище BentoML и создает Bento, который предоставляет конечную точку REST /predict для вызова платежной службы в режиме реального времени.
Команда платформы ML использует «bentomlContainerize», чтобы превратить модель настроений Hugging Face в образ Docker, который развертывается во внутреннем кластере Kubernetes.
Стартап обслуживает точно настроенную модель Llama с OpenLLM (построенной на BentoML), передавая токены в пользовательский интерфейс чата с адаптивной пакетной обработкой, сохраняя нагрузку на графический процессор.
Компания, занимающаяся компьютерным зрением, упаковывает классификатор изображений PyTorch с конвейером предварительной обработки в один Bento, поэтому точные преобразования, используемые при обучении, передаются вместе с моделью.
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the BentoML and Model Packaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Спекулятивные изменения моделей кода
Часто задаваемые вопросы
What is BentoML and Model Packaging?
BentoML — это платформа Python с открытым исходным кодом, которая объединяет обученные модели машинного обучения в стандартизированные развертываемые блоки, называемые «Bentos». Он устраняет разрыв между моделью, хранящейся в блокноте, и производственным сервисом, который действительно может предоставлять прогнозы через API.
Что представляет собой стандартизированное развертываемое устройство, которое производит BentoML?
BentoML упаковывает модель, ее код, зависимости и конфигурацию среды выполнения в автономный модуль с поддержкой версий, называемый Bento.
Что в первую очередь улучшает адаптивное микропакетирование BentoML?
Адаптивная пакетная обработка группирует входящие запросы во время выполнения, чтобы обеспечить занятость графических процессоров и максимизировать пропускную способность без изменений кода.
Что в архитектуре BentoML обрабатывает выполнение трудоемкой модели отдельно от сервера API?
Исполнители инкапсулируют вывод модели и могут масштабировать свои собственные рабочие процессы, отделенные от облегченного сервера API.
Какая команда превращает встроенный Bento в образ OCI Docker?
«bentomlContainerize» создает стандартный образ OCI/Docker из Bento для развертывания.
Что из этого является основной причиной, по которой BentoML встраивает версии зависимостей в Bento?
Закрепление и внедрение среды делает упакованную службу воспроизводимой и согласованной, где бы она ни выполнялась.