Технічний КЕРІВНИЦТВО

BentoML і модельне пакування

BentoML — це фреймворк Python з відкритим вихідним кодом, який упаковує навчені моделі машинного навчання в стандартизовані модулі, які можна розгортати під назвою «Bentos».

2 хвилини читанняОстаннє оновлення

Огляд

Він поєднує модель у нотатнику та виробничий сервіс, який може фактично подавати прогнози через API.

Глибоке занурення

Коли фахівець із обробки даних завершує навчання моделі, її запуск у виробництво зазвичай означає ручне написання коду обслуговування, закріплення залежностей, створення образу Docker і підключення API. BentoML автоматизує це. Ви зберігаєте модель у її локальному сховищі моделей, а потім визначаєте клас служби з кінцевою точкою API, призначеною для обробки висновків. Команда «bentoml build» пакує модель, ваш код Python, версії залежностей і конфігурацію середовища виконання в самодостатню версію Bento. Звідти «bentoml containerize» створює зображення OCI Docker. BentoML підтримує майже всі фреймворки (PyTorch, TensorFlow, scikit-learn, XGBoost, Hugging Face Transformers, ONNX) і додає адаптивне мікропакетування, яке автоматично групує вхідні запити, щоб максимізувати пропускну здатність GPU без зміни коду.

Технічне розуміння

BentoML відокремлює «Бігуни» (виконання моделі, яка потребує обчислень) від логіки сервера API. Виконувачі можуть самостійно масштабуватися та запускатися у своїх власних робочих процесах, тоді як легкий сервер HTTP/gRPC обробляє маршрутизацію запитів і введення-виведення. Його адаптивне пакетування динамічно налаштовує розмір пакета та вікно затримки під час виконання, тому воно поглинає спалахи трафіку та підтримує дорогі прискорювачі. Стандартизований формат Bento включає маніфест, файли моделі та середовище, що відтворюється, що робить збірки детермінованими на різних машинах.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє BentoML і модельного пакування

BentoML сильно схиляється до великої мовної моделі та генеративного обслуговування ШІ, а OpenLLM і BentoCloud пропонують потокові відповіді маркерів, автомасштабування та планування з урахуванням GPU. Очікуйте тіснішої інтеграції з оптимізаторами висновків, такими як vLLM і TensorRT-LLM, кращою підтримкою складених багатомодельних систем штучного інтелекту та плавнішими шляхами від пакетного розгортання Bento до безсерверного GPU. Оскільки команди переходять від окремих моделей до агентських конвеєрів, BentoML позиціонує себе як рівень упаковки та обслуговування, який об’єднує ці компоненти.

Реалізація в реальному світі

Команда з виявлення шахрайства зберігає модель XGBoost у магазині BentoML і створює Bento, який надає кінцеву точку REST /predict для виклику платіжної служби в режимі реального часу.

Команда ML-платформи використовує «bentoml containerize», щоб перетворити модель настрою Hugging Face на образ Docker, який розгортається у внутрішньому кластері Kubernetes.

Стартап обслуговує налаштовану модель Llama з OpenLLM (створену на BentoML), потокову передачу токенів до інтерфейсу користувача чату з адаптивним пакетуванням, що підтримує насичення GPU.

Компанія, що займається комп’ютерним баченням, об’єднує класифікатор зображень PyTorch із конвеєром попередньої обробки в один Bento, тому точні трансформації, які використовуються під час навчання, постачаються разом із моделлю.

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BentoML and Model Packaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Спекулятивні редагування для моделей коду

Часті запитання

Що таке BentoML і пакування моделей?

BentoML — це фреймворк Python з відкритим вихідним кодом, який упаковує навчені моделі машинного навчання в стандартизовані модулі, які можна розгортати під назвою «Bentos». Він усуває розрив між моделлю, що сидить у блокноті, і виробничою службою, яка фактично може обслуговувати прогнози через API.

Що таке стандартизований розгортаний пристрій, який виробляє BentoML?

BentoML упаковує модель, її код, залежності та конфігурацію середовища виконання в самодостатній блок із керуванням версіями під назвою Bento.

Що головним чином покращує адаптивне мікродозування BentoML?

Адаптивне пакетування групує вхідні запити під час виконання, щоб графічні процесори були зайняті та максимізували пропускну здатність без змін коду.

Що в архітектурі BentoML обробляє виконання інтенсивної моделі окремо від сервера API?

Виконувачі інкапсулюють висновок моделі та можуть масштабувати власні робочі процеси, відокремлені від легкого сервера API.

Яка команда перетворює вбудований Bento на образ OCI Docker?

'bentoml containerize' створює стандартний образ OCI/Docker з Bento для розгортання.

Що з цього є основною причиною, чому BentoML вбудовує версії залежностей у Bento?

Закріплення та вбудовування середовища робить пакетний сервіс відтворюваним і узгодженим, де б він не запускався.