Вернуться к новостям
ПродуктAI Understanding брифинг

AWS подробно описывает редизайн SageMaker SDK v3 для обучения и развертывания пользовательских моделей ИИ

AWS сообщает, что SageMaker Python SDK v3 унифицирует обучение и развертывание пользовательских моделей с помощью ModelTrainer, ModelBuilder и внедрения кода во время выполнения, с примерами, охватывающими scikit-learn и Stable Diffusion.

5 min readRead the primary source
Primary-source image accompanying AWS details SageMaker SDK v3 redesign for custom AI model training and deployment
ПервоисточникИсточник записан
Издатель
aws.amazon.com
Ссылка на источник
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/bring-your-own-model-with-amazon-sagemaker-ai-script-mode-in-sdk-v3/
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
LoRA (Адаптация низкого ранга)
Метод точной настройки с эффективным параметром, который добавляет матрицы адаптеров низкого ранга.
Машинное обучение (МО)
Методы, которые позволяют системам изучать закономерности на основе данных и совершенствоваться с течением времени.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

AWS опубликовал техническое описание SageMaker Python SDK v3, которое заменяет несколько классов обучения и развертывания для конкретной платформы унифицированным интерфейсом ModelTrainer и ModelBuilder. В публикации демонстрируется внедрение локального исходного кода во время выполнения в образы контейнеров, управляемые обучающие задания, конечные точки в реальном времени, распределенная тонкая настройка Stable Diffusion и обработка секретов с помощью AWS Secrets Manager.

В сообщении от 26 августа 2026 года AWS описывает SageMaker Python SDK v3 как модернизацию предыдущего рабочего процесса в режиме сценариев. Согласно AWS, версия 3 заменяет специфичные для платформы классы оценки, такие как SKLearn, PyTorch и XGBoost, на один ModelTrainer для запуска обучающих заданий. Он также заменяет более ранние шаблоны Model и Predictor на ModelBuilder для упаковки и развертывания моделей. В посте это представлено как общий интерфейс для разных рабочих нагрузок, а не как новая модель или новый алгоритм обучения.

Источником является техническое объяснение, созданное AWS, поэтому описанные здесь возможности и преимущества продукта являются заявлениями AWS. Центральной особенностью является объект конфигурации SourceCode. Разработчики предоставляют локальный исходный каталог и либо команду обучения, либо сценарий ввода вывода. AWS сообщает, что SageMaker синхронизирует этот каталог с выбранным контейнером при запуске задания, что позволяет командам изменять код обучения или вывода без перестройки образа контейнера. Контейнером может быть образ, созданный клиентом в реестре Elastic Container Registry Amazon, контейнер глубокого обучения AWS или сторонний образ.

В пошаговом руководстве говорится, что это сохраняет контроль над системными пакетами, библиотеками CUDA и версиями среды выполнения, одновременно предоставляя один интерфейс для рабочих нагрузок, включающих scikit-learn, PyTorch, Stable Diffusion и пользовательские двоичные файлы вывода C++. В первом примере обучаемый классификатор случайного леса обучается на наборе данных о диабете и развертывается в конечной точке в режиме реального времени с помощью DJL Serving. В примере используется один экземпляр ml.m5.2xlarge, настройка теплого пула на один час и Amazon S3 для артефактов модели. Во втором примере выполняется тонкая настройка Stable Diffusion 3.5 Medium с помощью LoRA на пользовательском наборе данных изображений и подписей.

AWS утверждает, что использует Hugging Face Accelerate для распределенного обучения на четырех графических процессорах A10G в одном экземпляре ml.g5.12xlarge, а затем передает полученные веса в конечную точку в реальном времени. В сообщении также показаны настройки на основе рецептов, настраиваемые входные каналы, дополнительное отслеживание MLflow и получение секретов через AWS Secrets Manager.

Подробности об источнике: aws.amazon.com ↗

Почему это важно

Это изменение может сократить необходимость перестройки контейнеров и настройки конкретной платформы для команд, выполняющих пользовательские рабочие нагрузки искусственного интеллекта в SageMaker. Он также иллюстрирует общую производственную схему: разделение кода модели и среды выполнения при использовании управляемой инфраструктуры для обучения, артефактов и вывода. Источник не предоставляет независимых сравнений производительности, стоимости или доступности.

Для команд ИИ наиболее практичным из описанных изменений является отделение повторно используемой инфраструктуры среды выполнения от часто меняющегося кода модели. Контейнер может содержать пакеты операционной системы, библиотеки и зависимости, специфичные для оборудования, а исходный код, сценарии запуска и файлы конфигурации предоставляются при запуске задания. Если реализация AWS работает так, как описано, это может сократить цикл итераций для экспериментов и обновлений модели, поскольку изменение кода не требует автоматической сборки и отправки нового контейнера. Это преимущество является операционным, а не алгоритмическим: оно влияет на то, как команды разрабатывают, тестируют и поддерживают системы искусственного интеллекта в управляемой облачной инфраструктуре.

Унифицированный API может также сократить количество концепций SageMaker, которые необходимо изучить разработчикам при переходе от традиционного машинного обучения к генеративному искусственному интеллекту. Один и тот же шаблон ModelTrainer и ModelBuilder показан для табличного классификатора на базе ЦП и задания точной настройки диффузии с несколькими графическими процессорами. AWS далее описывает ModelBuilder как способный упаковывать обработчики вывода с артефактами модели и, в некоторых случаях, выбирать контейнеры, фиксировать зависимости или генерировать код сериализации. Эти возможности могли бы сделать конвейеры развертывания более согласованными, но источник не устанавливает, что каждая платформа, сервер модели или пользовательский двоичный файл получают одинаковую поддержку или поведение.

В пошаговом руководстве рассматриваются элементы управления, имеющие значение в производстве. Результаты обучения записываются в Amazon S3, файлы модели упаковываются для развертывания, а обработчики вывода должны загружать модель один раз, а не перезагружать ее для каждого запроса. В этом примере также рекомендуется проверять типы контента запроса и использовать Secrets Manager для конфиденциальных токенов вместо помещения их в блокноты или обычные текстовые переменные среды. Эти методы могут улучшить повторяемость и уменьшить риски, которых можно избежать, но сами по себе они не демонстрируют полную систему безопасности или управления.

В сообщении не сообщается о независимом тестировании, измеренной задержке, снижении затрат, надежности конечных точек или изменениях качества обученных моделей.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Команды, оценивающие SDK, должны проверить усилия по миграции, поддерживаемую структуру и комбинации сервисов, региональную доступность, ограничения услуг, разрешения безопасности и общую стоимость. Им также следует проверить, соответствуют ли внедрение кода во время выполнения, теплые пулы, обучение нескольких графических процессоров и извлечение секретов их собственным требованиям к развертыванию и соблюдению требований.

Первый вопрос для усыновителей — масштабы миграции. AWS описывает переход от классов оценщиков SDK v2 и шаблона Model/Predictor к ModelTrainer и ModelBuilder, но в сообщении не перечислены все несовместимые параметры, устаревшие функции или предупреждения о миграции. Команды с существующими конвейерами SageMaker должны протестировать пользовательские точки входа, установку зависимостей, архивы моделей, обработчики вывода и интеграцию мониторинга, прежде чем рассматривать новый интерфейс как замену.

Им также следует подтвердить, какие среды выполнения обслуживания поддерживают их конкретный формат модели и протокол запросов. Стоимость и мощность — еще один открытый вопрос. В примерах используются управляемое обучение и конечные точки реального времени, теплые пулы, хранилище S3, реестры контейнеров и, для Stable Diffusion, четыре графических процессора. Эти ресурсы могут создавать периодические расходы, и источник не предоставляет оценку цен, данные об использовании или сравнение с другими подходами к развертыванию.

AWS специально инструктирует читателей удалять конечные точки, конфигурации конечных точек, модели, артефакты S3, изображения ECR и дополнительные ресурсы MLflow после тестирования. Это руководство по очистке сигнализирует о том, что примеры представляют собой операционные облачные рабочие процессы, а не бесплатные локальные демонстрации. Детали безопасности и надежности заслуживают тщательного изучения перед использованием в производстве. Источник сообщает, что исполнительной роли или пользователю необходимы разрешения SageMaker и S3, а руководителям обучения или непрерывной интеграции необходимо разрешение на чтение секретов из Secrets Manager.

Организациям следует проверять эти разрешения, изолировать роли обучения и обслуживания, контролировать, какой код синхронизируется с контейнерами, и определять, как журналы обрабатывают ошибки или конфиденциальные данные. Им также следует протестировать холодный запуск, поведение теплого пула, масштабирование конечных точек, загрузку модели и восстановление после сбоя. В сообщении не указывается региональная доступность, квоты на услуги, официальный статус поддержки, результаты независимых тестов или будут ли репозитории примеров синхронизироваться с будущими выпусками SDK.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаОбучение искусственному интеллектуБудущее ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?