Вернуться к новостям
ПродуктAI Understanding брифинг

AWS выпускает контейнер WhisperX для SageMaker AI

AWS выпустила контейнер глубокого обучения для WhisperX на Amazon SageMaker AI, обеспечивающий преобразование речи в текст промышленного уровня с метками говорящих и точными временными метками.

4 min readRead the primary source
Source-provided image accompanying AWS releases WhisperX container for SageMaker AI
ПервоисточникИсточник записан
Издатель
aws.amazon.com
Ссылка на источник
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/speaker-labeled-transcription-with-whisperx-on-sagemaker-ai/
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Глубокое обучение
Подмножество машинного обучения, которое использует многослойные нейронные сети для обучения представлению.
Вывод
Фаза выполнения, на которой обученная модель генерирует прогнозы или выходные данные.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

AWS опубликовал техническое руководство и выпустил контейнер глубокого обучения (DLC) для WhisperX, расширения с открытым исходным кодом модели Whisper от OpenAI. Этот контейнер предназначен для развертывания на Amazon SageMaker AI и поддерживает конечные точки как в реальном времени, так и асинхронные. Система добавляет к стандартной транскрипции диаризацию говорящего и временные метки на уровне слов, устраняя ограничения в универсальных инструментах преобразования речи в текст для корпоративных рабочих нагрузок.

AWS представила контейнер глубокого обучения (DLC) для WhisperX, доступный для развертывания на Amazon SageMaker AI. WhisperX — это проект с открытым исходным кодом, который расширяет модель автоматического распознавания речи Whisper OpenAI, добавляя пакетный вывод, принудительное выравнивание wav2vec2 для временных меток каждого слова и диаризацию говорящего. DLC AWS упаковывает эти компоненты в готовый к использованию графический процессор образ, который соответствует стандартному контракту на обслуживание искусственного интеллекта SageMaker, что устраняет необходимость для пользователей создавать собственные образы или управлять токенами Hugging Face.

Развертывание поддерживает два типа конечных точек: в режиме реального времени и асинхронный. Конечная точка реального времени подходит для коротких интерактивных клипов, которые завершаются в пределах 60-секундного ограничения ответа SageMaker AI, синхронно возвращая расшифровку. Асинхронную конечную точку рекомендуется использовать для длинных аудиофайлов, поскольку она обеспечивает ввод и вывод через Amazon S3, снимая ограничение по времени и позволяя выполнять более сложную обработку. Обе конечные точки требуют определенной настройки, включая привязку InferenceAmiVersion к al2-ami-sagemaker--gpu-3-1 для предотвращения ошибок запуска.

Исходный код предоставляет работоспособную записную книжку JupyterLab в репозитории образцов AWS для тестирования развертывания. В примере используется общедоступная запись переговоров диспетчеров воздушного движения с рейса 1549 авиакомпании US Airways, чтобы продемонстрировать способность системы обрабатывать многосторонние радиообмены с фоновым шумом. Выходные данные включают в себя сегменты, временные метки для каждого слова и метки говорящих, которые имеют решающее значение для приложений, требующих точного анализа звука и аудита соответствия.

Подробности об источнике: aws.amazon.com ↗

Почему это важно

Этот выпуск снижает барьер для предприятий при реализации высококачественного аудиоанализа, объединяя сложные компоненты, такие как выравнивание и диаризация wav2vec2, в управляемое изображение, готовое к использованию на графическом процессоре. Это позволяет командам развертывать транскрипцию с метками говорящего без создания пользовательских контейнеров, поддерживает сценарии использования в контакт-центрах, юридические исследования и субтитры для СМИ. Предоставляя стандартизированный контракт на обслуживание, AWS интегрирует расширенные возможности искусственного интеллекта с открытым исходным кодом в свою управляемую облачную инфраструктуру, обеспечивая масштабируемую и совместимую обработку звука.

Универсальные инструменты преобразования речи в текст часто не обеспечивают надежную идентификацию говорящего и точные временные метки, которые необходимы для корпоративных приложений, таких как анализ контакт-центра, юридическое расследование и субтитры для СМИ. Упаковав WhisperX в управляемый DLC, AWS предоставляет готовое к использованию решение, которое устраняет эти пробелы, не требуя глубоких знаний в области инфраструктуры.

Интеграция диаризации говорящего и выравнивания на уровне слов обеспечивает более детальный анализ аудиоданных. Например, контакт-центры могут измерять время разговора и соблюдение сценария, а медиа-команды могут создавать точные файлы субтитров SubRip (SRT) и текстовых дорожек веб-видео (VTT). Эта возможность поддерживает соблюдение нормативных требований в здравоохранении, юриспруденции и финансовом секторе, где для аудита требуется точная атрибуция речи.

В релизе подчеркивается тенденция облачных провайдеров интегрировать специализированные модели искусственного интеллекта с открытым исходным кодом в свои управляемые услуги. Предлагая стандартизированный контейнер, AWS снижает операционные накладные расходы на развертывание расширенных моделей распознавания речи, делая их более доступными для более широкого круга разработчиков и предприятий.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Что посмотреть дальше

Отслеживайте показатели внедрения клиентами и конкретные модели ценообразования для экземпляров графического процессора, необходимых для запуска этого контейнера. Следите за обновлениями проекта с открытым исходным кодом WhisperX, которые могут быть отражены в будущих версиях контейнера, и наблюдайте, как этот шаблон развертывания влияет на более широкий рынок управляемых услуг преобразования речи в текст.

В источнике не указаны цены на экземпляры графического процессора (ml.g4dn.xlarge или ml.g5.2xlarge), необходимые для запуска контейнера, а также не подробно описаны финансовые последствия непрерывного выставления счетов для конечных точек графического процессора. Пользователям следует следить за обновлениями цен AWS и функциями контроля затрат для SageMaker AI.

В будущих обновлениях проекта с открытым исходным кодом WhisperX могут появиться новые функции или улучшения, которые будут отражены в последующих версиях AWS DLC. Отслеживание этих обновлений будет важно для пользователей, которые полагаются на новейшие возможности диаризации и согласования говорящих.

Принятие этого контейнера корпоративными клиентами укажет на рыночный спрос на управляемые, высококачественные услуги преобразования речи в текст. Наблюдение за тем, как AWS позиционирует этот инструмент по сравнению с другими предложениями по распознаванию речи, позволит лучше понять конкурентную среду.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаИИ-агентыЧто такое ИИ?Проверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.
Нашли это полезным?