Назад до новин
ПродуктAI Understanding брифінг

AWS випускає контейнер WhisperX для SageMaker AI

AWS випустив Deep Learning Container для WhisperX на Amazon SageMaker AI, що забезпечує перетворення мови в текст робочого рівня з мітками мовців і точними часовими мітками.

4 min readRead the primary source
Source-provided image accompanying AWS releases WhisperX container for SageMaker AI
Першоджерельний документДжерело записано
Видавець
aws.amazon.com
Посилання на джерело
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/speaker-labeled-transcription-with-whisperx-on-sagemaker-ai/
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Глибоке навчання
Підмножина машинного навчання, яка використовує багаторівневі нейронні мережі для навчання представлення.
Висновок
Фаза виконання, на якій навчена модель генерує прогнози або результати.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

AWS опублікував технічний посібник і випустив Container (DLC) для WhisperX, розширення з відкритим кодом моделі Whisper від OpenAI. Цей контейнер розроблено для розгортання на Amazon SageMaker AI, підтримуючи як робочі, так і асинхронні кінцеві точки. Система додає до стандартної транскрипції щоденник мовця та часові мітки на рівні слів, усуваючи обмеження в загальних інструментах перетворення мови в текст для корпоративних робочих навантажень.

AWS представив контейнер глибокого навчання (DLC) для WhisperX, доступний для розгортання на Amazon SageMaker AI. WhisperX — це проект із відкритим вихідним кодом, який розширює модель автоматичного розпізнавання мовлення Whisper OpenAI, додаючи груповий висновок, примусове вирівнювання wav2vec2 для позначок часу на слово та діаріалізацію мовця. AWS DLC упаковує ці компоненти в образ, готовий до графічного процесора, який відповідає стандартному контракту на обслуговування SageMaker AI, усуваючи потребу користувачам створювати власні зображення або керувати маркерами Hugging Face.

Розгортання підтримує два типи кінцевих точок: режим реального часу та асинхронний. Кінцева точка реального часу підходить для коротких інтерактивних кліпів, які завершуються в межах 60-секундного обмеження відповіді SageMaker AI, синхронно повертаючи стенограму. Асинхронна кінцева точка рекомендована для довгих аудіофайлів, оскільки вона забезпечує введення та виведення через Amazon S3, усуваючи обмеження за часом і дозволяючи більш складну обробку. Для обох кінцевих точок потрібна спеціальна конфігурація, зокрема прикріплення InferenceAmiVersion до al2-ami-sagemaker--gpu-3-1, щоб запобігти помилкам запуску.

Джерело надає робочий блокнот JupyterLab у сховищі зразків AWS для тестування розгортання. У цьому прикладі використовується загальнодоступний запис зв’язку диспетчера повітряного руху з рейсу 1549 авіакомпанії US Airways, щоб продемонструвати здатність системи обробляти багатосторонні радіообміни з фоновим шумом. Вихідні дані включають сегменти, мітки часу на слово та мітки динаміків, які є критичними для додатків, які вимагають точного аналізу звуку та аудиту відповідності.

Деталі джерела: aws.amazon.com ↗

Чому це важливо

Цей випуск знижує бар’єр для підприємств щодо реалізації високоякісного аудіоаналізу шляхом упаковки складних компонентів, таких як вирівнювання wav2vec2 і діаризація, у кероване зображення, готове до GPU. Це дозволяє командам розгортати транскрипцію з мітками доповідачів без створення власних контейнерів, підтримуючи випадки використання в контакт-центрах, юридичні відкриття та медіа-титри. Забезпечуючи стандартизований контракт на обслуговування, AWS інтегрує розширені можливості штучного інтелекту з відкритим кодом у свою керовану хмарну інфраструктуру, сприяючи масштабованій та сумісній обробці аудіо.

Загальні засоби перетворення мовлення в текст часто не можуть забезпечити надійну ідентифікацію мовця та точні позначки часу, що є важливими для корпоративних програм, таких як аналіз контакт-центру, юридичні відкриття та субтитри до медіа. Упаковуючи WhisperX у керований DLC, AWS надає готове до виробництва рішення, яке усуває ці прогалини, не вимагаючи глибокої експертизи інфраструктури.

Інтеграція щоденника мовця та вирівнювання на рівні слів дає змогу детальніше аналізувати аудіодані. Наприклад, контакт-центри можуть вимірювати час розмови та дотримання сценарію, а медіа-команди можуть створювати точні файли субтитрів SubRip (SRT) і текстових треків веб-відео (VTT). Ця можливість підтримує відповідність нормативним вимогам у сферах охорони здоров’я, юридичному та фінансовому секторах, де для аудиту потрібна точна атрибуція мови.

Реліз підкреслює тенденцію хмарних провайдерів інтегрувати спеціалізовані моделі ШІ з відкритим кодом у свої керовані сервіси. Пропонуючи стандартизований контейнер, AWS зменшує операційні витрати на розгортання розширених моделей розпізнавання мовлення, роблячи їх доступнішими для широкого кола розробників і підприємств.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Що дивитися далі

Відстежуйте метрики прийняття клієнтами та конкретні моделі ціноутворення для екземплярів GPU, необхідних для запуску цього контейнера. Слідкуйте за оновленнями проекту WhisperX з відкритим вихідним кодом, які можуть бути відображені в майбутніх версіях контейнерів, і спостерігайте, як цей шаблон розгортання впливає на ширший ринок керованих послуг перетворення мови в текст.

Джерело не вказує ціни на екземпляри графічного процесора (ml.g4dn.xlarge або ml.g5.2xlarge), необхідні для запуску контейнера, а також не описує вартість безперервного виставлення рахунків для кінцевих точок графічного процесора. Користувачі повинні стежити за оновленнями цін AWS і функціями контролю витрат для SageMaker AI.

У майбутніх оновленнях проекту з відкритим вихідним кодом WhisperX можуть бути представлені нові функції або вдосконалення, які відображатимуться в наступних версіях AWS DLC. Відстеження цих оновлень буде важливим для користувачів, які покладаються на найновіші можливості в діарізації та вирівнюванні динаміків.

Прийняття цього контейнера корпоративними клієнтами вкаже на ринковий попит на керовані високоточні послуги перетворення мови в текст. Спостереження за тим, як AWS позиціонує цей інструмент порівняно з іншими пропозиціями розпізнавання мовлення, дасть змогу зрозуміти конкурентний ландшафт.

Пов’язані посібники та вікторини

Пояснення моделей AIАгенти ШІЩо таке ШІ?Перевірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосарії
Знайшли це корисним?