Що сталося
AWS опублікував технічний посібник і випустив Container (DLC) для WhisperX, розширення з відкритим кодом моделі Whisper від OpenAI. Цей контейнер розроблено для розгортання на Amazon SageMaker AI, підтримуючи як робочі, так і асинхронні кінцеві точки. Система додає до стандартної транскрипції щоденник мовця та часові мітки на рівні слів, усуваючи обмеження в загальних інструментах перетворення мови в текст для корпоративних робочих навантажень.
AWS представив контейнер глибокого навчання (DLC) для WhisperX, доступний для розгортання на Amazon SageMaker AI. WhisperX — це проект із відкритим вихідним кодом, який розширює модель автоматичного розпізнавання мовлення Whisper OpenAI, додаючи груповий висновок, примусове вирівнювання wav2vec2 для позначок часу на слово та діаріалізацію мовця. AWS DLC упаковує ці компоненти в образ, готовий до графічного процесора, який відповідає стандартному контракту на обслуговування SageMaker AI, усуваючи потребу користувачам створювати власні зображення або керувати маркерами Hugging Face.
Розгортання підтримує два типи кінцевих точок: режим реального часу та асинхронний. Кінцева точка реального часу підходить для коротких інтерактивних кліпів, які завершуються в межах 60-секундного обмеження відповіді SageMaker AI, синхронно повертаючи стенограму. Асинхронна кінцева точка рекомендована для довгих аудіофайлів, оскільки вона забезпечує введення та виведення через Amazon S3, усуваючи обмеження за часом і дозволяючи більш складну обробку. Для обох кінцевих точок потрібна спеціальна конфігурація, зокрема прикріплення InferenceAmiVersion до al2-ami-sagemaker--gpu-3-1, щоб запобігти помилкам запуску.
Джерело надає робочий блокнот JupyterLab у сховищі зразків AWS для тестування розгортання. У цьому прикладі використовується загальнодоступний запис зв’язку диспетчера повітряного руху з рейсу 1549 авіакомпанії US Airways, щоб продемонструвати здатність системи обробляти багатосторонні радіообміни з фоновим шумом. Вихідні дані включають сегменти, мітки часу на слово та мітки динаміків, які є критичними для додатків, які вимагають точного аналізу звуку та аудиту відповідності.
Деталі джерела: aws.amazon.com ↗
Чому це важливо
Цей випуск знижує бар’єр для підприємств щодо реалізації високоякісного аудіоаналізу шляхом упаковки складних компонентів, таких як вирівнювання wav2vec2 і діаризація, у кероване зображення, готове до GPU. Це дозволяє командам розгортати транскрипцію з мітками доповідачів без створення власних контейнерів, підтримуючи випадки використання в контакт-центрах, юридичні відкриття та медіа-титри. Забезпечуючи стандартизований контракт на обслуговування, AWS інтегрує розширені можливості штучного інтелекту з відкритим кодом у свою керовану хмарну інфраструктуру, сприяючи масштабованій та сумісній обробці аудіо.
Загальні засоби перетворення мовлення в текст часто не можуть забезпечити надійну ідентифікацію мовця та точні позначки часу, що є важливими для корпоративних програм, таких як аналіз контакт-центру, юридичні відкриття та субтитри до медіа. Упаковуючи WhisperX у керований DLC, AWS надає готове до виробництва рішення, яке усуває ці прогалини, не вимагаючи глибокої експертизи інфраструктури.
Інтеграція щоденника мовця та вирівнювання на рівні слів дає змогу детальніше аналізувати аудіодані. Наприклад, контакт-центри можуть вимірювати час розмови та дотримання сценарію, а медіа-команди можуть створювати точні файли субтитрів SubRip (SRT) і текстових треків веб-відео (VTT). Ця можливість підтримує відповідність нормативним вимогам у сферах охорони здоров’я, юридичному та фінансовому секторах, де для аудиту потрібна точна атрибуція мови.
Реліз підкреслює тенденцію хмарних провайдерів інтегрувати спеціалізовані моделі ШІ з відкритим кодом у свої керовані сервіси. Пропонуючи стандартизований контейнер, AWS зменшує операційні витрати на розгортання розширених моделей розпізнавання мовлення, роблячи їх доступнішими для широкого кола розробників і підприємств.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
In AI, what are a model's "parameters"?
Що дивитися далі
Відстежуйте метрики прийняття клієнтами та конкретні моделі ціноутворення для екземплярів GPU, необхідних для запуску цього контейнера. Слідкуйте за оновленнями проекту WhisperX з відкритим вихідним кодом, які можуть бути відображені в майбутніх версіях контейнерів, і спостерігайте, як цей шаблон розгортання впливає на ширший ринок керованих послуг перетворення мови в текст.
Джерело не вказує ціни на екземпляри графічного процесора (ml.g4dn.xlarge або ml.g5.2xlarge), необхідні для запуску контейнера, а також не описує вартість безперервного виставлення рахунків для кінцевих точок графічного процесора. Користувачі повинні стежити за оновленнями цін AWS і функціями контролю витрат для SageMaker AI.
У майбутніх оновленнях проекту з відкритим вихідним кодом WhisperX можуть бути представлені нові функції або вдосконалення, які відображатимуться в наступних версіях AWS DLC. Відстеження цих оновлень буде важливим для користувачів, які покладаються на найновіші можливості в діарізації та вирівнюванні динаміків.
Прийняття цього контейнера корпоративними клієнтами вкаже на ринковий попит на керовані високоточні послуги перетворення мови в текст. Спостереження за тим, як AWS позиціонує цей інструмент порівняно з іншими пропозиціями розпізнавання мовлення, дасть змогу зрозуміти конкурентний ландшафт.