Retour aux Actualités
ProduitBriefing AI Understanding

AWS lance le conteneur WhisperX pour SageMaker AI

AWS a publié un conteneur d'apprentissage profond pour WhisperX sur Amazon SageMaker AI, permettant une synthèse vocale de qualité production avec des étiquettes de locuteur et des horodatages précis.

4 min readRead the primary source
Source-provided image accompanying AWS releases WhisperX container for SageMaker AI
Document de source principaleSource enregistrée
Éditeur
aws.amazon.com
Lien source
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/speaker-labeled-transcription-with-whisperx-on-sagemaker-ai/
Type de source
Document principal : une annonce officielle, un document, un dépôt ou une page de première partie que nous lisons directement.
ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

Apprentissage profond
Un sous-ensemble d'apprentissage automatique qui utilise des réseaux neuronaux à plusieurs couches pour l'apprentissage des représentations.
Inférence
Phase d'exécution au cours de laquelle un modèle entraîné génère des prédictions ou des sorties.
Testez-vousQuiz sur les modèles d'IA expliqués

Que s'est-il passé

AWS a publié un guide technique et publié un Container (DLC) pour WhisperX, une extension open source du modèle Whisper de OpenAI. Ce conteneur est conçu pour être déployé sur Amazon SageMaker AI, prenant en charge les points de terminaison en temps réel et asynchrones. Le système ajoute la diarisation du locuteur et l'horodatage au niveau des mots à la transcription standard, répondant ainsi aux limitations des outils génériques de synthèse vocale pour les charges de travail d'entreprise.

AWS a introduit un conteneur d'apprentissage profond (DLC) pour WhisperX, disponible pour le déploiement sur Amazon SageMaker AI. WhisperX est un projet open source qui étend le modèle de reconnaissance vocale automatique Whisper de OpenAI en ajoutant l'inférence par lots, l'alignement forcé wav2vec2 pour les horodatages par mot et la diarisation des locuteurs. Le DLC AWS regroupe ces composants dans une image prête pour le GPU qui suit le contrat de service standard de SageMaker AI, éliminant ainsi le besoin pour les utilisateurs de créer des images personnalisées ou de gérer les jetons Hugging Face.

Le déploiement prend en charge deux types de points de terminaison : en temps réel et asynchrone. Le point de terminaison en temps réel convient aux clips courts et interactifs qui se terminent dans le délai de réponse de 60 secondes de SageMaker AI, renvoyant la transcription de manière synchrone. Le point de terminaison asynchrone est recommandé pour les fichiers audio longs, car il gère l'entrée et la sortie via Amazon S3, supprimant la limite de temps et permettant un traitement plus complexe. Les deux points de terminaison nécessitent une configuration spécifique, notamment l'épinglage d'InferenceAmiVersion à al2-ami-sagemaker--gpu-3-1 pour éviter les erreurs de démarrage.

La source fournit un notebook JupyterLab exécutable dans le référentiel d'exemples AWS pour tester le déploiement. L’exemple utilise un enregistrement du domaine public des communications du contrôle de la circulation aérienne du vol 1549 d’US Airways pour démontrer la capacité du système à gérer des échanges radio multipartites avec un bruit de fond. Le résultat comprend des segments, des horodatages par mot et des étiquettes de locuteurs, qui sont essentiels pour les applications nécessitant une analyse audio précise et un audit de conformité.

Détails de la source: aws.amazon.com ↗

Pourquoi c'est important

Cette version abaisse les obstacles pour les entreprises qui souhaitent mettre en œuvre une analyse audio haute fidélité en regroupant des composants complexes tels que l'alignement et la diarisation wav2vec2 dans une image gérée et prête pour le GPU. Il permet aux équipes de déployer une transcription étiquetée par le locuteur sans créer de conteneurs personnalisés, prenant en charge les cas d'utilisation dans les centres de contact, la découverte juridique et le sous-titrage des médias. En fournissant un contrat de service standardisé, AWS intègre des capacités avancées d'IA open source dans son infrastructure cloud gérée, facilitant un traitement audio évolutif et conforme.

Les outils génériques de synthèse vocale ne parviennent souvent pas à fournir une identification fiable du locuteur et des horodatages précis, qui sont essentiels pour les applications d'entreprise telles que l'analyse des centres de contact, la découverte juridique et le sous-titrage des médias. En intégrant WhisperX dans un DLC géré, AWS fournit une solution prête pour la production qui comble ces lacunes sans nécessiter une expertise approfondie en matière d'infrastructure.

L'intégration de la diarisation du locuteur et de l'alignement au niveau des mots permet une analyse plus granulaire des données audio. Par exemple, les centres de contact peuvent mesurer le temps de conversation et le respect des scripts, tandis que les équipes médiatiques peuvent générer des fichiers SubRip Subtitle (SRT) et Web Video Text Tracks (VTT) précis. Cette fonctionnalité prend en charge la conformité réglementaire dans les secteurs de la santé, du droit et de la finance où une attribution précise de la parole est requise pour les audits.

Cette version met en évidence la tendance des fournisseurs de cloud à intégrer des modèles d'IA open source spécialisés dans leurs services gérés. En proposant un conteneur standardisé, AWS réduit les frais opérationnels liés au déploiement de modèles de reconnaissance vocale avancés, les rendant plus accessibles à un plus large éventail de développeurs et d'entreprises.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Que regarder ensuite

Surveillez les mesures d'adoption par les clients et les modèles de tarification spécifiques pour les instances GPU requises pour exécuter ce conteneur. Surveillez les mises à jour du projet open source WhisperX qui pourraient être reflétées dans les futures versions de conteneurs et observez comment ce modèle de déploiement influence le marché plus large des services de synthèse vocale gérés.

La source ne précise pas le prix des instances GPU (ml.g4dn.xlarge ou ml.g5.2xlarge) requises pour exécuter le conteneur, ni ne détaille les implications financières de la facturation continue pour les points de terminaison GPU. Les utilisateurs doivent surveiller les mises à jour des prix AWS et les fonctionnalités de contrôle des coûts pour SageMaker AI.

Les futures mises à jour du projet open source WhisperX pourraient introduire de nouvelles fonctionnalités ou améliorations qui se refléteront dans les versions ultérieures du DLC AWS. Le suivi de ces mises à jour sera important pour les utilisateurs qui s'appuient sur les dernières fonctionnalités en matière de diarisation et d'alignement des enceintes.

L'adoption de ce conteneur par les entreprises clientes indiquera la demande du marché pour des services de synthèse vocale gérés et haute fidélité. Observer comment AWS positionne cet outil par rapport à d'autres offres de reconnaissance vocale fournira un aperçu du paysage concurrentiel.

Guides et quiz associés

Modèles d'IA expliquésAgents IAQu’est-ce que l’IA ?Testez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaire
Vous avez trouvé cela utile ?