Jasper et QuartzNet ASR
Jasper et QuartzNet sont les modèles de reconnaissance vocale convolutionnelle de bout en bout de NVIDIA, QuartzNet étant une refonte considérablement plus petite et efficace de Jasper.
Aperçu
They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.
Plongée profonde
Jasper (Just Another Speech Recognizer), publié par NVIDIA en 2019, est un réseau convolutif 1D profond, jusqu'à 54 couches, qui mappe les caractéristiques du spectrogramme Mel aux caractères en utilisant la perte CTC. Il a introduit des connexions résiduelles denses afin que les gradients s'écoulent proprement à travers des piles très profondes. QuartzNet, sorti la même année, a conservé la structure de bloc de Jasper mais a remplacé les convolutions standard par des convolutions séparables par canal temporel, divisant chaque filtre en une convolution temporelle en profondeur et une étape de mélange de canal par point. Cette factorisation a réduit les paramètres d'environ 333 millions de Jasper à environ 19 millions tout en faisant correspondre la précision de Librispeech. Les deux sont livrés avec la boîte à outils NeMo de NVIDIA et sont optimisés pour une formation GPU rapide et une inférence en temps réel, ce qui en fait des éléments de base populaires pour l'ASR de production.
Aperçu technique
L'efficacité de QuartzNet vient de convolutions séparables par canal temporel, la même idée derrière MobileNet. Une convolution 1D normale mélange le temps et les canaux, ce qui coûte K fois les poids C-in multipliés par C-out. Le séparer en une convolution en profondeur au fil du temps plus une convolution ponctuelle 1x1 sur les canaux réduit les paramètres à K fois C plus C-in fois C-out. Empilé en blocs résiduels et entraîné avec CTC, cela donne une précision proche de Jasper à une fraction de la taille et du calcul du modèle.
Impact stratégique
Accès et portée
Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.
Coût et budget
Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.
Vitesse et échelle
Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.
L’avenir de Jasper et QuartzNet ASR
La lignée de convolutions séparables de QuartzNet a conduit directement au Citrinet de NVIDIA et aux modèles Conformer largement utilisés, qui ajoutent une attention personnelle pour capturer le contexte global aux côtés des convolutions locales. Attendez-vous à une évolution continue vers des architectures hybrides de convolution plus attention et des décodeurs de transducteurs (RNN-T) pour le streaming. La leçon principale, les convolutions efficaces en termes de paramètres pour le déploiement en périphérie et en temps réel, reste centrale à mesure que l'ASR s'étend aux téléphones, aux voitures et aux appareils embarqués.
Mise en œuvre dans le monde réel
Transcription en temps réel et assistants vocaux déployés sur les GPU NVIDIA via le kit d'outils NeMo
Edge et ASR intégré où la faible empreinte de QuartzNet s'adapte aux appareils à mémoire limitée
Affiner les points de contrôle QuartzNet pré-entraînés pour les vocabulaires spécifiques à un domaine comme les termes médicaux ou juridiques
Analyses des centres d'appels transcrivant de grands volumes d'audio rapidement et à moindre coût
Risques et garde-fous
Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.
La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.
L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.
Feuille de route de mise en œuvre
Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.
Testez la qualité sur divers locuteurs et conditions d’arrière-plan.
Définissez quand un humain doit examiner ou approuver les résultats.
Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jasper and QuartzNet ASR quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
ASR convolutif Wav2Letter
Questions fréquemment posées
What is Jasper and QuartzNet ASR?
Jasper et QuartzNet sont les modèles de reconnaissance vocale convolutionnelle de bout en bout de NVIDIA, QuartzNet étant une refonte considérablement plus petite et efficace de Jasper. Ils sont importants pour montrer comment obtenir une grande précision avec beaucoup moins de paramètres, idéal pour le déploiement.
Quelle innovation clé permet à QuartzNet d'utiliser beaucoup moins de paramètres que Jasper ?
QuartzNet remplace les convolutions standard par des convolutions séparables par canal temporel, réduisant considérablement le nombre de paramètres tout en préservant la précision.
Environ combien de paramètres QuartzNet a-t-il par rapport aux ~ 333 millions de Jasper ?
QuartzNet se réduit à environ 19 millions de paramètres, soit une réduction d'environ 17 fois, tout en correspondant à la précision Librispeech de Jasper.
Quelle entreprise a développé Jasper et QuartzNet ?
Les deux modèles ont été développés par NVIDIA et sont distribués via sa boîte à outils d'IA conversationnelle NeMo.
Quelle fonction de perte Jasper et QuartzNet utilisent-ils pour s'entraîner sans alignements explicites ?
Les deux utilisent la perte CTC, qui aligne l'audio de longueur variable sur les séquences de caractères sans nécessiter d'étiquettes par image.
Quelle caractéristique structurelle permet aux gradients de circuler à travers le réseau très profond (jusqu'à 54 couches) de Jasper ?
Jasper utilise des connexions résiduelles denses (saut) afin que les gradients se propagent proprement à travers sa pile convolutive profonde.