GUIDE de l'IA audio

Jasper et QuartzNet ASR

Jasper et QuartzNet sont les modèles de reconnaissance vocale convolutionnelle de bout en bout de NVIDIA, QuartzNet étant une refonte considérablement plus petite et efficace de Jasper.

2 minutes de lectureDernière mise à jour

Aperçu

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Plongée profonde

Jasper (Just Another Speech Recognizer), publié par NVIDIA en 2019, est un réseau convolutif 1D profond, jusqu'à 54 couches, qui mappe les caractéristiques du spectrogramme Mel aux caractères en utilisant la perte CTC. Il a introduit des connexions résiduelles denses afin que les gradients s'écoulent proprement à travers des piles très profondes. QuartzNet, sorti la même année, a conservé la structure de bloc de Jasper mais a remplacé les convolutions standard par des convolutions séparables par canal temporel, divisant chaque filtre en une convolution temporelle en profondeur et une étape de mélange de canal par point. Cette factorisation a réduit les paramètres d'environ 333 millions de Jasper à environ 19 millions tout en faisant correspondre la précision de Librispeech. Les deux sont livrés avec la boîte à outils NeMo de NVIDIA et sont optimisés pour une formation GPU rapide et une inférence en temps réel, ce qui en fait des éléments de base populaires pour l'ASR de production.

Aperçu technique

L'efficacité de QuartzNet vient de convolutions séparables par canal temporel, la même idée derrière MobileNet. Une convolution 1D normale mélange le temps et les canaux, ce qui coûte K fois les poids C-in multipliés par C-out. Le séparer en une convolution en profondeur au fil du temps plus une convolution ponctuelle 1x1 sur les canaux réduit les paramètres à K fois C plus C-in fois C-out. Empilé en blocs résiduels et entraîné avec CTC, cela donne une précision proche de Jasper à une fraction de la taille et du calcul du modèle.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L’avenir de Jasper et QuartzNet ASR

La lignée de convolutions séparables de QuartzNet a conduit directement au Citrinet de NVIDIA et aux modèles Conformer largement utilisés, qui ajoutent une attention personnelle pour capturer le contexte global aux côtés des convolutions locales. Attendez-vous à une évolution continue vers des architectures hybrides de convolution plus attention et des décodeurs de transducteurs (RNN-T) pour le streaming. La leçon principale, les convolutions efficaces en termes de paramètres pour le déploiement en périphérie et en temps réel, reste centrale à mesure que l'ASR s'étend aux téléphones, aux voitures et aux appareils embarqués.

Mise en œuvre dans le monde réel

Transcription en temps réel et assistants vocaux déployés sur les GPU NVIDIA via le kit d'outils NeMo

Edge et ASR intégré où la faible empreinte de QuartzNet s'adapte aux appareils à mémoire limitée

Affiner les points de contrôle QuartzNet pré-entraînés pour les vocabulaires spécifiques à un domaine comme les termes médicaux ou juridiques

Analyses des centres d'appels transcrivant de grands volumes d'audio rapidement et à moindre coût

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

ASR convolutif Wav2Letter

Questions fréquemment posées

What is Jasper and QuartzNet ASR?

Jasper et QuartzNet sont les modèles de reconnaissance vocale convolutionnelle de bout en bout de NVIDIA, QuartzNet étant une refonte considérablement plus petite et efficace de Jasper. Ils sont importants pour montrer comment obtenir une grande précision avec beaucoup moins de paramètres, idéal pour le déploiement.

Quelle innovation clé permet à QuartzNet d'utiliser beaucoup moins de paramètres que Jasper ?

QuartzNet remplace les convolutions standard par des convolutions séparables par canal temporel, réduisant considérablement le nombre de paramètres tout en préservant la précision.

Environ combien de paramètres QuartzNet a-t-il par rapport aux ~ 333 millions de Jasper ?

QuartzNet se réduit à environ 19 millions de paramètres, soit une réduction d'environ 17 fois, tout en correspondant à la précision Librispeech de Jasper.

Quelle entreprise a développé Jasper et QuartzNet ?

Les deux modèles ont été développés par NVIDIA et sont distribués via sa boîte à outils d'IA conversationnelle NeMo.

Quelle fonction de perte Jasper et QuartzNet utilisent-ils pour s'entraîner sans alignements explicites ?

Les deux utilisent la perte CTC, qui aligne l'audio de longueur variable sur les séquences de caractères sans nécessiter d'étiquettes par image.

Quelle caractéristique structurelle permet aux gradients de circuler à travers le réseau très profond (jusqu'à 54 couches) de Jasper ?

Jasper utilise des connexions résiduelles denses (saut) afin que les gradients se propagent proprement à travers sa pile convolutive profonde.