Jasper i QuartzNet ASR
Jasper i QuartzNet to kompleksowe modele splotowego rozpoznawania mowy firmy NVIDIA, przy czym QuartzNet to znacznie mniejsza, wydajniejsza przeprojektowana wersja Jasper.
Przegląd
They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.
Głębokie nurkowanie
Jasper (Just Another Speech Recognizer), wydany przez firmę NVIDIA w 2019 r., to głęboka sieć splotowa 1D, zawierająca do 54 warstw, która odwzorowuje cechy spektrogramu mel na znaki przy użyciu utraty CTC. Wprowadzono gęste połączenia resztkowe, dzięki czemu gradienty przepływają czysto przez bardzo głębokie stosy. QuartzNet, wydany w tym samym roku, zachował strukturę blokową Jaspera, ale zastąpił standardowe sploty splotami rozłączalnymi w kanałach czasowych, dzieląc każdy filtr na splot czasowy wgłębny i krok mieszania kanałów punktowych. Ta faktoryzacja obniżyła parametry Jaspera z około 333 milionów do około 19 milionów, dopasowując jednocześnie dokładność do Librispeech. Obydwa są dostarczane w zestawie narzędzi NeMo firmy NVIDIA i są dostrojone pod kątem szybkiego uczenia procesora graficznego i wnioskowania w czasie rzeczywistym, co czyni je popularnymi elementami składowymi produkcyjnego ASR.
Wgląd techniczny
Wydajność QuartzNet wynika z oddzielnych splotów w kanałach czasowych, co jest tą samą ideą, która stoi za MobileNet. Normalny splot 1D łączy ze sobą czas i kanały, co kosztuje K razy C-in i C-out. Rozdzielenie go na splot głęboki w czasie plus splot punktowy 1x1 na kanałach redukuje parametry do K razy C plus C-in razy C-out. Ułożone w resztkowe bloki i wyszkolone za pomocą CTC, daje to dokładność bliską Jasperowi przy ułamku rozmiaru modelu i obliczeń.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość Jaspera i QuartzNet ASR
Linia QuartzNet z możliwością rozdzielenia splotów doprowadziła bezpośrednio do Citrinet firmy NVIDIA i powszechnie używanych modeli Conformer, które dodają samouważności w celu uchwycenia globalnego kontekstu wraz z lokalnymi splotami. Należy spodziewać się ciągłego ruchu w kierunku hybrydowych architektur splotu i uwagi oraz dekoderów z przetwornikiem (RNN-T) do przesyłania strumieniowego. Podstawowa lekcja, efektywne pod względem parametrów sploty do wdrażania na brzegu sieci i w czasie rzeczywistym, pozostaje kluczowa w miarę wdrażania ASR na telefony, samochody i urządzenia wbudowane.
Implementacja w świecie rzeczywistym
Transkrypcja w czasie rzeczywistym i asystenci głosowi wdrażani na procesorach graficznych NVIDIA za pośrednictwem zestawu narzędzi NeMo
Edge i wbudowany ASR, w którym niewielka powierzchnia QuartzNet pasuje do urządzeń o ograniczonej pamięci
Dostosowywanie wstępnie wyszkolonych punktów kontrolnych QuartzNet pod kątem słowników specyficznych dla domeny, takich jak terminy medyczne lub prawne
Analityka call-center umożliwia szybką i ekonomiczną transkrypcję dużych ilości dźwięku
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jasper and QuartzNet ASR quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Splotowy ASR Wav2Letter
Często zadawane pytania
What is Jasper and QuartzNet ASR?
Jasper i QuartzNet to kompleksowe modele splotowego rozpoznawania mowy firmy NVIDIA, przy czym QuartzNet to znacznie mniejsza, wydajniejsza przeprojektowana wersja Jasper. Mają znaczenie, jeśli chodzi o pokazanie, jak uzyskać dużą dokładność przy znacznie mniejszej liczbie parametrów, co jest idealne do wdrożenia.
Jaka kluczowa innowacja pozwala QuartzNet używać znacznie mniej parametrów niż Jasper?
QuartzNet zastępuje standardowe sploty splotami rozdzielanymi w kanałach czasowych, drastycznie zmniejszając liczbę parametrów przy jednoczesnym zachowaniu dokładności.
Ile mniej więcej parametrów ma QuartzNet w porównaniu z ~333 milionami Jaspera?
QuartzNet zmniejsza się do około 19 milionów parametrów, czyli około 17-krotnie mniej, dopasowując się do dokładności Librispeech Jaspera.
Która firma opracowała zarówno Jasper, jak i QuartzNet?
Obydwa modele zostały opracowane przez firmę NVIDIA i są dystrybuowane za pośrednictwem zestawu narzędzi konwersacyjnych AI NeMo.
Jakiej funkcji straty używają Jasper i QuartzNet do trenowania bez wyraźnych wyrównań?
Obydwa wykorzystują stratę CTC, która dopasowuje dźwięk o zmiennej długości do sekwencji znaków bez konieczności stosowania etykiet na klatkę.
Jaka cecha strukturalna pomaga gradientom przepływać przez bardzo głęboką (do 54 warstw) sieć Jaspera?
Jasper wykorzystuje gęste połączenia resztkowe (pomijane), dzięki czemu gradienty rozprzestrzeniają się w sposób czysty poprzez głęboki stos splotowy.