PRZEWODNIK AI audio

Jasper i QuartzNet ASR

Jasper i QuartzNet to kompleksowe modele splotowego rozpoznawania mowy firmy NVIDIA, przy czym QuartzNet to znacznie mniejsza, wydajniejsza przeprojektowana wersja Jasper.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Głębokie nurkowanie

Jasper (Just Another Speech Recognizer), wydany przez firmę NVIDIA w 2019 r., to głęboka sieć splotowa 1D, zawierająca do 54 warstw, która odwzorowuje cechy spektrogramu mel na znaki przy użyciu utraty CTC. Wprowadzono gęste połączenia resztkowe, dzięki czemu gradienty przepływają czysto przez bardzo głębokie stosy. QuartzNet, wydany w tym samym roku, zachował strukturę blokową Jaspera, ale zastąpił standardowe sploty splotami rozłączalnymi w kanałach czasowych, dzieląc każdy filtr na splot czasowy wgłębny i krok mieszania kanałów punktowych. Ta faktoryzacja obniżyła parametry Jaspera z około 333 milionów do około 19 milionów, dopasowując jednocześnie dokładność do Librispeech. Obydwa są dostarczane w zestawie narzędzi NeMo firmy NVIDIA i są dostrojone pod kątem szybkiego uczenia procesora graficznego i wnioskowania w czasie rzeczywistym, co czyni je popularnymi elementami składowymi produkcyjnego ASR.

Wgląd techniczny

Wydajność QuartzNet wynika z oddzielnych splotów w kanałach czasowych, co jest tą samą ideą, która stoi za MobileNet. Normalny splot 1D łączy ze sobą czas i kanały, co kosztuje K razy C-in i C-out. Rozdzielenie go na splot głęboki w czasie plus splot punktowy 1x1 na kanałach redukuje parametry do K razy C plus C-in razy C-out. Ułożone w resztkowe bloki i wyszkolone za pomocą CTC, daje to dokładność bliską Jasperowi przy ułamku rozmiaru modelu i obliczeń.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość Jaspera i QuartzNet ASR

Linia QuartzNet z możliwością rozdzielenia splotów doprowadziła bezpośrednio do Citrinet firmy NVIDIA i powszechnie używanych modeli Conformer, które dodają samouważności w celu uchwycenia globalnego kontekstu wraz z lokalnymi splotami. Należy spodziewać się ciągłego ruchu w kierunku hybrydowych architektur splotu i uwagi oraz dekoderów z przetwornikiem (RNN-T) do przesyłania strumieniowego. Podstawowa lekcja, efektywne pod względem parametrów sploty do wdrażania na brzegu sieci i w czasie rzeczywistym, pozostaje kluczowa w miarę wdrażania ASR na telefony, samochody i urządzenia wbudowane.

Implementacja w świecie rzeczywistym

Transkrypcja w czasie rzeczywistym i asystenci głosowi wdrażani na procesorach graficznych NVIDIA za pośrednictwem zestawu narzędzi NeMo

Edge i wbudowany ASR, w którym niewielka powierzchnia QuartzNet pasuje do urządzeń o ograniczonej pamięci

Dostosowywanie wstępnie wyszkolonych punktów kontrolnych QuartzNet pod kątem słowników specyficznych dla domeny, takich jak terminy medyczne lub prawne

Analityka call-center umożliwia szybką i ekonomiczną transkrypcję dużych ilości dźwięku

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Splotowy ASR Wav2Letter

Często zadawane pytania

What is Jasper and QuartzNet ASR?

Jasper i QuartzNet to kompleksowe modele splotowego rozpoznawania mowy firmy NVIDIA, przy czym QuartzNet to znacznie mniejsza, wydajniejsza przeprojektowana wersja Jasper. Mają znaczenie, jeśli chodzi o pokazanie, jak uzyskać dużą dokładność przy znacznie mniejszej liczbie parametrów, co jest idealne do wdrożenia.

Jaka kluczowa innowacja pozwala QuartzNet używać znacznie mniej parametrów niż Jasper?

QuartzNet zastępuje standardowe sploty splotami rozdzielanymi w kanałach czasowych, drastycznie zmniejszając liczbę parametrów przy jednoczesnym zachowaniu dokładności.

Ile mniej więcej parametrów ma QuartzNet w porównaniu z ~333 milionami Jaspera?

QuartzNet zmniejsza się do około 19 milionów parametrów, czyli około 17-krotnie mniej, dopasowując się do dokładności Librispeech Jaspera.

Która firma opracowała zarówno Jasper, jak i QuartzNet?

Obydwa modele zostały opracowane przez firmę NVIDIA i są dystrybuowane za pośrednictwem zestawu narzędzi konwersacyjnych AI NeMo.

Jakiej funkcji straty używają Jasper i QuartzNet do trenowania bez wyraźnych wyrównań?

Obydwa wykorzystują stratę CTC, która dopasowuje dźwięk o zmiennej długości do sekwencji znaków bez konieczności stosowania etykiet na klatkę.

Jaka cecha strukturalna pomaga gradientom przepływać przez bardzo głęboką (do 54 warstw) sieć Jaspera?

Jasper wykorzystuje gęste połączenia resztkowe (pomijane), dzięki czemu gradienty rozprzestrzeniają się w sposób czysty poprzez głęboki stos splotowy.