Audio AI GUIDE

Jasper og QuartzNet ASR

Jasper og QuartzNet er NVIDIAs ende-til-ende konvolusjonelle talegjenkjenningsmodeller, med QuartzNet som en dramatisk mindre, effektiv redesign av Jasper.

2 min lesingSist oppdatert

Oversikt

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Dypdykk

Jasper (Just Another Speech Recognizer), utgitt av NVIDIA i 2019, er et dypt 1D konvolusjonsnettverk, opptil 54 lag, som kartlegger mel-spektrogram-funksjoner til karakterer ved å bruke CTC-tap. Den introduserte tette gjenværende forbindelser slik at gradienter flyter rent gjennom veldig dype stabler. QuartzNet, utgitt samme år, beholdt Jaspers blokkstruktur, men erstattet standard konvolusjoner med tidskanal-separerbare konvolusjoner, og delte hvert filter i en dybdevis tidsmessig konvolusjon og et punktvis kanalblandingstrinn. Denne faktoriseringen kuttet parametrene fra Jaspers omtrent 333 millioner ned til rundt 19 millioner mens den matchet nøyaktigheten på Librispeech. Begge leveres i NVIDIAs NeMo-verktøysett og er innstilt for rask GPU-trening og sanntidsslutning, noe som gjør dem til populære byggeklosser for produksjon av ASR.

Teknisk innsikt

QuartzNets effektivitet kommer fra tidskanalseparerbare konvolusjoner, den samme ideen bak MobileNet. En normal 1D konvolusjon blander tid og kanaler sammen, og koster K ganger C-inn ganger C-ut vekter. Å separere den i en dybdevis konvolusjon over tid pluss en 1x1 punktvis konvolusjon over kanaler reduserer parametere til K ganger C pluss C-inn ganger C-ut. Stablet i gjenværende blokker og trent med CTC, gir dette nesten Jaspis nøyaktighet på en brøkdel av modellstørrelsen og beregningen.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

Fremtiden til Jasper og QuartzNet ASR

QuartzNets avstamning med separerbar konvolusjon førte direkte til NVIDIAs Citrinet og de mye brukte Conformer-modellene, som legger til selvoppmerksomhet for å fange global kontekst sammen med lokale konvolusjoner. Forvent fortsatt bevegelse mot hybrid konvolusjon-pluss-oppmerksomhet-arkitekturer og transduser-dekodere (RNN-T) for streaming. Kjerneleksjonen, parametereffektive konvolusjoner for kant- og sanntidsdistribusjon, forblir sentral når ASR skyver inn på telefoner, biler og innebygde enheter.

Real-World Implementering

Sanntidstranskripsjon og taleassistenter distribuert på NVIDIA GPUer via NeMo-verktøysettet

Edge og innebygd ASR der QuartzNets lille fotavtrykk passer til minnebegrensede enheter

Finjustere forhåndstrente QuartzNet-sjekkpunkter for domenespesifikke vokabularer som medisinske eller juridiske termer

Call-center-analyse som transkriberer store volumer lyd raskt og kostnadseffektivt

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Wav2Letter Convolutional ASR

Ofte stilte spørsmål

What is Jasper and QuartzNet ASR?

Jasper og QuartzNet er NVIDIAs ende-til-ende konvolusjonelle talegjenkjenningsmodeller, med QuartzNet som en dramatisk mindre, effektiv redesign av Jasper. De er viktige for å vise hvordan du får sterk nøyaktighet med langt færre parametere, ideelt for distribusjon.

Hvilken nøkkelinnovasjon lar QuartzNet bruke langt færre parametere enn Jasper?

QuartzNet erstatter standard konvolusjoner med tidskanalseparerbare konvolusjoner, og reduserer parameterantallet drastisk samtidig som nøyaktigheten bevares.

Omtrent hvor mange parametere har QuartzNet sammenlignet med Jaspers ~333 millioner?

QuartzNet krymper til omtrent 19 millioner parametere, omtrent en reduksjon på 17 ganger, samtidig som den matcher Jaspers Librispeech-nøyaktighet.

Hvilket selskap utviklet både Jasper og QuartzNet?

Begge modellene ble utviklet av NVIDIA og distribueres gjennom NeMo-konversasjons-AI-verktøysettet.

Hvilken tapsfunksjon bruker Jasper og QuartzNet for å trene uten eksplisitte justeringer?

Begge bruker CTC-tap, som justerer lyd med variabel lengde til tegnsekvenser uten å kreve etiketter per ramme.

Hvilken strukturell funksjon hjelper gradienter å flyte gjennom Jaspers veldig dype (opptil 54-lags) nettverk?

Jasper bruker tette gjenværende (hopp over) forbindelser slik at gradienter forplanter seg rent gjennom den dype konvolusjonsstabelen.