Jasper és QuartzNet ASR
A Jasper és a QuartzNet az NVIDIA végpontok közötti konvolúciós beszédfelismerő modelljei, a QuartzNet pedig a Jasper drámaian kisebb, hatékony újratervezése.
Áttekintés
They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.
Mély merülés
A Jasper (Just Another Speech Recognizer), amelyet az NVIDIA 2019-ben adott ki, egy mély 1D konvolúciós hálózat, akár 54 rétegből is, amely a mel-spektrogram jellemzőit CTC-vesztést használó karakterekhez rendeli hozzá. Sűrű maradék kapcsolatokat vezetett be, így a gradiensek tisztán folynak át nagyon mély kötegeken. Az ugyanabban az évben kiadott QuartzNet megtartotta a Jasper blokkstruktúráját, de a szabványos konvolúciókat időcsatornánként szétválasztható konvolúciókra cserélte, minden szűrőt felosztott egy mélységi időbeli konvolúcióra és egy pontszerű csatornakeverési lépésre. Ez a faktorizálás a paramétereket Jasper nagyjából 333 milliójáról körülbelül 19 millióra csökkentette, miközben a Librispeech pontossága megfelelt. Mindkettőt az NVIDIA NeMo eszközkészletében szállítjuk, és gyors GPU-tanításra és valós idejű következtetésekre hangolják, így népszerű építőkövei az éles ASR-nek.
Technikai betekintés
A QuartzNet hatékonysága az időcsatornánként szétválasztható konvolúciókból fakad, ami a MobileNet mögött is ugyanaz. Egy normál 1D konvolúció keveri az időt és a csatornákat, így a költség K-szer C-be szoroz C-out súlyokkal. Ha szétválasztja egy mélységi konvolúcióra az idő múlásával plusz egy 1x1 pontszerű konvolúciót a csatornákon keresztül, akkor a paraméterek K-szer C-szer plusz C-be- és C-out-szorosra csökkennek. A maradék blokkokban halmozott és CTC-vel betanított, ez közel Jasper pontosságot biztosít a modell méretének és számításának töredékénél.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A Jasper és a QuartzNet ASR jövője
A QuartzNet szétválasztható konvolúciós vonala közvetlenül az NVIDIA Citrinetjéhez és a széles körben használt Conformer modellekhez vezetett, amelyek önmagukra is figyelnek a globális kontextus megragadásához a helyi konvolúciók mellett. Folyamatos elmozdulás várható a hibrid konvolúció plusz figyelem architektúrák és transzduceres (RNN-T) dekóderek irányába a streaminghez. Az alapvető lecke, a paraméter-hatékony konvolúciók az éles és a valós idejű telepítéshez, továbbra is központi szerepet tölt be, amikor az ASR rányomódik a telefonokra, autókra és beágyazott eszközökre.
Valós megvalósítás
Valós idejű átírási és hangsegédek az NVIDIA GPU-kon a NeMo eszköztáron keresztül
Edge és beágyazott ASR, ahol a QuartzNet kis helyigénye elfér a korlátozott memóriával rendelkező eszközökön
Előképzett QuartzNet ellenőrzőpontok finomhangolása a tartományspecifikus szókészletekhez, például orvosi vagy jogi kifejezésekhez
Call-center analitika nagy mennyiségű hang gyors és költséghatékony átírására
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jasper and QuartzNet ASR quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Wav2Letter konvolúciós ASR
Gyakran ismételt kérdések
What is Jasper and QuartzNet ASR?
A Jasper és a QuartzNet az NVIDIA végpontok közötti konvolúciós beszédfelismerő modelljei, a QuartzNet pedig a Jasper drámaian kisebb, hatékony újratervezése. Fontosak, hogy megmutassák, hogyan lehet jóval kevesebb paraméterrel nagy pontosságot elérni, ami ideális a telepítéshez.
Milyen kulcsfontosságú innováció teszi lehetővé, hogy a QuartzNet sokkal kevesebb paramétert használjon, mint a Jasper?
A QuartzNet a szabványos konvolúciókat időcsatornánként szétválasztható konvolúciókkal helyettesíti, drasztikusan csökkentve a paraméterek számát, miközben megőrzi a pontosságot.
A QuartzNetnek nagyjából hány paramétere van Jasper ~333 milliójához képest?
A QuartzNet nagyjából 19 millió paraméterre zsugorodik, ami körülbelül 17-szeres csökkenés, miközben megfelel a Jasper Librispeech pontosságának.
Melyik cég fejlesztette ki a Jaspert és a QuartzNet-et is?
Mindkét modellt az NVIDIA fejlesztette ki, és a NeMo párbeszédes AI eszközkészletén keresztül terjesztik.
Milyen veszteségfüggvényt használ a Jasper és a QuartzNet az explicit igazítások nélküli edzéshez?
Mindkettő CTC-vesztést használ, amely a változó hosszúságú hangot a karaktersorozatokhoz igazítja anélkül, hogy képkockánkénti címkéket igényelne.
Milyen szerkezeti jellemzők segítik a gradiensek átáramlását Jasper nagyon mély (akár 54 rétegű) hálózatán?
A Jasper sűrű maradék (kihagyó) kapcsolatokat használ, így a színátmenetek tisztán terjednek a mély konvolúciós veremben.