Audio AI ÚTMUTATÓ

Jasper és QuartzNet ASR

A Jasper és a QuartzNet az NVIDIA végpontok közötti konvolúciós beszédfelismerő modelljei, a QuartzNet pedig a Jasper drámaian kisebb, hatékony újratervezése.

2 perc olvasásUtoljára frissítve

Áttekintés

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Mély merülés

A Jasper (Just Another Speech Recognizer), amelyet az NVIDIA 2019-ben adott ki, egy mély 1D konvolúciós hálózat, akár 54 rétegből is, amely a mel-spektrogram jellemzőit CTC-vesztést használó karakterekhez rendeli hozzá. Sűrű maradék kapcsolatokat vezetett be, így a gradiensek tisztán folynak át nagyon mély kötegeken. Az ugyanabban az évben kiadott QuartzNet megtartotta a Jasper blokkstruktúráját, de a szabványos konvolúciókat időcsatornánként szétválasztható konvolúciókra cserélte, minden szűrőt felosztott egy mélységi időbeli konvolúcióra és egy pontszerű csatornakeverési lépésre. Ez a faktorizálás a paramétereket Jasper nagyjából 333 milliójáról körülbelül 19 millióra csökkentette, miközben a Librispeech pontossága megfelelt. Mindkettőt az NVIDIA NeMo eszközkészletében szállítjuk, és gyors GPU-tanításra és valós idejű következtetésekre hangolják, így népszerű építőkövei az éles ASR-nek.

Technikai betekintés

A QuartzNet hatékonysága az időcsatornánként szétválasztható konvolúciókból fakad, ami a MobileNet mögött is ugyanaz. Egy normál 1D konvolúció keveri az időt és a csatornákat, így a költség K-szer C-be szoroz C-out súlyokkal. Ha szétválasztja egy mélységi konvolúcióra az idő múlásával plusz egy 1x1 pontszerű konvolúciót a csatornákon keresztül, akkor a paraméterek K-szer C-szer plusz C-be- és C-out-szorosra csökkennek. A maradék blokkokban halmozott és CTC-vel betanított, ez közel Jasper pontosságot biztosít a modell méretének és számításának töredékénél.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Jasper és a QuartzNet ASR jövője

A QuartzNet szétválasztható konvolúciós vonala közvetlenül az NVIDIA Citrinetjéhez és a széles körben használt Conformer modellekhez vezetett, amelyek önmagukra is figyelnek a globális kontextus megragadásához a helyi konvolúciók mellett. Folyamatos elmozdulás várható a hibrid konvolúció plusz figyelem architektúrák és transzduceres (RNN-T) dekóderek irányába a streaminghez. Az alapvető lecke, a paraméter-hatékony konvolúciók az éles és a valós idejű telepítéshez, továbbra is központi szerepet tölt be, amikor az ASR rányomódik a telefonokra, autókra és beágyazott eszközökre.

Valós megvalósítás

Valós idejű átírási és hangsegédek az NVIDIA GPU-kon a NeMo eszköztáron keresztül

Edge és beágyazott ASR, ahol a QuartzNet kis helyigénye elfér a korlátozott memóriával rendelkező eszközökön

Előképzett QuartzNet ellenőrzőpontok finomhangolása a tartományspecifikus szókészletekhez, például orvosi vagy jogi kifejezésekhez

Call-center analitika nagy mennyiségű hang gyors és költséghatékony átírására

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Wav2Letter konvolúciós ASR

Gyakran ismételt kérdések

What is Jasper and QuartzNet ASR?

A Jasper és a QuartzNet az NVIDIA végpontok közötti konvolúciós beszédfelismerő modelljei, a QuartzNet pedig a Jasper drámaian kisebb, hatékony újratervezése. Fontosak, hogy megmutassák, hogyan lehet jóval kevesebb paraméterrel nagy pontosságot elérni, ami ideális a telepítéshez.

Milyen kulcsfontosságú innováció teszi lehetővé, hogy a QuartzNet sokkal kevesebb paramétert használjon, mint a Jasper?

A QuartzNet a szabványos konvolúciókat időcsatornánként szétválasztható konvolúciókkal helyettesíti, drasztikusan csökkentve a paraméterek számát, miközben megőrzi a pontosságot.

A QuartzNetnek nagyjából hány paramétere van Jasper ~333 milliójához képest?

A QuartzNet nagyjából 19 millió paraméterre zsugorodik, ami körülbelül 17-szeres csökkenés, miközben megfelel a Jasper Librispeech pontosságának.

Melyik cég fejlesztette ki a Jaspert és a QuartzNet-et is?

Mindkét modellt az NVIDIA fejlesztette ki, és a NeMo párbeszédes AI eszközkészletén keresztül terjesztik.

Milyen veszteségfüggvényt használ a Jasper és a QuartzNet az explicit igazítások nélküli edzéshez?

Mindkettő CTC-vesztést használ, amely a változó hosszúságú hangot a karaktersorozatokhoz igazítja anélkül, hogy képkockánkénti címkéket igényelne.

Milyen szerkezeti jellemzők segítik a gradiensek átáramlását Jasper nagyon mély (akár 54 rétegű) hálózatán?

A Jasper sűrű maradék (kihagyó) kapcsolatokat használ, így a színátmenetek tisztán terjednek a mély konvolúciós veremben.