PANDUAN AI Audio

Jasper dan QuartzNet ASR

Jasper dan QuartzNet ialah model pengecaman pertuturan konvolusi hujung ke hujung NVIDIA, dengan QuartzNet menjadi reka bentuk semula Jasper yang lebih kecil dan cekap secara dramatik.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Menyelam dalam

Jasper (Just Another Speech Recognizer), dikeluarkan oleh NVIDIA pada 2019, ialah rangkaian konvolusi 1D yang mendalam, sehingga 54 lapisan, yang memetakan ciri mel-spektrogram kepada aksara menggunakan kehilangan CTC. Ia memperkenalkan sambungan sisa padat supaya kecerunan mengalir dengan bersih melalui susunan yang sangat dalam. QuartzNet, dikeluarkan pada tahun yang sama, mengekalkan struktur blok Jasper tetapi menggantikan lilitan standard dengan lilitan boleh dipisahkan saluran masa, membelah setiap penapis kepada lilitan temporal secara mendalam dan langkah mencampurkan saluran mengikut arah. Pemfaktoran ini mengurangkan parameter daripada kira-kira 333 juta Jasper kepada sekitar 19 juta sambil memadankan ketepatan pada Librispeech. Kedua-dua dihantar dalam kit alat NeMo NVIDIA dan ditala untuk latihan GPU pantas dan inferens masa nyata, menjadikannya blok binaan popular untuk pengeluaran ASR.

Wawasan Teknikal

Kecekapan QuartzNet datang daripada lilitan boleh dipisahkan saluran masa, idea yang sama di sebalik MobileNet. Konvolusi 1D biasa mencampurkan masa dan saluran bersama-sama, menelan kos K kali C-in kali C-out pemberat. Mengasingkannya menjadi lilitan mendalam dari masa ke masa ditambah lilitan 1x1 arah ke atas saluran mengurangkan parameter kepada K kali C campur C-in kali C-out. Ditindan dalam blok sisa dan dilatih dengan CTC, ini memberikan ketepatan hampir Jasper pada sebahagian kecil daripada saiz model dan pengiraan.

Kesan Strategik

Akses dan capai

Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.

Kos dan bajet

Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.

Kelajuan dan skala

Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.

Masa Depan Jasper dan QuartzNet ASR

Garis keturunan boleh dipisahkan-konvolusi QuartzNet membawa terus kepada NVIDIA's Citrinet dan model Conformer yang digunakan secara meluas, yang menambah perhatian diri untuk menangkap konteks global bersama-sama konvolusi tempatan. Jangkakan pergerakan berterusan ke arah seni bina konvolusi-tambah-perhatian hibrid dan penyahkod transduser (RNN-T) untuk penstriman. Pelajaran teras, konvolusi cekap parameter untuk penggunaan tepi dan masa nyata, kekal penting apabila ASR menolak ke telefon, kereta dan peranti terbenam.

Pelaksanaan Dunia Sebenar

Transkripsi masa nyata dan pembantu suara yang digunakan pada GPU NVIDIA melalui kit alat NeMo

Edge dan ASR terbenam di mana jejak kecil QuartzNet sesuai dengan peranti yang dikekang memori

Memperhalusi pusat pemeriksaan QuartzNet terlatih untuk perbendaharaan kata khusus domain seperti istilah perubatan atau undang-undang

Analitis pusat panggilan menyalin volum besar audio dengan cepat dan kos efektif

Risiko & Pengawal

Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.

Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.

Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.

Hala Tuju Pelaksanaan

1

Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.

2

Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.

3

Tentukan bila manusia mesti menyemak atau meluluskan output.

4

Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Wav2Letter Convolutional ASR

Soalan lazim

What is Jasper and QuartzNet ASR?

Jasper dan QuartzNet ialah model pengecaman pertuturan konvolusi hujung ke hujung NVIDIA, dengan QuartzNet menjadi reka bentuk semula Jasper yang lebih kecil dan cekap secara dramatik. Mereka penting untuk menunjukkan cara mendapatkan ketepatan yang kuat dengan parameter yang jauh lebih sedikit, sesuai untuk penggunaan.

Apakah inovasi utama yang membolehkan QuartzNet menggunakan parameter yang jauh lebih sedikit daripada Jasper?

QuartzNet menggantikan lilitan standard dengan lilitan boleh dipisahkan saluran masa, memotong kiraan parameter secara drastik sambil mengekalkan ketepatan.

Kira-kira berapa banyak parameter QuartzNet berbanding dengan Jasper ~333 juta?

QuartzNet mengecut kepada kira-kira 19 juta parameter, kira-kira pengurangan 17x, sambil memadankan ketepatan Librispeech Jasper.

Syarikat manakah yang membangunkan Jasper dan QuartzNet?

Kedua-dua model dibangunkan oleh NVIDIA dan diedarkan melalui kit alat AI perbualan NeMo.

Apakah fungsi kehilangan yang Jasper dan QuartzNet gunakan untuk melatih tanpa penjajaran yang jelas?

Kedua-duanya menggunakan kehilangan CTC, yang menjajarkan audio panjang berubah-ubah kepada jujukan aksara tanpa memerlukan label setiap bingkai.

Apakah ciri struktur yang membantu kecerunan mengalir melalui rangkaian Jasper yang sangat dalam (sehingga 54 lapisan)?

Jasper menggunakan sambungan sisa padat (langkau) supaya kecerunan merambat dengan bersih melalui timbunan konvolusinya yang dalam.