PANDUAN Audio AI

Jasper dan QuartzNet ASR

Jasper dan QuartzNet adalah model pengenalan suara konvolusional end-to-end dari NVIDIA, dengan QuartzNet merupakan desain ulang Jasper yang jauh lebih kecil dan efisien.

2 min readTerakhir diperbarui

Ikhtisar

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Menyelam Lebih Dalam

Jasper (Just Another Speech Recognizer), dirilis oleh NVIDIA pada tahun 2019, adalah jaringan konvolusional 1D yang dalam, hingga 54 lapisan, yang memetakan fitur mel-spektogram ke karakter menggunakan kerugian CTC. Ini memperkenalkan koneksi sisa yang padat sehingga gradien mengalir dengan bersih melalui tumpukan yang sangat dalam. QuartzNet, dirilis pada tahun yang sama, mempertahankan struktur blok Jasper tetapi mengganti konvolusi standar dengan konvolusi saluran waktu yang dapat dipisahkan, membagi setiap filter menjadi konvolusi temporal yang mendalam dan langkah pencampuran saluran yang tepat. Faktorisasi ini memangkas parameter Jasper dari sekitar 333 juta menjadi sekitar 19 juta sambil mencocokkan akurasi pada Librispeech. Keduanya dikirimkan dalam toolkit NeMo NVIDIA dan disetel untuk pelatihan GPU cepat dan inferensi real-time, menjadikannya blok bangunan yang populer untuk produksi ASR.

Wawasan Teknis

Efisiensi QuartzNet berasal dari konvolusi saluran waktu yang dapat dipisahkan, ide yang sama di balik MobileNet. Konvolusi 1D normal menggabungkan waktu dan saluran, menghabiskan biaya K kali C-in kali C-out bobot. Memisahkannya menjadi konvolusi mendalam dari waktu ke waktu ditambah konvolusi titik 1x1 pada saluran mengurangi parameter menjadi K kali C ditambah C-in dikali C-out. Ditumpuk dalam blok sisa dan dilatih dengan CTC, hal ini memberikan akurasi mendekati Jasper dengan ukuran model dan komputasi yang sangat kecil.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Jasper dan QuartzNet ASR

Silsilah konvolusi terpisah QuartzNet mengarah langsung ke Citrinet NVIDIA dan model Conformer yang banyak digunakan, yang menambah perhatian untuk menangkap konteks global bersama dengan konvolusi lokal. Harapkan pergerakan berkelanjutan menuju arsitektur hybrid convolution-plus-attention dan decoder transduser (RNN-T) untuk streaming. Pembelajaran inti, yaitu konvolusi yang efisien terhadap parameter untuk penerapan edge dan real-time, tetap menjadi inti seiring penerapan ASR pada ponsel, mobil, dan perangkat tertanam.

Implementasi Dunia Nyata

Transkripsi real-time dan asisten suara diterapkan pada GPU NVIDIA melalui toolkit NeMo

Edge dan ASR tertanam di mana ukuran kecil QuartzNet cocok dengan perangkat dengan memori terbatas

Menyempurnakan pos pemeriksaan QuartzNet yang telah dilatih sebelumnya untuk kosakata khusus domain seperti istilah medis atau hukum

Analisis pusat panggilan yang menyalin audio dalam jumlah besar dengan cepat dan hemat biaya

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ASR Konvolusional Wav2Letter

Pertanyaan yang sering diajukan

What is Jasper and QuartzNet ASR?

Jasper dan QuartzNet adalah model pengenalan suara konvolusional end-to-end dari NVIDIA, dengan QuartzNet merupakan desain ulang Jasper yang jauh lebih kecil dan efisien. Hal ini penting untuk menunjukkan cara mendapatkan akurasi yang kuat dengan parameter yang jauh lebih sedikit, sehingga ideal untuk penerapan.

Inovasi utama apa yang memungkinkan QuartzNet menggunakan parameter yang jauh lebih sedikit dibandingkan Jasper?

QuartzNet menggantikan konvolusi standar dengan konvolusi saluran waktu yang dapat dipisahkan, secara drastis memotong jumlah parameter sambil menjaga akurasi.

Kira-kira berapa banyak parameter yang dimiliki QuartzNet dibandingkan dengan ~333 juta milik Jasper?

QuartzNet menyusut menjadi sekitar 19 juta parameter, sekitar 17x pengurangan, sekaligus menyamai akurasi Librispeech Jasper.

Perusahaan mana yang mengembangkan Jasper dan QuartzNet?

Kedua model tersebut dikembangkan oleh NVIDIA dan didistribusikan melalui perangkat AI percakapan NeMo.

Fungsi kerugian apa yang digunakan Jasper dan QuartzNet untuk berlatih tanpa penyelarasan eksplisit?

Keduanya menggunakan kerugian CTC, yang menyelaraskan audio dengan panjang variabel ke urutan karakter tanpa memerlukan label per frame.

Fitur struktural apa yang membantu aliran gradien melalui jaringan Jasper yang sangat dalam (hingga 54 lapisan)?

Jasper menggunakan koneksi sisa (lewati) yang padat sehingga gradien menyebar dengan rapi melalui tumpukan konvolusionalnya yang dalam.