Jasper і QuartzNet ASR
Jasper і QuartzNet — це наскрізні моделі згорткового розпізнавання мовлення від NVIDIA, причому QuartzNet є значно меншою та ефективнішою моделлю Jasper.
Огляд
They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.
Глибоке занурення
Jasper (Just Another Speech Recognizer), випущений NVIDIA у 2019 році, є глибокою 1D згортковою мережею до 54 шарів, яка відображає функції мел-спектрограми на символи за допомогою втрати CTC. Він представив щільні залишкові зв’язки, тому градієнти чітко проходять через дуже глибокі стеки. QuartzNet, випущений того ж року, зберіг блочну структуру Джаспера, але замінив стандартні згортки згортками, що відокремлюються від часового каналу, розділяючи кожен фільтр на глибинну часову згортку та поточковий етап змішування каналів. Ця факторізація скоротила параметри з приблизно 333 мільйонів Джаспера до приблизно 19 мільйонів, зрівнявшись із точністю на Librispeech. Обидва поставляються в наборі інструментів NeMo від NVIDIA та налаштовані на швидке навчання графічного процесора та висновки в реальному часі, що робить їх популярними будівельними блоками для робочого ASR.
Технічне розуміння
Ефективність QuartzNet полягає в згортках, які можна розділити на часові канали, та сама ідея MobileNet. Звичайна одновимірна згортка змішує час і канали разом, що коштує K помножених на C-in помножених на C-out ваги. Розділення його на згортку по глибині в часі плюс поточкову згортку 1x1 по каналам зменшує параметри до K, помножених на C, плюс C-in, помножених на C-out. Зібрані в залишкові блоки та навчені за допомогою CTC, це дає точність, близьку до Jasper, за частки розміру моделі та обчислень.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє Jasper і QuartzNet ASR
Лінія роздільної згортки QuartzNet привела безпосередньо до Citrinet від NVIDIA та широко використовуваних моделей Conformer, які додають увагу до себе для захоплення глобального контексту разом із локальними згортками. Очікуйте продовження руху до гібридної архітектури згортки плюс уваги та декодерів перетворювача (RNN-T) для потокової передачі. Основний урок, ефективні згортки параметрів для периферійного розгортання та розгортання в реальному часі, залишається центральним, оскільки ASR натискає на телефони, автомобілі та вбудовані пристрої.
Реалізація в реальному світі
Транскрипція в реальному часі та голосові помічники, розгорнуті на графічних процесорах NVIDIA за допомогою інструментарію NeMo
Edge і вбудований ASR, де QuartzNet невеликий розмір підходить для пристроїв з обмеженою пам'яттю
Точне налаштування попередньо навчених контрольних точок QuartzNet для предметних словників, таких як медичні або юридичні терміни
Аналітика колл-центру транскрибує великі обсяги аудіо швидко та економічно ефективно
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jasper and QuartzNet ASR quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Згортковий ASR Wav2Letter
Часті запитання
What is Jasper and QuartzNet ASR?
Jasper і QuartzNet — це наскрізні моделі згорткового розпізнавання мовлення від NVIDIA, причому QuartzNet є значно меншою та ефективнішою моделлю Jasper. Вони важливі для того, щоб показати, як отримати високу точність із значно меншою кількістю параметрів, що ідеально підходить для розгортання.
Яке ключове нововведення дозволяє QuartzNet використовувати набагато менше параметрів, ніж Jasper?
QuartzNet замінює стандартні згортки згортками, які можна розділити за часовим каналом, різко скорочуючи кількість параметрів, зберігаючи при цьому точність.
Приблизно скільки параметрів має QuartzNet порівняно з ~333 мільйонами Jasper?
QuartzNet скорочується приблизно до 19 мільйонів параметрів, тобто приблизно в 17 разів, і відповідає точності Librispeech Джаспера.
Яка компанія розробила Jasper і QuartzNet?
Обидві моделі були розроблені компанією NVIDIA та поширюються через її набір розмовних штучних інтелектів NeMo.
Яку функцію втрат використовують Jasper і QuartzNet для навчання без явного вирівнювання?
Обидва використовують втрату CTC, яка вирівнює аудіо змінної довжини з послідовністю символів, не вимагаючи міток для кожного кадру.
Яка структурна особливість допомагає градієнтам проходити через дуже глибоку (до 54 шарів) мережу Jasper?
Jasper використовує щільні залишкові (пропускаючі) з’єднання, тому градієнти чітко поширюються через його глибокий згортковий стек.