Аудио AI РЪКОВОДСТВО

Jasper и QuartzNet ASR

Jasper и QuartzNet са моделите от край до край на NVIDIA за конволюционно разпознаване на реч, като QuartzNet е драстично по-малък, ефективен редизайн на Jasper.

2 min readПоследна актуализация

Преглед

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Дълбоко гмуркане

Jasper (Just Another Speech Recognizer), пуснат от NVIDIA през 2019 г., е дълбока 1D конволюционна мрежа, до 54 слоя, която картографира характеристиките на мел-спектрограмата към знаци, използвайки CTC загуба. Той въведе плътни остатъчни връзки, така че градиентите протичат чисто през много дълбоки стекове. QuartzNet, пуснат през същата година, запази блоковата структура на Jasper, но замени стандартните навивки с навивки, отделими от времеви канали, разделяйки всеки филтър на времева навивка в дълбочина и стъпка на смесване на канали по точки. Тази факторизация намали параметрите от приблизително 333 милиона на Jasper до около 19 милиона, като същевременно съпостави точността на Librispeech. И двата се доставят в NeMo инструментариума на NVIDIA и са настроени за бързо обучение на GPU и изводи в реално време, което ги прави популярни градивни елементи за производствен ASR.

Техническа информация

Ефективността на QuartzNet идва от отделими навивки на времеви канали, същата идея зад MobileNet. Нормалната 1D конволюция смесва времето и каналите заедно, струвайки K пъти C-in пъти C-out тегла. Разделянето му на дълбочинна намотка във времето плюс 1x1 поточкова намотка по каналите намалява параметрите до K по C плюс C-in по C-out. Подредени в остатъчни блокове и обучени с CTC, това дава точност, близка до Jasper, при част от размера на модела и изчислението.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на Jasper и QuartzNet ASR

Линията на QuartzNet с разделяща се навивка доведе директно до Citrinet на NVIDIA и широко използваните модели Conformer, които добавят внимание към себе си, за да уловят глобалния контекст заедно с локалните навивки. Очаквайте непрекъснато движение към хибридни архитектури с конволюция плюс внимание и декодери на преобразуватели (RNN-T) за поточно предаване. Основният урок, ефективни от параметри конволюции за крайно внедряване и внедряване в реално време, остава централен, докато ASR навлиза в телефони, автомобили и вградени устройства.

Внедряване в реалния свят

Транскрипция в реално време и гласови асистенти, внедрени на NVIDIA GPU чрез инструментариума NeMo

Edge и вграден ASR, където малкият отпечатък на QuartzNet пасва на устройства с ограничена памет

Фина настройка на предварително обучени контролни точки на QuartzNet за специфични за домейна речници като медицински или юридически термини

Анализ на кол-центъра, транскрибиращ големи обеми аудио бързо и рентабилно

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Wav2Letter Convolutional ASR

Frequently asked questions

What is Jasper and QuartzNet ASR?

Jasper и QuartzNet са моделите от край до край на NVIDIA за конволюционно разпознаване на реч, като QuartzNet е драстично по-малък, ефективен редизайн на Jasper. Те имат значение, защото показват как да получите висока точност с много по-малко параметри, идеални за внедряване.

Коя ключова иновация позволява на QuartzNet да използва много по-малко параметри от Jasper?

QuartzNet заменя стандартните навивки с навивки, отделящи се от времеви канали, като драстично намалява броя на параметрите, като същевременно запазва точността.

Приблизително колко параметри има QuartzNet в сравнение с ~333 милиона на Jasper?

QuartzNet се свива до приблизително 19 милиона параметъра, около 17 пъти намаление, като същевременно съответства на точността на Librispeech на Jasper.

Коя компания разработи Jasper и QuartzNet?

И двата модела са разработени от NVIDIA и се разпространяват чрез нейния инструментариум NeMo за разговорен AI.

Каква функция за загуба използват Jasper и QuartzNet за обучение без изрично подравняване?

И двата използват CTC загуба, която подравнява аудио с променлива дължина към последователности от знаци, без да изисква етикети за кадър.

Коя структурна характеристика помага на градиентите да преминават през много дълбоката (до 54 слоя) мрежа на Jasper?

Jasper използва плътни остатъчни (пропускащи) връзки, така че градиентите се разпространяват чисто през неговия дълбок конволюционен стек.