MelGAN Generative Vocoder
MelGAN е напълно конволюционен GAN-базиран вокодер, който превръща мел-спектрограмите в необработени аудио вълни с едно бързо преминаване напред.
Преглед
It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.
Дълбоко гмуркане
MelGAN, въведен от Kumar et al. през 2019 г. генерира аудио без бавния цикъл проба по проба, използван от WaveNet. Неговият генератор е стек от транспонирани навивки, които преобразуват мел-спектрограма (обикновено 80 честотни ленти) до честотата на аудио дискретизация, с остатъчни блокове, използващи разширени навивки за разширяване на възприемчивото поле. Ключовото нововъведение беше обучение с множество дискриминатори, работещи на различни звукови скали (оригиналната форма на вълната плюс намалени версии), като всеки разглежда припокриващи се прозорци. Загубата на съвпадение на функции сравнява активирането на дискриминатора между реално и фалшиво аудио, стабилизирайки обучението на GAN. Моделът е малък по стандартите за невронен звук и работи по-бързо от реално време дори на CPU, което го прави практичен за вграден текст в говор и в устройството.
Техническа информация
Многомащабният дискриминатор на MelGAN използва три идентични мрежи, разглеждащи аудиото при пълна, половин и четвърт резолюция, като всяка улавя структура в различни честотни диапазони. Най-важното е, че MelGAN разчита на загуба на съпоставяне на характеристиките (разстояние L1 между картите на характеристиките на дискриминатора на реално спрямо генерирано аудио), а не на явна загуба на реконструкция на спектрограма, което насърчава генератора да съпостави статистическите данни на истинското аудио слой по слой.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на MelGAN Generative Vocoder
MelGAN постави началото на семейство вокодери GAN. Неговите наследници, HiFi-GAN и UnivNet, запазиха бързия неавторегресивен подход, но добавиха многопериодни и мулти-резолюционни дискриминатори за по-чисти високи честоти. Архитектурата продължава да съществува в TTS на устройството и при поточно предаване, където латентността и размерът на модела имат значение, а нейните дискриминаторни идеи продължават да влияят върху невронните кодеци и системите за генериране на музика, където състезателното обучение подобрява качеството на възприемане.
Внедряване в реалния свят
Преобразуване на текст в говор на устройството в мобилните асистенти, където малък, бърз вокодер избягва двупосочните пътувания в облака
Тръбопроводи за преобразуване на глас в реално време, които преобразуват мелспектрограмата на говорещия в целеви глас
Инструменти за игри и анимация, които синтезират диалог с герои от генерирани спектрограми с ниска латентност
Базови линии за изследване на аудио GAN, където загубата на съвпадение на функции на MelGAN се използва повторно за генериране на музика и звукови ефекти
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MelGAN Generative Vocoder quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Дифузионен вокодер DiffWave
Frequently asked questions
What is MelGAN Generative Vocoder?
MelGAN е напълно конволюционен GAN-базиран вокодер, който превръща мел-спектрограмите в необработени аудио вълни с едно бързо преминаване напред. Имаше значение, защото доказа, че висококачественият, неавторегресивен синтез на реч може да работи стотици пъти по-бързо от реално време на GPU.
Какъв вход преобразува MelGAN в необработена аудио вълна?
MelGAN е вокодер: той приема представяне на акустична характеристика, мел-спектрограмата, и синтезира съответната форма на вълната.
Защо MelGAN е много по-бърз от WaveNet при извод?
WaveNet генерира проби една по една авторегресивно; Конволюционният генератор на MelGAN произвежда цялата форма на вълната в едно паралелно преминаване напред.
Какъв отличителен дизайн на дискриминатора представи MelGAN?
MelGAN използва множество идентични дискриминатори, които изследват оригиналната вълнова форма и намалени версии, за да уловят структурата в различни мащаби.
Коя загуба помага да се стабилизира състезателното обучение на MelGAN?
Загубата на съвпадение на функции минимизира разстоянието L1 между картите на характеристиките на дискриминатора за реално и генерирано аудио, насочвайки генератора и стабилизирайки обучението.
Как генераторът на MelGAN увеличава своето възприемчиво поле?
Остатъчните блокове с разширени навивки разширяват ефективно възприемчивото поле, позволявайки на генератора да моделира дългосрочна времева структура.