РЪКОВОДСТВО за визуален AI

Прогресивно нарастване на GAN

Прогресивното отглеждане обучава GAN, като започва с малки разделителни способности и постепенно добавя слоеве, за да достигне изображения с висока разделителна способност.

2 min readПоследна актуализация

Преглед

It matters because it made stable, megapixel-quality GAN synthesis practical for the first time.

Дълбоко гмуркане

Въведено от Karras et al. (NVIDIA) през 2017 г., прогресивното нарастване (ProGAN) се справя с нестабилността и бавното обучение на GAN директно при висока резолюция. И генераторът, и дискриминаторът започват с малки размери, при 4x4 пиксела, заучавайки само мащабна структура. След това нови слоеве, които удвояват разделителната способност (8x8, 16x16, до 1024x1024), се добавят симетрично към двете мрежи в хода на обучението. Най-важното е, че всеки нов слой се избледнява плавно, като се използва линейна алфа смес, така че мрежата да не бъде шокирана от рязка архитектурна промяна. Чрез научаване на грубите черти преди фините детайли, обучението е по-стабилно, сближава се по-бързо и създава висококачествени лица, които направиха резултатите на CelebA-HQ известни. Документът също така въведе стандартно отклонение на минипартиди и изравнени скорости на обучение за по-нататъшно стабилизиране на обучението.

Техническа информация

Затихването е основният трик. Когато се добави блок с по-висока разделителна способност, неговият изход се смесва с увеличена версия на предишната разделителна способност, като се използва алфа на теглото, което се променя от 0 до 1. Това позволява на теглата на новите слоеве да се затоплят постепенно, вместо да нарушава това, което мрежата вече е научила. В дискриминатора протича симетричен процес. Стандартното отклонение на минипартидите добавя функция, обобщаваща вариациите на партидите, обезсърчавайки генератора да се срине до ограничени изходи.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на прогресивното разрастване на GAN

Прогресивното разрастване беше основата, върху която се гради StyleGAN, но StyleGAN2 по-късно показа, че фиксирана архитектура с прескачащи връзки и остатъчни блокове може да отговаря на качеството си без поетапния график, така че явното разрастване изпадна в немилост. По-дълбокото наследство продължава: генерирането от грубо към фино сега се появява в многомащабна дифузия, каскадни тръбопроводи със супер разделителна способност и ъпскейлери в латентно пространство. Разбирането на прогресивното израстване остава ценно за разбиране защо йерархичното обучение с ниска към висока честота стабилизира генеративното обучение.

Внедряване в реалния свят

Създаване на изображения на лицето CelebA-HQ с висока разделителна способност, които демонстрират 1024x1024 GAN синтез.

Генериране на висококачествени проби от други домейни като спални (LSUN) и обекти в мащаб.

Служи като архитектурна отправна точка, която StyleGAN разшири за генериране на управляемо лице.

Преподаване на принципа на обучение от грубо към фино, използван повторно в каскадни и многомащабни генеративни тръбопроводи.

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Progressive Growing of GANs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Условни GAN

Frequently asked questions

What is Progressive Growing of GANs?

Прогресивното отглеждане обучава GAN, като започва с малки разделителни способности и постепенно добавя слоеве, за да достигне изображения с висока разделителна способност. Има значение, защото направи стабилен GAN синтез с качество на мегапиксела практичен за първи път.

Как един прогресивно пораснал GAN започва обучение?

Обучението започва от 4x4, където мрежите научават груба структура, преди да се добавят слоеве с по-висока разделителна способност.

Каква е основната полза от постепенното нарастване на резолюцията?

Изучаването на груби функции първо стабилизира обучението и ускорява конвергенцията в сравнение с атакуването на пълна разделителна способност от самото начало.

Когато се добави нов слой с по-висока разделителна способност, как се въвежда?

Линейното затихване смесва изхода на новия слой с увеличен изход с по-ниска разделителна способност, така че мрежата да се адаптира постепенно.

Защо се добавят слоеве както към генератора, така и към дискриминатора?

И двете мрежи растат в тандем, така че дискриминаторът може да продължи да оценява изображенията при текущата разделителна способност на генератора.

Каква е целта на слоя със стандартно отклонение за минипартиди, въведен в ProGAN?

Той добавя статистика за вариациите на партидите, насърчавайки генератора да произвежда различни резултати, вместо да се срива.