РЪКОВОДСТВО за визуален AI

ESRGAN и GAN Super-Resolution

ESRGAN използва състезание генератор срещу дискриминатор, за да измисли реалистични детайли при мащабиране на изображения, надхвърляйки замъглената интерполация.

2 min readПоследна актуализация

Преглед

It matters because it set the template for photo-realistic super-resolution that still influences tools today.

Дълбоко гмуркане

ESRGAN (Enhanced Super-Resolution Generative Adversarial Network), въведен през 2018 г., е подобрен на по-ранния SRGAN. Той използва генератор, изграден от плътни блокове Residual-in-Residual Dense Blocks (RRDB), които подреждат много плътни връзки без партидна нормализация, което според авторите причинява артефакти. Отделна дискриминаторна мрежа се опитва да различи истински снимки с висока разделителна способност от генерирани, като натиска генератора да халюцинира убедителни текстури като коса, тухла и зеленина. ESRGAN съчетава три загуби: загуба на пикселно съдържание, перцептивна загуба, измерена на картите на VGG функции преди активирането, и противопоставителна загуба. Той също така въведе „релативистичен“ дискриминатор, който преценява дали реалните изображения изглеждат по-реалистични от фалшивите, като подобри обучението. ESRGAN спечели предизвикателството за перцептивна супер разделителна способност PIRM за 2018 г.

Техническа информация

Ключовата идея е замяна на точността на пикселите за перцептуален реализъм. Загубите на пиксели като MSE са осреднени за правдоподобни текстури, давайки плавен, размазан изход. Противоположната загуба вместо това принуждава изхода към множеството реално изглеждащи изображения, така че генераторът се ангажира с една рязка, правдоподобна текстура. Релативистичният среден дискриминатор на ESRGAN оценява колко по-реалистичен е истинският пластир от фалшивия, който предава повече градиентна информация и създава по-ясни ръбове от стандартния дискриминатор.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на ESRGAN и GAN Super-Resolution

Чистата супер-разделителна способност на GAN все повече се смесва с или се заменя с трансформаторни опори и базирани на дифузия ъпскейлери, които предлагат по-стабилно обучение и по-фин контрол. И все пак генераторът на RRDB на ESRGAN и рецептата за възприемане плюс съперничество остават силна, лека базова линия, вградена в безброй модификации на игрални текстури и инструменти за снимки. Очаквайте хибридни модели, които запазват остротата на GAN, като същевременно заимстват разнообразието на дифузията и дългосрочния контекст на трансформаторите, както и по-стриктно внедряване на устройството за мащабиране в реално време.

Внедряване в реалния свят

Увеличаване на текстури с ниска разделителна способност в модификации на видеоигри (популярно в общността за модифициране „AI Upscale“ за по-стари компютърни заглавия)

Подобряване на стари семейни снимки или сканирани изображения преди отпечатване в по-големи размери

Подобряване на неподвижни изображения, извлечени от архив с ниска разделителна способност или запис от наблюдение

Генериране на текстурни карти с висока разделителна способност за 3D артисти, работещи от малки референтни изображения

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ESRGAN and GAN Super-Resolution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Супер разделителна способност на изображението

Frequently asked questions

What is ESRGAN and GAN Super-Resolution?

ESRGAN използва състезание генератор срещу дискриминатор, за да измисли реалистични детайли при мащабиране на изображения, надхвърляйки замъглената интерполация. Има значение, защото задава шаблона за фотореалистична супер разделителна способност, която все още влияе на инструментите днес.

Какво означава „GAN“ в ESRGAN?

GAN означава Generative Adversarial Network, настройка, при която генератор и дискриминатор се състезават по време на обучение.

Какъв градивен елемент използва основно генераторът ESRGAN?

Генераторът на ESRGAN подрежда остатъчно-в-остатъчните плътни блокове (RRDB), плътно свързани остатъчни единици, като своя основна структура.

Защо авторите на ESRGAN премахнаха партидната нормализация от генератора?

Авторите откриха, че партидната нормализация създава неприятни артефакти в изхода със супер разделителна способност, така че го премахнаха от блоковете RRDB.

Какъв е основният компромис, който прави ESRGAN в сравнение с методите само за загуба на пиксели?

Конфликтната загуба тласка изхода към реалистично изглеждащи текстури, дори ако стойностите на отделните пиксели се различават от основната истина.

Къде се измерва перцептивната загуба на ESRGAN (VGG)?

ESRGAN изчислява загубата на възприятие върху картите на функциите на VGG преди функцията за активиране, която според авторите дава по-ясни резултати.