Візуальний AI GUIDE

ESRGAN і GAN Super-Resolution

ESRGAN використовує змагання «генератор проти дискримінатора», щоб створити реалістичні деталі під час масштабування зображень, виходячи за межі розмитої інтерполяції.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it set the template for photo-realistic super-resolution that still influences tools today.

Глибоке занурення

ESRGAN (Enhanced Super-Resolution Generative Adversarial Network), представлений у 2018 році, покращив попередню SRGAN. У ньому використовується генератор, побудований із щільних блоків із залишковим вмістом (RRDB), які накопичують багато щільних з’єднань без пакетної нормалізації, що, як виявили автори, спричинило артефакти. Окрема мережа дискримінаторів намагається відрізнити справжні фотографії високої роздільної здатності від згенерованих, змушуючи генератор галюцинувати переконливі текстури, такі як волосся, цегла та листя. ESRGAN поєднує в собі три втрати: втрату піксельного вмісту, втрату сприйняття, виміряну на картах функцій VGG перед активацією, і втрату змагання. Він також представив «релятивістський» дискримінатор, який визначає, чи реальні зображення виглядають більш реалістичними, ніж підроблені, покращуючи навчання. ESRGAN переміг у 2018 році в конкурсі PIRM на сприйняття суперроздільності.

Технічне розуміння

Ключова ідея полягає в обміні точності пікселів на реалізм сприйняття. Втрати пікселів, такі як MSE, середні для правдоподібних текстур, що забезпечує плавний розмитий результат. Змагальна втрата натомість змушує виводити на безліч реальних зображень, тому генератор зобов’язується створити одну чітку, правдоподібну текстуру. Релятивістський середній дискримінатор ESRGAN оцінює, наскільки справжній патч реалістичніший за підроблений, який передає більше градієнтної інформації та створює чіткіші краї, ніж стандартний дискримінатор.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє ESRGAN і GAN Super-Resolution

Чиста супер-роздільна здатність GAN все частіше поєднується з магістралями трансформаторів і розсіювачами масштабування на основі дифузії, які забезпечують більш стабільне навчання та точніший контроль. Тим не менш, генератор RRDB від ESRGAN і рецепт сприйняття плюс змагальність залишаються сильною, легкою базовою лінією, вбудованою в незліченні модифікації ігрових текстур і інструменти для фотографій. Очікуйте гібридних моделей, які зберігають різкість GAN, запозичуючи різноманітність дифузії та контекст трансформаторів на великі відстані, а також більш жорстке розгортання на пристрої для масштабування в реальному часі.

Реалізація в реальному світі

Масштабування текстур із низькою роздільною здатністю у модифікаціях відеоігор (популярно в спільноті модифікаторів «AI Upscale» для старіших ігор для ПК)

Поліпшення старих сімейних фотографій або відсканованих зображень перед друком у більших розмірах

Покращення фотографій, витягнутих з архіву з низькою роздільною здатністю або записів відеоспостереження

Створення текстурних карт високої роздільної здатності для 3D-художників, які працюють із невеликими опорними зображеннями

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ESRGAN and GAN Super-Resolution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Надроздільна здатність зображення

Часті запитання

What is ESRGAN and GAN Super-Resolution?

ESRGAN використовує змагання «генератор проти дискримінатора», щоб створити реалістичні деталі під час масштабування зображень, виходячи за межі розмитої інтерполяції. Це важливо, тому що воно заклало шаблон для фотореалістичної суперроздільності, яка все ще впливає на інструменти сьогодні.

Що означає «GAN» у ESRGAN?

GAN означає Generative Adversarial Network, установку, у якій генератор і дискримінатор змагаються під час навчання.

Який будівельний блок в основному використовує генератор ESRGAN?

Генератор ESRGAN утримує щільні блоки залишку в залишку (RRDB), щільно з’єднані залишкові одиниці, як свою основну структуру.

Чому автори ESRGAN видалили пакетну нормалізацію з генератора?

Автори виявили, що пакетна нормалізація спричиняє неприємні артефакти у виводі з надвисокою роздільною здатністю, тому вони видалили його з блоків RRDB.

Який основний компроміс робить ESRGAN порівняно з методами лише втрати пікселів?

Змагальна втрата підштовхує результат до реалістичних текстур, навіть якщо значення окремих пікселів відрізняються від реальних.

Де вимірюється перцептивна втрата ESRGAN (VGG)?

ESRGAN обчислює втрати сприйняття на картах функцій VGG перед функцією активації, яка, як виявили автори, дала чіткіші результати.