Візуальний AI GUIDE

VQGAN і синтез зображень кодової книги

VQGAN стискає зображення в сітку окремих токенів, взятих із вивченої кодової книги, дозволяючи трансформатору генерувати зображення так само, як мовні моделі генерують текст.

2 хвилини читанняОстаннє оновлення

Глибоке занурення

VQGAN, представлений у документі 2021 року «Приборкання трансформаторів для синтезу зображень високої роздільної здатності», поєднує в собі векторно-квантований автокодер (VQVAE) із змагальним і перцептивним навчанням. Кодер відображає зображення на невеликій сітці векторів ознак; кожен вектор прив’язується до найближчого запису в вивченій кодовій книзі, скажімо, 1024 дискретних кодів, перетворюючи зображення на послідовність цілочисельних маркерів. Декодер реконструює зображення з цих маркерів, навчених із дискримінатором GAN і втратою сприйняття, тому реконструкції виглядають чіткими, а не розмитими. Оскільки зображення тепер є дискретними послідовностями токенів, авторегресійний трансформатор може моделювати їх як мову, передбачаючи токени один за одним. Відомо, що VQGAN використовував ранні художні інструменти перетворення тексту в зображення в поєднанні з підказками CLIP.

Технічне розуміння

Основною операцією є векторне квантування: безперервні вихідні дані кодувальника замінюються їхніми найближчими векторами кодової книги за допомогою «наскрізного» оцінювача градієнта, щоб кодер все ще міг навчатися, незважаючи на недиференційований пошук. Додавання дискримінатора GAN на основі патчів поверх автокодувальника дозволяє VQGAN використовувати набагато меншу сітку токенів (наприклад, 16x16), ніж VQVAE, зберігаючи при цьому чіткі текстури, що робить моделювання трансформатора доступним.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє VQGAN і синтезу зображень кодової книги

Рецепт дискретних токенів VQGAN став основою для моделей зображення та відео на основі токенів, від MaskGIT до мультимодальних систем, які змішують токени зображення та тексту в одному трансформаторі. Зараз дослідження спрямовані на створення більших, скінченно-скалярних або вільних від пошуку кодових книг, які уникають згортання кодових книг, і на уніфіковані моделі, де той самий словниковий запас охоплює зображення, аудіо та мову, що дозволяє використовувати будь-яке покоління.

Реалізація в реальному світі

Кодування фотографії в сітку 16x16 токенів кодової книги, щоб трансформатор міг моделювати та регенерувати її

Поєднання VQGAN з інструкціями CLIP для створення сюрреалістичного штучного інтелекту «VQGAN+CLIP», яке стало вірусним у 2021 році

Стиснення зображень у компактні дискретні коди для ефективного зберігання або подальшого генеративного навчання

Служить токенізатором зображень у великих генераторах на основі токенів, таких як MaskGIT і мультимодальні трансформатори

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Синтез семантичного образу SPADE

Часті запитання

What is VQGAN and Codebook Image Synthesis?

VQGAN стискає зображення в сітку окремих токенів, взятих із вивченої кодової книги, дозволяючи трансформатору генерувати зображення так само, як мовні моделі генерують текст.

Що використовує VQGAN для представлення зображення у вигляді окремих токенів?

VQGAN квантує функції кодера до найближчих записів у вивченій кодовій книзі, перетворюючи зображення на послідовність дискретних індексів коду.

Чому VQGAN додає дискримінатор GAN поверх VQVAE?

Змагальні та сприйнятливі втрати дозволяють VQGAN реконструювати чіткі зображення з компактної сітки маркерів, яку VQVAE має тенденцію розмивати.

Як тільки зображення є послідовністю токенів, яка модель генерує нові зображення?

Оскільки зображення стають окремими послідовностями маркерів, трансформатор може моделювати їх авторегресійно, так само, як генеруючи текст.

Яка техніка дозволяє пропускати градієнти через крок недиференційованого квантування?

Векторне квантування є недиференційованим, тому VQGAN використовує наскрізний оцінювач градієнта для навчання кодера.

Яку відому мистецьку тенденцію штучного інтелекту VQGAN допоміг створити у 2021 році?

Поєднання VQGAN з інструкціями CLIP створило широко поширене мистецтво «VQGAN+CLIP», яке популяризувало створення текстових зображень.