VQGAN и синтез на изображения на кодова книга
VQGAN компресира изображения в мрежа от отделни токени, извлечени от научена кодова книга, позволявайки на трансформатор да генерира изображения по същия начин, по който езиковите модели генерират текст.
Дълбоко гмуркане
VQGAN, представен в документа от 2021 г. „Укротяване на трансформатори за синтез на изображения с висока разделителна способност“, съчетава векторно квантуван автоенкодер (VQVAE) със съперничещо и перцептивно обучение. Енкодер картографира изображение към малка мрежа от вектори на характеристики; всеки вектор се прихваща до най-близкия запис в научена кодова книга от, да речем, 1024 дискретни кода, превръщайки изображението в последователност от цели числа. Декодер възстановява изображението от тези токени, обучен с GAN дискриминатор и загуба на възприятие, така че реконструкциите да изглеждат по-скоро резки, отколкото замъглени. Тъй като изображенията вече са отделни последователности от токени, авторегресивен трансформатор може да ги моделира като език, предвиждайки токени един по един. Известно е, че VQGAN задвижва ранни инструменти за текст към изображение, когато е съчетан с насоки CLIP.
Техническа информация
Основната операция е векторно квантуване: непрекъснатите изходи на енкодера се заменят с техните най-близки вектори от кодовата книга, с „прав“ оценител на градиента, така че енкодерът все още може да се учи въпреки недиференцируемото търсене. Добавянето на базиран на кръпки GAN дискриминатор върху автокодера е това, което позволява на VQGAN да използва много по-малка решетка на токени (напр. 16x16) от VQVAE, като същевременно запазва текстурите ясни, правейки трансформаторното моделиране податливо.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на VQGAN и синтеза на изображения на кодова книга
Рецептата за дискретни токени на VQGAN стана основата за базирани на токени изображения и видео модели, от MaskGIT до мултимодални системи, които смесват токени за изображение и текст в един трансформатор. Изследванията сега се насочват към по-големи кодови книги с краен скалар или без търсене, които избягват колапс на кодови книги и към унифицирани модели, където един и същи речник обхваща изображения, аудио и език, позволявайки всяко поколение.
Внедряване в реалния свят
Кодиране на снимка в мрежа 16x16 от токени на кодова книга, така че трансформаторът да може да я моделира и регенерира
Сдвояване на VQGAN с насоки за CLIP за създаване на сюрреалистичното AI изкуство „VQGAN+CLIP“, което стана вирусно през 2021 г.
Компресиране на изображения в компактни дискретни кодове за ефективно съхранение или генеративно обучение надолу по веригата
Служи като токенизатор на изображения в по-големи генератори, базирани на токени, като MaskGIT и мултимодални трансформатори
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
SPADE Синтез на семантичен образ
Frequently asked questions
What is VQGAN and Codebook Image Synthesis?
VQGAN компресира изображения в мрежа от отделни токени, извлечени от научена кодова книга, позволявайки на трансформатор да генерира изображения по същия начин, по който езиковите модели генерират текст.
Какво използва VQGAN, за да представи изображение като отделни токени?
VQGAN квантува характеристиките на енкодера до най-близките записи в научена кодова книга, превръщайки изображението в последователност от дискретни кодови индекси.
Защо VQGAN добавя GAN дискриминатор върху VQVAE?
Противоположните и перцептивните загуби позволяват на VQGAN да реконструира ясни изображения от компактна жетонна решетка, която само VQVAE има тенденция да замъглява.
След като едно изображение е поредица от токени, какъв модел генерира нови изображения?
Тъй като изображенията се превръщат в отделни последователности от символи, трансформаторът може да ги моделира авторегресивно, точно като генерирането на текст.
Каква техника позволява градиенти да преминават през недиференцируемата стъпка на квантуване?
Векторното квантуване е недиференцируемо, така че VQGAN използва оценител на градиент с прав ход, за да обучи енкодера.
Коя известна тенденция в изкуството на AI помогна VQGAN да създаде през 2021 г.?
Сдвояването на VQGAN с насоки CLIP създаде широко разпространеното изкуство „VQGAN+CLIP“, което популяризира генерирането на изображения, управлявани от текст.