Синтез изображений VQGAN и кодовой книги
VQGAN сжимает изображения в сетку дискретных токенов, взятых из изученной кодовой книги, позволяя преобразователю генерировать изображения так же, как языковые модели генерируют текст.
Глубокое погружение
VQGAN, представленный в статье 2021 года «Укрощение трансформаторов для синтеза изображений высокого разрешения», сочетает в себе автокодировщик векторного квантования (VQVAE) с состязательным и перцептивным обучением. Кодер отображает изображение в небольшую сетку векторов признаков; каждый вектор привязывается к ближайшей записи в изученной кодовой книге, состоящей, скажем, из 1024 дискретных кодов, превращая изображение в последовательность целочисленных токенов. Декодер реконструирует изображение из этих токенов, обученных с помощью дискриминатора GAN и потерь восприятия, поэтому реконструкции выглядят четкими, а не размытыми. Поскольку изображения теперь представляют собой дискретные последовательности токенов, авторегрессионный преобразователь может моделировать их как язык, предсказывая токены один за другим. VQGAN, как известно, стал основой первых инструментов преобразования текста в изображение в сочетании с руководством CLIP.
Техническая информация
Основной операцией является векторное квантование: непрерывные выходные данные кодера заменяются их ближайшими векторами кодовой книги с «прямой» оценкой градиента, поэтому кодер все еще может учиться, несмотря на недифференцируемый поиск. Добавление дискриминатора GAN на основе патчей поверх автоэнкодера позволяет VQGAN использовать гораздо меньшую сетку токенов (например, 16x16), чем VQVAE, сохраняя при этом четкость текстур, что делает моделирование трансформаторов более удобным.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее VQGAN и синтеза изображений кодовой книги
Рецепт дискретных токенов VQGAN стал основой для моделей изображений и видео на основе токенов, от MaskGIT до мультимодальных систем, которые смешивают токены изображения и текста в одном преобразователе. В настоящее время исследования направлены на создание более крупных, конечно-скалярных кодовых книг или книг без поиска, которые позволяют избежать коллапса кодовых книг, и к унифицированным моделям, в которых один и тот же словарный запас охватывает изображения, аудио и язык, что позволяет генерировать любые данные.
Реальная реализация
Кодирование фотографии в сетку токенов кодовой книги размером 16x16, чтобы преобразователь мог моделировать и регенерировать ее.
Сочетание VQGAN с руководством CLIP для создания сюрреалистического ИИ-искусства «VQGAN+CLIP», которое стало вирусным в 2021 году.
Сжатие изображений в компактные дискретные коды для эффективного хранения или последующего генеративного обучения.
Служит токенизатором изображений внутри более крупных генераторов на основе токенов, таких как MaskGIT и мультимодальных преобразователей.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Синтез семантического изображения SPADE
Часто задаваемые вопросы
Что такое VQGAN и синтез изображений кодовой книги?
VQGAN сжимает изображения в сетку дискретных токенов, взятых из изученной кодовой книги, позволяя преобразователю генерировать изображения так же, как языковые модели генерируют текст.
Что использует VQGAN для представления изображения в виде дискретных токенов?
VQGAN квантует функции кодера до ближайших записей в изученной кодовой книге, превращая изображение в последовательность индексов дискретного кода.
Почему VQGAN добавляет дискриминатор GAN поверх VQVAE?
Состязательные и перцептивные потери позволяют VQGAN реконструировать четкие изображения из компактной сетки токенов, которую только VQVAE имеет тенденцию размывать.
Если изображение представляет собой последовательность токенов, какая модель генерирует новые изображения?
Поскольку изображения становятся дискретными последовательностями токенов, преобразователь может моделировать их авторегрессионно, точно так же, как генерирует текст.
Какой метод позволяет градиентам проходить через этап недифференцируемого квантования?
Векторное квантование недифференцируемо, поэтому VQGAN использует прямоточную систему оценки градиента для обучения кодера.
Какое известное направление в искусстве искусственного интеллекта помогло создать VQGAN в 2021 году?
Сочетание VQGAN с руководством CLIP привело к созданию широко распространенного искусства «VQGAN+CLIP», которое популяризировало генерацию текстовых изображений.