Визуальное руководство по искусственному интеллекту

Условные GAN

Условные GAN (cGAN) расширяют обычные GAN, добавляя дополнительную информацию, например метку класса или текст, как в генератор, так и в дискриминатор.

2 минуты чтенияПоследнее обновление

Обзор

This lets you control what the network produces instead of getting random outputs.

Глубокое погружение

Стандартный GAN превращает случайный шум в изображение, но не дает вам права голоса в результате. Условные GAN, предложенные Мирзой и Осиндеро в 2014 году, исправляют это путем формирования условий на метке y. Обе сети получают y: генератор объединяет шум с меткой для создания соответствующего изображения, а дискриминатор оценивает, является ли изображение реалистичным и соответствует ли его метке. Обучите его на MNIST с цифровыми метками, и вы сможете запросить конкретно «7». Обуславливающим сигналом может быть вектор горячего класса, встраивание, набор атрибутов или даже другое изображение. Идея управления генерацией является основой, которая делает возможными системы преобразования текста в изображение и изображения в изображение.

Техническая информация

Входные данные преобразования обычно объединяются с вектором шума генератора и входными функциями дискриминатора, хотя более продвинутые конструкции вводят их посредством условной пакетной нормализации или слоя проекции, который переносит внутренний продукт между встраиванием метки и функциями изображения. Ключ в том, что дискриминатор должен наказывать несовпадающие пары, изображение, которое выглядит реальным, но не соответствует своей метке, заставляя генератор соблюдать условие, а не игнорировать его.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее условных GAN

Условная генерация теперь является ожиданием по умолчанию: пользователи хотят указать, что они получат. Идея формирования меток была обобщена до формирования расширенного текста посредством перекрестного внимания в моделях диффузии, таких как Stable Diffusion, и в пространственном формировании в стиле ControlNet с использованием краев, глубины или позы. Будущие системы будут принимать еще более гибкие и мультимодальные условия, смешивая текст, эскизы, аудио и трехмерные ограничения, одновременно улучшая то, насколько точно выходные данные соответствуют каждой части инструкции.

Реальная реализация

Генерация конкретной рукописной цифры или класса объекта по требованию, а не случайно.

Синтезирование лиц с выбранными атрибутами, такими как возраст, прическа, очки или выражение лица.

Использование первых конвейеров преобразования текста в изображение, в которых подпись обуславливает сгенерированное изображение.

Создание сбалансированных по классам синтетических данных для расширения недостаточно представленных категорий в обучающих наборах.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Conditional GANs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Прогрессивное развитие GAN

Часто задаваемые вопросы

What is Conditional GANs?

Условные GAN (cGAN) расширяют обычные GAN, добавляя дополнительную информацию, например метку класса или текст, как в генератор, так и в дискриминатор. Это позволяет вам контролировать то, что производит сеть, вместо того, чтобы получать случайные выходные данные.

В чем основное отличие условного GAN от стандартного GAN?

Условные GAN добавляют кондиционирующий сигнал (например, метку) как к генератору, так и к дискриминатору, чтобы вы могли указать, что генерируется.

Что вы можете сделать в cGAN, обученном на помеченных цифрах, чего не может обычный GAN?

Поскольку генерация обусловлена ​​меткой, вы можете запросить у генератора конкретный класс вместо случайного результата.

Что должен проверять дискриминатор cGAN, кроме того, выглядит ли изображение реальным?

Дискриминатор наказывает реалистично выглядящие изображения, которые не соответствуют их состоянию, заставляя генератор соблюдать метку.

Какой обычно способ подачи преобразующего сигнала на генератор?

Простой и распространенный подход объединяет метку (часто горячую или встраивающую) с вектором шума генератора.

Условные GAN заложили основу для каких будущих возможностей?

Управление генерацией с помощью условия — это именно то, на что полагаются системы преобразования текста в изображение и изображения в изображение.