Условни GAN
Условните GAN (cGAN) разширяват обикновените GAN, като подават допълнителна информация, като етикет на клас или текст, както в генератора, така и в дискриминатора.
Преглед
This lets you control what the network produces instead of getting random outputs.
Дълбоко гмуркане
Стандартният GAN превръща случаен шум в изображение, но не ви дава мнение за резултата. Условните GAN, предложени от Mirza и Osindero през 2014 г., коригират това чрез кондициониране на генериране на етикет y. И двете мрежи получават y: генераторът комбинира шума с етикета, за да произведе съответстващо изображение, докато дискриминаторът преценява дали изображението е едновременно реалистично и съвместимо с етикета. Обучете го на MNIST с цифрови етикети и можете да поискате конкретно „7“. Сигналът за кондициониране може да бъде вектор от един горещ клас, вграждане, набор от атрибути или дори друго изображение. Тази идея за управление на генерирането е основата, която прави възможни системите текст към изображение и изображение към изображение.
Техническа информация
Входът за кондициониране обикновено е свързан с вектора на шума на генератора и с входните характеристики на дискриминатора, въпреки че по-напредналите дизайни го инжектират чрез условна партидна нормализация или проекционен слой, който взема вътрешния продукт между вграждането на етикета и характеристиките на изображението. Ключът е, че дискриминаторът трябва да санкционира несъответстващите двойки, изображение, което изглежда реално, но не съответства на етикета му, принуждавайки генератора да уважи условието, вместо да го игнорира.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на условните GAN
Условното генериране вече е стандартното очакване: потребителите искат да посочат какво получават. Идеята за кондициониране на етикети се обобщава в кондициониране на обогатен текст чрез кръстосано внимание в дифузионни модели като Stable Diffusion и в пространствено кондициониране в стил ControlNet, използвайки ръбове, дълбочина или поза. Бъдещите системи ще приемат все по-гъвкави и мултимодални условия, смесвайки текст, скици, аудио и 3D ограничения, като същевременно ще подобрят доколко вярно резултатите зачитат всяка част от инструкцията.
Внедряване в реалния свят
Генериране на конкретна ръкописна цифра или обектен клас при поискване, а не на случаен принцип
Синтезиране на лица с избрани атрибути като възраст, прическа, очила или изражение
Захранване на ранни тръбопроводи за текст към изображение, където надпис определя генерираната картина
Създаване на класово балансирани синтетични данни за увеличаване на недостатъчно представените категории в наборите за обучение
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Conditional GANs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Прогресивно нарастване на GAN
Frequently asked questions
What is Conditional GANs?
Условните GAN (cGAN) разширяват обикновените GAN, като подават допълнителна информация, като етикет на клас или текст, както в генератора, така и в дискриминатора. Това ви позволява да контролирате какво произвежда мрежата, вместо да получавате произволни изходи.
Каква е основната разлика между условен GAN и стандартен GAN?
Условните GAN добавят кондициониращ сигнал (като етикет) както към генератора, така и към дискриминатора, така че можете да посочите какво се генерира.
В cGAN, обучен на етикетирани цифри, какво можете да направите, което обикновен GAN не може?
Тъй като генерирането зависи от етикета, можете да поискате от генератора конкретен клас вместо случаен изход.
Какво трябва да провери дискриминаторът на cGAN, освен дали изображението изглежда реално?
Дискриминаторът наказва реалистично изглеждащи изображения, които не съответстват на тяхното състояние, принуждавайки генератора да спазва етикета.
Кой е често срещаният начин за подаване на кондициониращ сигнал към генератора?
Прост и често срещан подход свързва етикета (често един горещ или вграждане) към вектора на шума на генератора.
Условните GAN положиха основата за коя по-късна възможност?
Управлението на генерирането чрез условие е точно това, на което разчитат системите за текст към изображение и изображение към изображение.