РЪКОВОДСТВО за визуален AI

GLIGEN Заземено поколение

GLIGEN (Grounded-Language-to-Image Generation) ви позволява да контролирате точно къде се появяват обектите в генерирано изображение, като подавате ограничителните полета на модела и етикетите заедно с текстовата подкана.

2 min readПоследна актуализация

Преглед

It turns vague text-to-image into precise, layout-controllable synthesis.

Дълбоко гмуркане

Стандартните модели текст към изображение се борят с пространствения контрол: поискайте „котка отляво на куче“ и често грешите разположението. GLIGEN, въведен през 2023 г., решава това чрез добавяне на заземяващи входове, като например ограничаващи полета, съчетани с текстови или графични обекти, ключови точки или референтни изображения. Най-важното е, че той замразява теглата на оригиналния предварително обучен дифузионен модел и инжектира нови обучаеми затворени слоеве за самовнимание, които абсорбират заземяващите токени. Това означава, че се основава на модел като Stable Diffusion, без да унищожава наученото си знание, а стробирането започва близо до нула, така че поведението на базовия модел се запазва в началото на обучението. Резултатът е заземено генериране в отворен свят: можете да поставите произволно описани обекти на определени места и това се обобщава до концепции и оформления, които не са виждани по време на обучението за заземяване.

Техническа информация

GLIGEN представя всеки заземяващ обект като токен, комбиниращ вградения текст или изображение с неговата пространствена информация, като например четирите координати на ограничителна кутия, кодирана чрез функции на Фурие. Тези заземяващи токени влизат в замразената дифузионна U-Net чрез нововмъкнати затворени слоеве за самовнимание, поставени между съществуващите блокове за самовнимание и кръстосано внимание. Обучаем гейт, инициализиран до нула, контролира доколко заземяването влияе върху генерирането, така че добавянето на контрол се влошава елегантно и обучението остава стабилно.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на GLIGEN Grounded Generation

Заземеното и контролирано от оформлението генериране се превръща в стандарт в производствените инструменти. Очаквайте пространственото кондициониране в стил GLIGEN да се слее с други методи за контрол, като ControlNet и регионално подсказване, и да се разшири във видео и 3D, където разположението на обектите във времето и пространството има още по-голямо значение. Тъй като моделите възприемат интерфейси, следващи инструкции, управлението на оформлението с плъзгане и пускане и графиките на сцени, определени от език, ще направят прецизната композиция достъпна без бързи инженерни трикове.

Внедряване в реалния свят

Поставяне на лого или продукт в точен регион на генерирана реклама с помощта на ограничителна кутия

Композиране на сложни сцени чрез указване къде трябва да седи всеки герой или обект преди рендиране

Генериране на тренировъчни данни за откриване на обекти с известни местоположения на кутията за истина на земята

Рисуване на описан обект в начертан от потребителя регион на съществуваща снимка

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GLIGEN Grounded Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Генериране на текст към 3D

Frequently asked questions

What is GLIGEN Grounded Generation?

GLIGEN (Grounded-Language-to-Image Generation) ви позволява да контролирате точно къде се появяват обектите в генерирано изображение, като подавате ограничителните полета на модела и етикетите заедно с текстовата подкана. Той превръща неясния текст в изображение в прецизен, контролиран от оформлението синтез.

Какъв проблем основно решава GLIGEN?

GLIGEN добавя заземяващи входове като ограничаващи кутии, така че можете да контролирате точно къде са поставени обектите, които подканите с обикновен текст се справят зле.

Как GLIGEN запазва знанията за предварително обучения модел на дифузия?

GLIGEN замразява базовия модел и инжектира нови затворени слоеве за самовнимание, така че оригиналните научени знания остават непокътнати.

Какъв типичен вход за заземяване приема GLIGEN?

GLIGEN поддържа заземяване чрез ограничаващи полета с обекти текст/изображение, ключови точки и референтни изображения.

Защо портата в новите слоеве на вниманието на GLIGEN е инициализирана на нула?

Нулева инициализирана врата означава, че заземяването няма ефект първоначално, запазвайки оригиналния модел и поддържайки тренировката стабилна, докато контролът нараства.

Какво означава заземено поколение „отворен свят“ в GLIGEN?

GLIGEN обобщава отвъд набора си за обучение за заземяване, поставяйки нови описани обекти на определени места.