Наземна генерація GLIGEN
GLIGEN (Grounded-Language-to-Image Generation) дозволяє контролювати, де саме відображаються об’єкти на згенерованому зображенні, додаючи обмежувальні рамки моделі та мітки поруч із текстовою підказкою.
Огляд
It turns vague text-to-image into precise, layout-controllable synthesis.
Глибоке занурення
Стандартні моделі перетворення тексту в зображення мають проблеми з просторовим контролем: запитуйте «кіт ліворуч від собаки», і ви часто неправильно розміщуєте. GLIGEN, представлений у 2023 році, вирішує цю проблему шляхом додавання заземлюючих вхідних даних, таких як обмежувальні прямокутники в поєднанні з об’єктами тексту чи зображення, ключовими точками чи еталонними зображеннями. Найважливішим є те, що він заморожує ваги початкової попередньо навченої моделі дифузії та вводить нові навчувані шари стробованої самоуважності, які поглинають маркери заземлення. Це означає, що він базується на моделі, як-от Stable Diffusion, без руйнування отриманих знань, а стробування починається близько нуля, тому поведінка базової моделі зберігається на початку навчання. Результатом є заземлена генерація у відкритому світі: ви можете розміщувати довільні описані об’єкти у визначених місцях, і це узагальнює концепції та макети, яких не бачили під час навчання заземленням.
Технічне розуміння
GLIGEN представляє кожну заземлюючу сутність як маркер, що поєднує текст або вбудоване зображення з її просторовою інформацією, такою як чотири координати обмежувальної рамки, закодовані за допомогою функцій Фур’є. Ці маркери заземлення потрапляють у заморожену дифузійну мережу U-Net через нещодавно вставлені закриті шари самоуважності, розміщені між існуючими блоками самоуважності та перехресної уваги. Шлюз з можливістю навчання, ініціалізований до нуля, контролює, наскільки заземлення впливає на генерацію, тому додавання керування плавно погіршується, а навчання залишається стабільним.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє GLIGEN Grounded Generation
Обґрунтована та керована макетом генерація стає стандартом у виробничих інструментах. Очікуйте, що просторове кондиціонування у стилі GLIGEN поєднається з іншими методами керування, такими як ControlNet і регіональні підказки, а також пошириться на відео та 3D, де розміщення об’єктів у часі та просторі має ще більше значення. Оскільки в моделях використовуються інтерфейси, які слідують інструкціям, керування макетом за допомогою перетягування та діаграми сцен, визначені мовою, зроблять точну композицію доступною без оперативних інженерних хитрощів.
Реалізація в реальному світі
Розміщення логотипу або продукту в точній області створеної реклами за допомогою обмежувальної рамки
Створення складних сцен шляхом визначення місця розташування кожного персонажа чи об’єкта перед рендерингом
Створення тренувальних даних для виявлення об’єктів із відомим розташуванням ящика правдивості на землі
Додавання описаного об’єкта до намальованої користувачем області наявної фотографії
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GLIGEN Grounded Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Генерація тексту в 3D
Часті запитання
What is GLIGEN Grounded Generation?
GLIGEN (Grounded-Language-to-Image Generation) дозволяє контролювати, де саме відображаються об’єкти на згенерованому зображенні, додаючи обмежувальні рамки моделі та мітки поруч із текстовою підказкою. Він перетворює розпливчастий текст у зображення на точний синтез, який можна контролювати макетом.
Яку проблему в першу чергу вирішує GLIGEN?
GLIGEN додає заземлюючі вхідні дані, наприклад обмежувальні прямокутники, щоб ви могли контролювати, де саме розміщуються об’єкти, які погано обробляються з простими текстовими підказками.
Як GLIGEN зберігає знання попередньо навченої моделі дифузії?
GLIGEN заморожує базову модель і додає нові закриті шари самоуважності, тому вихідні набуті знання залишаються недоторканими.
Який типовий вхід заземлення приймає GLIGEN?
GLIGEN підтримує заземлення через обмежувальні прямокутники з об’єктами тексту/зображення, ключовими точками та еталонними зображеннями.
Чому ворота в нових рівнях уваги GLIGEN ініціалізуються на нуль?
Ініціалізований нуль воріт означає, що спочатку заземлення не має ефекту, зберігаючи оригінальну модель і зберігаючи стабільність тренування в міру збільшення контролю.
Що означає «генерація у відкритому світі» в GLIGEN?
GLIGEN узагальнює за межами свого базового навчального набору, розміщуючи нові описані об’єкти у визначених місцях.