Візуальний AI GUIDE

Редагування інструкцій InstructPix2Pix

InstructPix2Pix дозволяє редагувати фотографію, ввівши звичайну команду, як-от «зробити це зимою» або «перетворити кота на собаку», без використання масок чи інструментів виділення.

2 хвилини читанняОстаннє оновлення

Огляд

It taught a diffusion model to follow editing instructions directly.

Глибоке занурення

InstructPix2Pix (Brooks et al., 2023) — це дифузійна модель, налаштована на отримання вхідного зображення разом із текстовою інструкцією та виведення відредагованого зображення за один прохід вперед. Його розумний трюк полягає в навчальних даних: автори використовували GPT-3 для створення пар підписів до і після, а потім використали Prompt-to-Prompt зі стабільною дифузією для синтезу відповідних пар зображень до/після. Це дало їм великий набір даних (оригінальне зображення, інструкція, відредаговане зображення) потрійних даних, на яких вони могли тренуватися, і все без маркування вручну. Оскільки інструкції описують зміну, а не всю сцену, модель зберігає незгадані частини зображення. Він використовує дві орієнтовні шкали: одну для того, наскільки точно вона дотримується інструкцій, а іншу для того, наскільки точно вона дотримується оригінального зображення, що дозволяє користувачам обмінюватися силою редагування з точністю.

Технічне розуміння

Модель обумовлює як вихідне зображення, так і інструкцію, застосовуючи вказівки без класифікатора по двох осях. Одна вага зважує текстову інструкцію, інша – вхідне зображення. Збільшення масштабу зображення зберігає більшу частину оригіналу недоторканим, тоді як збільшення масштабу тексту робить редагування більш агресивним. Це подвійне керівництво – це те, що дозволяє одній загальній інструкції надійно змінити один аспект, залишаючи решту фотографії впізнаваною.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє редагування інструкцій InstructPix2Pix

Редагування на основі вказівок стає стандартним інтерфейсом для інструментів для зображень, які тепер включені в основні програми та наступні програми, такі як MagicBrush і нові багатооборотні редактори. Очікуйте кращого збереження дрібних деталей, надійної обробки просторових інструкцій, таких як «перемістіть лампу ліворуч», і безперебійного розширення відео, де одна команда редагує весь кліп. Поєднання цих моделей з мовними агентами може дозволити вам описати повний сеанс редагування в розмові.

Реалізація в реальному світі

Блогер вводить слово «додати осіннє листя», щоб змінити шкірку фотографії літнього пейзажу для сезонної публікації.

Продавець електронної комерції дає вказівку «змінити колір сорочки на темно-синій», щоб створити варіанти кольорів продукту з одного кадру.

Учитель редагує історичну фотографію за допомогою «розфарбувати це», щоб зробити чорно-біле архівне зображення яскравим для уроку.

Творець мему наказує «надіньте сонцезахисні окуляри на собаку», не маскуючи обличчя собаки вручну.

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InstructPix2Pix Instruction Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Інтерактивне редагування DragGAN

Часті запитання

What is InstructPix2Pix Instruction Editing?

InstructPix2Pix дозволяє редагувати фотографію, ввівши звичайну команду, як-от «зробити це зимою» або «перетворити кота на собаку», без використання масок чи інструментів виділення. Це навчило дифузійну модель безпосередньо слідувати інструкціям редагування.

Як сказати InstructPix2Pix, що змінити?

Ви просто вводите інструкцію на кшталт «зробити зимою»; не потрібні маски чи вибір регіону.

Як створювалися навчальні дані InstructPix2Pix?

Автори поєднали пари титрів, згенерованих GPT-3, із синтезом зображень Prompt-to-Prompt для автоматичного створення трійок.

Чим керують дві вказівні шкали InstructPix2Pix?

Одна шкала визначає, наскільки редагування відповідає інструкції; інший визначає, скільки вихідного зображення буде збережено.

Чому модель намагається залишити в спокої незгадані частини зображення?

Інструкція націлена на конкретну зміну, тому модель зберігає регіони, які не згадуються в інструкції.

Скільки проходів вперед потрібно InstructPix2Pix для редагування?

Це єдина модель умовної дифузії, яка об’єднує зображення та інструкцію та виводить редагування.