Визуальное руководство по искусственному интеллекту

Редактирование с перекрестным вниманием от подсказки к подсказке

Функция «Подсказка к подсказке» редактирует сгенерированное изображение, настраивая его текстовую подсказку при повторном использовании внутренних карт внимания модели, поэтому изменение одного слова меняет местами этот элемент, сохраняя при этом остальную часть сцены нетронутой.

2 минуты чтенияПоследнее обновление

Обзор

It is editing through words, not pixels.

Глубокое погружение

«Подсказка к подсказке» (Hertz et al., 2022) — это не требующий обучения метод текстового редактирования в диффузионных моделях. Ключевой вывод заключается в том, что карты перекрестного внимания, которые сообщают модели, на какие области изображения должно влиять каждое слово, кодируют пространственную структуру сцены. Когда вы повторно создаете изображение со слегка измененным приглашением, метод вводит карты внимания исходного приглашения в новый запуск. Замена слова, скажем, «велосипед» на «мотоцикл», меняет этот объект местами, сохраняя при этом композицию и фон. Добавление слова привлекает внимание только к неизменившимся токенам, поэтому новый атрибут появляется без перетасовки всего. Вы также можете изменить вес внимания токена, чтобы усилить или ослабить его эффект. Поскольку он не требует тонкой настройки или масок, он стал основополагающим строительным блоком для многих последующих методов редактирования, включая генерацию данных InstructPix2Pix.

Техническая информация

Во время шумоподавления перекрестное внимание вычисляет для каждого токена пространственную карту того, где он находится на изображении. Prompt-to-Prompt копирует эти карты из исходного поколения в отредактированную для общих токенов. При обмене словами внимание распределяется между соответствующими токенами; для добавленных слов он сохраняет старые карты и позволяет только новым лексемам привлекать свежее внимание; Изменение веса просто масштабирует значение внимания токена, усиливая или приглушая его визуальное влияние.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее редактирования с перекрестным вниманием

Манипулирование перекрестным вниманием теперь лежит в основе целого семейства управляемых инструментов генерации, а идеи распространяются на управление вниманием в новых архитектурах и распространение видео для согласованного во времени монтажа. Ожидайте более тесной интеграции с редактированием реального изображения посредством инверсии, более надежной обработки крупных структурных изменений и комбинации с моделями инструкций, чтобы трюки с вниманием выполнялись незаметно под простым интерфейсом на естественном языке.

Реальная реализация

Дизайнер меняет «красную машину на улице» на «синюю машину на улице» и сохраняет тот же макет сцены.

Иллюстратор меняет значение слова «снежный», чтобы сделать пейзаж все более зимним в разных вариантах.

Рассказчик меняет слово «лев» на «тигр» в подсказке, чтобы сохранить идентичную позу и фон для листа персонажа.

Исследователь использует его для создания парных изображений «до» и «после» в качестве обучающих данных для редактора, следующего за инструкциями.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt-to-Prompt Cross-Attention Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Перекрестное внимание

Часто задаваемые вопросы

What is Prompt-to-Prompt Cross-Attention Editing?

Функция «Подсказка к подсказке» редактирует сгенерированное изображение, настраивая его текстовую подсказку при повторном использовании внутренних карт внимания модели, поэтому изменение одного слова меняет местами этот элемент, сохраняя при этом остальную часть сцены нетронутой. Это редактирование словами, а не пикселями.

Какую внутреннюю информацию повторно использует Prompt-to-Prompt для сохранения сцены?

Карты перекрестного внимания фиксируют, где каждое слово влияет на изображение, поэтому их повторное использование обеспечивает единообразие макета во время редактирования.

Требует ли «подсказка к подсказке» точную настройку модели?

Он манипулирует вниманием во время вывода и не требует дополнительной подготовки.

Что дает изменение веса внимания токена?

Масштабирование значений внимания токена усиливает или приглушает степень проявления этой концепции.

Почему «подсказка к подсказке» считается основополагающим методом?

Манипулирование вниманием, не требующее тренировки, стало строительным блоком, повторно использованным в последующих исследованиях по редактированию.