Визуальное руководство по искусственному интеллекту

Изображение 2 и диффузия, настроенная на вознаграждение

Imagen 2 — это фотореалистичная модель преобразования текста в изображение Google, основанная на диффузии, усовершенствованная с помощью настройки вознаграждения, чтобы ее результаты лучше соответствовали тому, что на самом деле хотят люди.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.

Глубокое погружение

Imagen 2 основан на оригинальном рецепте Imagen: большая замороженная языковая модель кодирует подсказку, а каскад диффузных моделей превращает случайный шум в детальное изображение, сохраняя при этом текст. Дополнением к заголовку является настройка вознаграждения, при которой изученная модель вознаграждения оценивает сгенерированные изображения по таким качествам, как быстрое выравнивание, эстетика и реализм, а модель распространения точно настраивается для получения результатов с более высокими оценками. Это отражает обучение с подкреплением на основе отзывов людей, используемое в языковых моделях. В Imagen 2 улучшен фотореализм, более надежное написание текста на изображении, многоязычная поддержка и улучшена обработка сложных объектов, таких как руки и лица. Он также добавил закрашивание и закрашивание, а Google объединил его с инструментом создания водяных знаков SynthID, чтобы невидимо отмечать изображения, созданные искусственным интеллектом. Он реализовал функции продуктов Google и ImageFX.

Техническая информация

Диффузия учится обращать процесс шумообразования, постепенно превращая случайное поле в изображение, управляемое встраиванием текста. На первом месте находится настройка вознаграждения: модель вознаграждения, обученная на человеческих предпочтениях, подает сигнал, который подталкивает модель распространения к результатам, которые люди оценивают выше, аналогично RLHF для текста. В сочетании с руководством без классификаторов, которое балансирует между достоверностью и разнообразием, это позволяет Imagen 2 напрямую оптимизировать воспринимаемое качество и согласованность, а не только согласовывать распределение обучения.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее Imagen 2 и диффузии, настроенной на вознаграждение

Распространение, ориентированное на вознаграждение, становится стандартным путем к контролируемому, высококачественному производству, а сигналы вознаграждения будут расширяться и охватывать безопасность, актуальность и справедливость наряду с эстетикой. Ожидайте более жесткого контроля над редактированием, более быстрого отбора проб посредством дистилляции и стандартного происхождения через водяные знаки, такие как SynthID. По мере того, как модели предпочтений становятся все более детальными и ориентированными на каждого пользователя, генераторы изображений будут все чаще адаптировать стиль и контент к индивидуальному вкусу, оставаясь при этом отслеживаемыми, как созданные искусственным интеллектом.

Реальная реализация

Создание маркетинговых изображений и изображений продуктов с точным текстом внутри изображения, например короткими слоганами или этикетками.

Inpainting позволяет легко удалять или заменять объекты на существующей фотографии.

Перерисовка для расширения сцены для разных макетов, баннеров или соотношений сторон.

Создание многоязычных творческих ресурсов, в которых подсказки и отображаемый текст отображаются на нескольких языках с водяными знаками SynthID для подтверждения происхождения.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen 2 and Reward-Tuned Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Стабильная диффузия видео

Часто задаваемые вопросы

What is Imagen 2 and Reward-Tuned Diffusion?

Imagen 2 — это фотореалистичная модель преобразования текста в изображение Google, основанная на диффузии, усовершенствованная с помощью настройки вознаграждения, чтобы ее результаты лучше соответствовали тому, что на самом деле хотят люди. Это важно, поскольку сочетает в себе высокое качество изображения и точную визуализацию текста с методами выравнивания, заимствованными из того, как обучаются чат-боты.

Какой основной генеративный метод использует Imagen 2?

Imagen 2 — это диффузионная модель: она учится обращать вспять процесс зашумления, превращая случайный шум в детальное изображение, управляемое текстом.

Что добавляет настройка вознаграждения в Imagen 2?

Настройка вознаграждения настраивает модель с использованием модели вознаграждения, обученной на человеческих предпочтениях, подталкивая ее к изображениям с более высоким рейтингом и лучшим соответствием.

На какой метод обучения языковой модели похожа настройка вознаграждения Imagen 2?

Настройка вознаграждения концептуально похожа на RLHF: модель вознаграждения, обученная на основе предпочтений, позволяет точно настроить результаты, которые нравятся людям.

Как Imagen 2 распознает текстовую подсказку?

Imagen 2 следует рецепту Imagen, заключающемуся в использовании большой замороженной языковой модели для кодирования подсказки в форматированный текст.

Для чего SynthID используется с изображениями Imagen 2?

SynthID добавляет невидимый водяной знак, поэтому изображения, созданные ИИ, можно идентифицировать на предмет происхождения даже после некоторых изменений.