Визуальное руководство по искусственному интеллекту

Генеративная визуализация под маской Muse

Muse — это модель преобразования текста в изображение из Google, которая генерирует изображения путем одновременного заполнения токенов замаскированных изображений, что делает его намного быстрее, чем пошаговое распространение.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

Глубокое погружение

Muse работает в дискретном пространстве токенов изображения. Предварительно обученный VQGAN превращает изображение в сетку целочисленных токенов, подобную словарю визуальных строительных блоков. Во время обучения большая часть этих токенов маскируется, и преобразователь учится предсказывать их обратно на основе вложений текста из замороженной большой языковой модели (T5-XXL). Во время генерации Muse начинает с полностью замаскированной сетки и выполняет декодирование в параллельных раундах, прогнозируя множество токенов за шаг и повторно маскируя наименее достоверные. Двухэтапный дизайн сначала создает сетку токенов с низким разрешением, затем модель со сверхвысоким разрешением заполняет сетку с более высоким разрешением. Поскольку одновременно обрабатываются десятки токенов, модели параметров 900M и 3B создают изображение размером 256 или 512 пикселей всего за несколько проходов вперед.

Техническая информация

Основная хитрость заключается в параллельном декодировании с доверительной перемаскировкой, которую часто называют выборкой в ​​стиле MaskGIT. Вместо прогнозирования одного токена за раз (авторегрессия) или сотни раз шумоподавления (диффузия), Muse прогнозирует все замаскированные токены, сохраняет наиболее надежные из них и повторно маскирует остальные для следующего раунда. Использование замороженного кодировщика текста T5-XXL бесплатно дает хорошее понимание языка, а работа с дискретными токенами позволяет модели рассуждать об изображениях больше как о словах.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее генеративной визуализации в маске Muse

Маскированное параллельное декодирование указывает на то, что генераторы будут одновременно высококачественными и по-настоящему быстрыми, что важно для интерактивного редактирования и использования на устройстве. Ожидается, что идея прогнозирования токенов объединится с методами диффузии и авторегрессии видео, а также обеспечит мгновенное закрашивание, закрашивание и редактирование без масок. По мере совершенствования дискретных токенизаторов маскированная визуализация может легко распространяться на видео и 3D, где параллельное декодирование может значительно сократить затраты на создание множества кадров или представлений.

Реальная реализация

Быстрые концепт-арты и мудборды, где художнику нужно множество вариаций изображения за секунды, а не за минуты.

Прорисовка с нулевым кадром, например удаление объекта и заполнение модели замаскированной области в соответствии с окружением.

Перерисовка, позволяющая расширить фотографию за пределы исходных границ для баннеров или других соотношений сторон.

Редактирование без маски, например изменение цвета собаки или закатного неба путем редактирования текстовой подсказки и повторного декодирования затронутых токенов.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Маскированные автоэнкодеры

Часто задаваемые вопросы

What is Muse Masked Generative Imaging?

Muse — это модель преобразования текста в изображение из Google, которая генерирует изображения путем одновременного заполнения токенов замаскированных изображений, что делает его намного быстрее, чем пошаговое распространение. Это важно, потому что оно показало, что можно получить высококачественные, хорошо выровненные изображения без медленного итеративного шумоподавления, на которое полагаются большинство генераторов.

Что Muse предсказывает во время генерации вместо шумоподавления пикселей?

Muse работает в дискретном пространстве токенов, предсказывая токены замаскированных изображений, созданные токенизатором VQGAN, а не работая напрямую с пикселями.

Почему Muse в целом быстрее стандартных диффузионных моделей?

Muse заполняет множество замаскированных токенов одновременно и требует всего лишь нескольких раундов декодирования, в отличие от многих последовательных шагов шумоподавления в диффузии.

Откуда Muse получает представление о текстовой подсказке?

Muse создает условия для встраивания текста из замороженной предварительно обученной языковой модели T5-XXL, обеспечивая четкое понимание языка.

Какова роль доверительной перемаскировки в Muse?

После каждого параллельного прогноза Muse сохраняет наиболее достоверные токены и повторно маскирует наименее достоверные для уточнения в последующих раундах.

Как Muse обрабатывает изображения с более высоким разрешением?

Сначала Muse создает сетку токенов с низким разрешением, затем вторая модель со сверхвысоким разрешением создает сетку токенов с более высоким разрешением.