Визуальное руководство по искусственному интеллекту

Виртуальная примерка с диффузионными моделями

Виртуальная примерка с помощью искусственного интеллекта делает фотографию человека и фотографию одежды и создает новое изображение этого человека, носящего эту одежду, сохраняя его позу, тело и лицо, одновременно передавая форму, текстуру и детали одежды.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее виртуальной примерки диффузионных моделей
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Современные системы используют диффузионные модели, основанные на позе и контурах тела человека, вместо того, чтобы просто наклеивать одежду сверху. Это важно, потому что меняет то, как люди делают покупки в Интернете, но показывает, как может выглядеть одежда, а не то, подойдет ли она на самом деле.

Глубокое погружение

Виртуальная примерка состоит из двух взаимосвязанных задач: сохранить неизменным личность человека (лицо, волосы, тон кожи, форму тела, позу) и точно воспроизвести одежду (крой, цвет, принт, логотип, фактуру ткани). Ранние подходы, такие как VITON (2018) и CP-VTON, работали в два этапа. Сначала они деформировали плоское изображение одежды, чтобы оно соответствовало позе человека, часто используя тонкий сплайн или изученное поле потока, затем вторая сеть смешала деформированную одежду с фотографией. Эти методы боролись с большими изменениями позы, окклюзиями, такими как скрещенные руки, и сложными отпечатками, поскольку 2D-деформация не может создать части одежды, которые никогда не были видны. Диффузионные модели изменили второй этап. Вместо смешивания модель восстанавливает область одежды из шума, учитывая изображение одежды, ключевые точки позы человека, карту анализа тела и замаскированную версию исходной фотографии. В программе TryOnDiffusion (2023) Google использовались две параллельные сети, которые обмениваются информацией посредством перекрестного внимания, позволяя одежде неявно деформироваться внутри модели, а не на отдельном этапе; Google использовала это семейство методов для примерки результатов покупок, показанных на реальных моделях разных размеров. Модели открытых исследований, такие как StableVITON, OOTDiffusion и IDM-VTON, адаптировали Stable Diffusion для этой задачи. Распространенное заблуждение состоит в том, что примерка определяет ваш размер. Это не так. Модель не имеет размеров растяжки одежды или вашего тела; это создает правдоподобное представление о том, как одежда этого стиля имеет тенденцию драпироваться. К режимам неудач относятся верх, который одинаково сидит на каждом теле, потерянный или смазанный текст и логотипы, измененный тон кожи или форма тела, изобретенные руки и руки, а также более слабые результаты для типов телосложения, оттенков кожи, стилей одежды или поз, которые редко встречаются в тренировочных данных.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее виртуальной примерки диффузионных моделей

Исследования движутся к видеопримерке, использованию нескольких предметов одежды и контролю над такими атрибутами посадки, как «оверсайз» или «узкий». Более сложный и нерешенный шаг — связать изображение с физической реальностью: объединить таблицы размеров, свойства ткани и размеры тела, возможно, с 3D-моделями тела и симуляцией ткани, чтобы предварительный просмотр отражал фактическую посадку, а не лестное предположение. Снизит ли примерка прибыль на практике, зависит от этой связи и от того, будут ли розничные торговцы публиковать честные оценки. Ожидайте постоянного внимания к согласию и конфиденциальности фотографий, загружаемых пользователями, а также к работе различных органов.

Реальная реализация

Интернет-покупатель выбирает модель, которая примерно соответствует его типу телосложения, и видит блузку, изображенную на этом человеке в нескольких позах, прежде чем решить, стоит ли покупать.

Ритейлер модной одежды фотографирует каждый новый предмет одежды один раз на плоской поверхности и использует функцию примерки, чтобы показать его на нескольких моделях из каталога вместо того, чтобы заказывать новую фотосессию.

Покупатель загружает свою фотографию в полный рост в приложение для примерки и видит на себе куртку, замечая, что длина рукава скорее угадывается, чем измеряется.

Исследовательская группа оценивает примерную модель на тестовом наборе, охватывающем широкий диапазон размеров тела и оттенков кожи, и обнаруживает, что логотипы и полосы больше искажаются на больших телах и в необычных позах.

Риски и ограничения

  • Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

  • Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

  • Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

  1. Определите критерии приемки точности, стоимости отзыва и ошибок.

  2. Тестируйте с данными, которые соответствуют реальным производственным условиям.

  3. Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

  4. Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Virtual Try-On with Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое виртуальная примерка диффузионных моделей?

Виртуальная примерка с помощью искусственного интеллекта делает фотографию человека и фотографию одежды и создает новое изображение этого человека, носящего эту одежду, сохраняя его позу, тело и лицо, одновременно передавая форму, текстуру и детали одежды. Современные системы используют диффузионные модели, основанные на позе и контурах тела человека, вместо того, чтобы просто наклеивать одежду сверху. Это важно, потому что меняет то, как люди делают покупки в Интернете, но показывает, как может выглядеть одежда, а не то, подойдет ли она на самом деле.

Какие две конкурирующие цели должна балансировать каждая виртуальная система примерки?

Примерка должна сохранить личность, позу и тело человека, одновременно передавая крой, цвет и принт одежды. Улучшение одного часто вредит другому.

Как в основном работали ранние методы, такие как VITON и CP-VTON?

Ранние системы использовали двухэтапный подход: геометрическую деформацию (например, тонкие пластинчатые сплайны), за которой следовала сеть смешивания.

Почему при 2D-деформировании возникали трудности со скрещенными руками или большими изменениями поз?

Деформация перемещает только существующие пиксели, поэтому она не может создавать скрытые или перекрытые части одежды.

Что модель делает с областью одежды в модели с диффузной примеркой?

Диффузионная примерка прорисовывает область замаскированной одежды путем шумоподавления, руководствуясь характеристиками одежды, информацией о позе и остальным изображением человека.

Какую особенность дизайна использовала TryOnDiffusion от Google для переноса одежды?

TryOnDiffusion использовал две сети, связанные перекрестным вниманием, поэтому одежду можно было неявно деформировать внутри модели.