Візуальний AI GUIDE

Віртуальна примірка з дифузійними моделями

Віртуальна примірка штучного інтелекту робить фотографію людини та фотографію одягу та створює нове зображення цієї людини, яка носить одяг, зберігаючи її позу, тіло та обличчя, одночасно передаючи форму, текстуру та деталі одягу.

  • 4 хвилини читання
  • Останнє оновлення
На цій сторінці4 хвилини читання
  1. Огляд
  2. Глибоке занурення
  3. Стратегічний вплив
  4. Майбутнє віртуального випробування з дифузійними моделями
  5. Реалізація в реальному світі
  6. Ризики та огорожі
  7. Дорожня карта впровадження
  8. Продовжуйте досліджувати
  9. Часті запитання

Огляд

Сучасні системи використовують дифузійні моделі, орієнтуючись на позу людини та контури тіла, замість того, щоб просто наклеювати одяг зверху. Це має значення, оскільки змінює те, як люди роблять покупки в Інтернеті, але показує, як може виглядати одяг, а не те, чи підійде він насправді.

Глибоке занурення

Віртуальна примірка виконує дві задачі, які взаємодіють одна з одною: зберегти людину незмінною (обличчя, волосся, тон шкіри, форму тіла, позу) і точно відтворити одяг (крій, колір, принт, логотип, текстуру тканини). Ранні підходи, такі як VITON (2018) і CP-VTON, працювали в два етапи. Спочатку вони деформували зображення плоского одягу, щоб відповідати позі людини, часто використовуючи сплайн тонкої пластини або навчене поле потоку, а потім друга мережа змішала деформований одяг із фотографією. Ці методи боролися з великими змінами пози, оклюзіями, такими як схрещені руки, і складними принтами, оскільки двовимірна деформація не може створити частини одягу, які ніколи не були видимі. Дифузійні моделі змінили другий етап. Замість змішування модель регенерує область одягу з шуму, обумовлюючись зображенням одягу, ключовими точками пози людини, картою розбору тіла та замаскованою версією оригінальної фотографії. TryOnDiffusion (2023) Google використовував дві паралельні мережі, які обмінювалися інформацією через перехресну увагу, дозволяючи одягу неявно деформуватися всередині моделі, а не окремим кроком; Google використовував цю групу методів для функції примірки в результатах покупок, показаних на реальних моделях різних розмірів. Відкриті дослідницькі моделі, такі як StableVITON, OOTDiffusion і IDM-VTON, адаптували Stable Diffusion для цього завдання. Поширена помилкова думка полягає в тому, що примірка визначає ваш розмір. Це не так. Модель не має розмірів розтяжності одягу чи вашого тіла; це створює правдоподібне зображення того, як одяг цього стилю має тенденцію драпіруватися. Невдалі режими включають топи, які виглядають однаково на кожному тілі, втрачений або змащений текст і логотипи, змінений тон шкіри чи форми тіла, вигадані руки та руки, а також слабші результати для типів фігури, тонів шкіри, стилю одягу чи поз, які рідко зустрічаються в даних тренувань.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє віртуального випробування з дифузійними моделями

Дослідження рухаються до відеопримірок, одягу з кількох предметів одягу та контролю над атрибутами посадки, такими як oversize проти slim. Важчим і невирішеним кроком є ​​зв’язування зображення з фізичною реальністю: поєднання таблиць розмірів, властивостей тканини та розмірів тіла, можливо, з 3D-моделями тіла та симуляцією тканини, щоб попередній перегляд відображав фактичну посадку, а не втішні припущення. Чи зменшує примірка повернення на практиці, залежить від цього зв’язку та від роздрібних продавців, які публікують чесні оцінки. Очікуйте постійної уваги до згоди та конфіденційності фотографій, які завантажують користувачі, а також до продуктивності різних організацій.

Реалізація в реальному світі

Інтернет-покупець вибирає модель, яка приблизно відповідає його типу фігури, і бачить блузку, зображену на цій людині в кількох позах, перш ніж вирішити, чи купувати.

Роздрібний продавець модного одягу фотографує кожен новий одяг один раз на плоскій поверхні та використовує генерацію примірок, щоб показати його на кількох моделях із каталогу замість того, щоб замовляти нову фотосесію.

Покупець завантажує власну фотографію всього тіла в додаток для примірок і бачить на собі піджак, помічаючи, що довжину рукава вгадали, а не виміряли.

Дослідницька група оцінює модель для примірки на тестовому наборі, який охоплює широкий діапазон розмірів тіла та відтінків шкіри, і виявляє, що логотипи та смуги спотворюють більше на великих тілах і незвичайних позах.

Ризики та огорожі

  • Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

  • Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

  • Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

  1. Визначте критерії прийнятності для точності, відкликання та вартості помилок.

  2. Тестуйте з даними, які відповідають реальним умовам виробництва.

  3. Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

  4. Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Virtual Try-On with Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

Що таке віртуальна спроба з дифузійними моделями?

Віртуальна примірка штучного інтелекту робить фотографію людини та фотографію одягу та створює нове зображення цієї людини, яка носить одяг, зберігаючи її позу, тіло та обличчя, одночасно передаючи форму, текстуру та деталі одягу. Сучасні системи використовують дифузійні моделі, орієнтуючись на позу людини та контури тіла, замість того, щоб просто наклеювати одяг зверху. Це має значення, оскільки змінює те, як люди роблять покупки в Інтернеті, але показує, як може виглядати одяг, а не те, чи підійде він насправді.

Які дві конкуруючі цілі має збалансувати кожна віртуальна пробна система?

Примірка має зберігати ідентичність, позу та тіло людини, передаючи крій, колір та принт одягу. Удосконалення одного часто шкодить іншому.

Як в основному працювали ранні методи, такі як VITON і CP-VTON?

У ранніх системах використовувався двоступеневий підхід: геометрична деформація (наприклад, сплайни тонких пластин), а потім мережа змішування.

Чому двовимірне викривлення не справлялося зі схрещеними руками чи великою зміною пози?

Деформація переміщує лише наявні пікселі, тому вона не може створювати прихованих або закритих частин одягу.

У дифузійній моделі для примірки, як модель впливає на область одягу?

Дифузійна примірка зафарбовує замасковану частину одягу шляхом придушення шумів, керуючись характеристиками одягу, інформацією про позу та зображенням решти особи.

Яку конструктивну особливість використав TryOnDiffusion від Google для перенесення одягу?

TryOnDiffusion використовував дві мережі, з’єднані перехресною увагою, щоб одяг міг неявно деформуватися всередині моделі.