Візуальний AI GUIDE

Чому AI генератори зображень помиляються

Генератори зображень штучного інтелекту помиляються, оскільки руки маленькі, дуже гнучкі, часто частково приховані та рідко описані в підписах.

  • 4 хвилини читання
  • Останнє оновлення
На цій сторінці4 хвилини читання
  1. Огляд
  2. Глибоке занурення
  3. Стратегічний вплив
  4. Майбутнє того, чому генератори зображень штучного інтелекту отримують неправильні руки
  5. Реалізація в реальному світі
  6. Ризики та огорожі
  7. Дорожня карта впровадження
  8. Продовжуйте досліджувати
  9. Часті запитання

Огляд

Моделі вивчають, як виглядають руки на поверхні, не вивчаючи достовірно їхню структуру, наприклад п’ять пальців на руці. Помилки рук стали загальновідомою ознакою синтетичних зображень, і розуміння того, чому вони трапляються, пояснює як покращення нових моделей, так і те, чому підрахунок пальців більше не є надійним способом виявлення підробок.

Глибоке занурення

Дифузійні моделі вчаться на мільярдах пар зображення-підпис, навчаючись усувати доданий шум. Вони дуже добре сприймають локальні візуальні візерунки: текстуру шкіри, освітлення, загальний вигляд руки. Чого вони ніколи не отримують, так це чіткого правила, що на руці є п’ять пальців, з’єднаних із долонею в певному порядку. Кілька факторів роблять руки жорсткими. На більшості фотографій руки займають невелику частину, тому на них мало пікселів. Моделі латентної дифузії, такі як Stable Diffusion, також зменшують зображення у вісім разів у кожному вимірі перед генерацією, що може залишити лише кілька прихованих клітин. Руки приймають величезну кількість поз, захоплюють об’єкти, накладаються одна на одну і часто частково приховані, тому навчальні дані повні неповних зображень. Пальці виглядають схожими, тому модель, що видає «пальці, пальці, пальці», не має сильного сигналу, який би повідомляв їй, коли зупинитися. Підписи майже ніколи не згадують руки, не кажучи вже про їхню позу, тому підказка мало вказівок. Результатом є набір знайомих помилок: зайві або відсутні пальці, злиті пальці, великі пальці на неправильному боці та руки, що розчиняються в предметах або інших людях. З подібних причин псуються зуби, вуха та прикраси. Новіші системи зменшили кількість таких збоїв. Допомогли більші моделі, вищі навчальні роздільності, краще відфільтровані та підписані дані, архітектури на основі трансформаторів і точне налаштування рейтингів уподобань людей. Версія 5 Midjourney у 2023 році була широко відзначена кращою роботою, а пізніші моделі з кількох лабораторій були вдосконалені. Але помилки нікуди не зникли, особливо в складних позах, натовпі та руках, що тримають речі. Поширеною помилкою є те, що модель «не може рахуватися». Точніше сказати, що він вивчає зовнішній вигляд статистично, а правильна структура виникає лише тоді, коли достатньо даних і ємності моделі.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє того, чому генератори зображень штучного інтелекту отримують неправильні руки

Помилки рук, ймовірно, продовжуватимуть зменшуватися, оскільки моделі зростатимуть і тренувальні дані покращаться, але незвичайні пози, зчеплені руки та руки, які маніпулюють об’єктами, залишаються складнішими, ніж проста розкрита долоня. Генерація відео додає нову версію проблеми, оскільки пальці повинні залишатися послідовними від кадру до кадру. Для тих, хто оцінює автентичність, ручна перевірка є слабким сигналом. Деформована рука все ще свідчить про створення зображення, але правильна рука нічого не доводить. Записи про походження та водяні знаки надійніші, ніж перевірка анатомії.

Реалізація в реальному світі

На ранньому портреті Stable Diffusion зображено людину, яка тримає чашку з кавою, обгорнувши її шістьма пальцями, типова помилка, коли модель поєднує багато поз, що перекривають руки.

У груповій сцені зі старішою моделлю руки двох людей зливаються там, де вони торкаються, оскільки модель не має чіткого уявлення про те, де закінчується одне тіло і починається інше.

Художниця подає ControlNet OpenPose або карту глибини, зроблену з фотографії її власної руки, щоб примусово вибрати правильну позу, а потім малює будь-які помилки, що залишилися.

Фактчекер зазначає, що ймовірна підробка має абсолютно нормальні руки, нагадуючи, що новіші генератори часто малюють руки правильно, і потрібні інші підказки.

Ризики та огорожі

  • Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

  • Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

  • Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

  1. Визначте критерії прийнятності для точності, відкликання та вартості помилок.

  2. Тестуйте з даними, які відповідають реальним умовам виробництва.

  3. Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

  4. Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Why AI Image Generators Get Hands Wrong quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

Чому генератори зображень штучного інтелекту потрапляють у руки неправильно?

Генератори зображень штучного інтелекту помиляються, оскільки руки маленькі, дуже гнучкі, часто частково приховані та рідко описані в підписах. Моделі вивчають, як виглядають руки на поверхні, не вивчаючи достовірно їхню структуру, наприклад п’ять пальців на руці. Помилки рук стали загальновідомою ознакою синтетичних зображень, і розуміння того, чому вони трапляються, пояснює як покращення нових моделей, так і те, чому підрахунок пальців більше не є надійним способом виявлення підробок.

Відповідно до посібника, що модель дифузії в основному вивчає з пар зображення-підпис?

Моделі дізнаються, як все виглядає статистично. Ніщо в навчанні не дає їм чіткого правила, що на руці п’ять пальців.

Як латентне стиснення в Stable Diffusion ускладнює малювання рук?

Маленька рука, яка зменшується у вісім разів у кожному вимірі, у підсумку має дуже мало місця для представлення п’яти різних пальців.

Чому титри мало допомагають моделям з руками?

Без тексту, що описує пози рук, модель не може пов’язати слова підказки зі структурою руки.

Яка версія Midjourney, за словами путівника, була широко відзначена кращими руками у 2023 році?

Версія 5 Midjourney, випущена в 2023 році, була широко відзначена покращеними руками, частиною ширшої тенденції масштабування та кращих даних.

Що робить робочий процес виявлення та повторного малювання у стилі ADetailer?

Збільшення врожаю дає руці набагато більше латентних клітин під час регенерації, що покращує її структуру.