ДаліНаступний посібник
Генератори зображень штучного інтелекту на уроках мистецтва
Візуальний ШІ
Візуальний AI GUIDE
Генератори зображень штучного інтелекту помиляються, оскільки руки маленькі, дуже гнучкі, часто частково приховані та рідко описані в підписах.
Моделі вивчають, як виглядають руки на поверхні, не вивчаючи достовірно їхню структуру, наприклад п’ять пальців на руці. Помилки рук стали загальновідомою ознакою синтетичних зображень, і розуміння того, чому вони трапляються, пояснює як покращення нових моделей, так і те, чому підрахунок пальців більше не є надійним способом виявлення підробок.
Дифузійні моделі вчаться на мільярдах пар зображення-підпис, навчаючись усувати доданий шум. Вони дуже добре сприймають локальні візуальні візерунки: текстуру шкіри, освітлення, загальний вигляд руки. Чого вони ніколи не отримують, так це чіткого правила, що на руці є п’ять пальців, з’єднаних із долонею в певному порядку. Кілька факторів роблять руки жорсткими. На більшості фотографій руки займають невелику частину, тому на них мало пікселів. Моделі латентної дифузії, такі як Stable Diffusion, також зменшують зображення у вісім разів у кожному вимірі перед генерацією, що може залишити лише кілька прихованих клітин. Руки приймають величезну кількість поз, захоплюють об’єкти, накладаються одна на одну і часто частково приховані, тому навчальні дані повні неповних зображень. Пальці виглядають схожими, тому модель, що видає «пальці, пальці, пальці», не має сильного сигналу, який би повідомляв їй, коли зупинитися. Підписи майже ніколи не згадують руки, не кажучи вже про їхню позу, тому підказка мало вказівок. Результатом є набір знайомих помилок: зайві або відсутні пальці, злиті пальці, великі пальці на неправильному боці та руки, що розчиняються в предметах або інших людях. З подібних причин псуються зуби, вуха та прикраси. Новіші системи зменшили кількість таких збоїв. Допомогли більші моделі, вищі навчальні роздільності, краще відфільтровані та підписані дані, архітектури на основі трансформаторів і точне налаштування рейтингів уподобань людей. Версія 5 Midjourney у 2023 році була широко відзначена кращою роботою, а пізніші моделі з кількох лабораторій були вдосконалені. Але помилки нікуди не зникли, особливо в складних позах, натовпі та руках, що тримають речі. Поширеною помилкою є те, що модель «не може рахуватися». Точніше сказати, що він вивчає зовнішній вигляд статистично, а правильна структура виникає лише тоді, коли достатньо даних і ємності моделі.
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Помилки рук, ймовірно, продовжуватимуть зменшуватися, оскільки моделі зростатимуть і тренувальні дані покращаться, але незвичайні пози, зчеплені руки та руки, які маніпулюють об’єктами, залишаються складнішими, ніж проста розкрита долоня. Генерація відео додає нову версію проблеми, оскільки пальці повинні залишатися послідовними від кадру до кадру. Для тих, хто оцінює автентичність, ручна перевірка є слабким сигналом. Деформована рука все ще свідчить про створення зображення, але правильна рука нічого не доводить. Записи про походження та водяні знаки надійніші, ніж перевірка анатомії.
На ранньому портреті Stable Diffusion зображено людину, яка тримає чашку з кавою, обгорнувши її шістьма пальцями, типова помилка, коли модель поєднує багато поз, що перекривають руки.
У груповій сцені зі старішою моделлю руки двох людей зливаються там, де вони торкаються, оскільки модель не має чіткого уявлення про те, де закінчується одне тіло і починається інше.
Художниця подає ControlNet OpenPose або карту глибини, зроблену з фотографії її власної руки, щоб примусово вибрати правильну позу, а потім малює будь-які помилки, що залишилися.
Фактчекер зазначає, що ймовірна підробка має абсолютно нормальні руки, нагадуючи, що новіші генератори часто малюють руки правильно, і потрібні інші підказки.
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Генератори зображень штучного інтелекту помиляються, оскільки руки маленькі, дуже гнучкі, часто частково приховані та рідко описані в підписах. Моделі вивчають, як виглядають руки на поверхні, не вивчаючи достовірно їхню структуру, наприклад п’ять пальців на руці. Помилки рук стали загальновідомою ознакою синтетичних зображень, і розуміння того, чому вони трапляються, пояснює як покращення нових моделей, так і те, чому підрахунок пальців більше не є надійним способом виявлення підробок.
Моделі дізнаються, як все виглядає статистично. Ніщо в навчанні не дає їм чіткого правила, що на руці п’ять пальців.
Маленька рука, яка зменшується у вісім разів у кожному вимірі, у підсумку має дуже мало місця для представлення п’яти різних пальців.
Без тексту, що описує пози рук, модель не може пов’язати слова підказки зі структурою руки.
Версія 5 Midjourney, випущена в 2023 році, була широко відзначена покращеними руками, частиною ширшої тенденції масштабування та кращих даних.
Збільшення врожаю дає руці набагато більше латентних клітин під час регенерації, що покращує її структуру.
Продовжуйте вчитися
Інші посібники, вибрані для цієї теми
ДаліНаступний посібник
Генератори зображень штучного інтелекту на уроках мистецтва
Візуальний ШІ