ДалееСледующее руководство
Генераторы изображений AI в художественном классе
Визуальный ИИ
Визуальное руководство по искусственному интеллекту
Генераторы изображений с искусственным интеллектом ошибаются, потому что руки маленькие, очень гибкие, часто частично скрыты и редко описываются в подписях.
Модели изучают, как руки выглядят на поверхности, не изучая их строение, например пять пальцев на руке. Ошибки рук стали общеизвестным признаком синтетических изображений, и понимание того, почему они происходят, объясняет, как улучшились новые модели и почему подсчет пальцев больше не является надежным способом обнаружения подделок.
Модели диффузии обучаются на миллиардах пар изображений и подписей, обучаясь обращать вспять добавленный шум. Они очень хорошо различают местные визуальные закономерности: текстуру кожи, освещение, общий вид руки. Чего они никогда не получают, так это явного правила, согласно которому на руке пять пальцев соединены с ладонью в определенном порядке. Несколько факторов делают руки твердыми. Руки занимают небольшую часть большинства фотографий, поэтому пикселей у них мало. Модели скрытой диффузии, такие как Stable Diffusion, также перед генерацией сжимают изображения в восемь раз в каждом измерении, в результате чего на руке может остаться лишь несколько скрытых клеток. Руки принимают огромное количество поз, захватывают предметы, перекрывают друг друга и часто частично скрыты, поэтому данные обучения полны неполных представлений. Пальцы похожи друг на друга, поэтому модель, производящая «палец, палец, палец», не имеет четкого сигнала, говорящего ей, когда остановиться. В подписях почти никогда не упоминаются руки, не говоря уже об их позе, поэтому подсказка мало что дает. В результате получается набор знакомых ошибок: лишние или отсутствующие пальцы, сросшиеся пальцы, большой палец не на той стороне и руки, слипающиеся с предметами или другими людьми. По тем же причинам портятся зубы, уши и украшения. Новые системы уменьшили количество этих сбоев. Более крупные модели, более высокое разрешение обучения, лучше отфильтрованные и снабженные субтитрами данные, архитектура на основе трансформаторов и точная настройка рейтингов предпочтений человека — все это помогло. Версия 5 Midjourney в 2023 году была широко известна лучшими руками, а более поздние модели из нескольких лабораторий еще больше улучшились. Однако ошибки не исчезли, особенно в сложных позах, толпе и руках, держащих вещи. Распространенным заблуждением является то, что модель «не умеет считать». Точнее сказать, что он изучает внешний вид статистически, и правильная структура возникает только тогда, когда данных и возможностей модели достаточно.
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Ошибки рук, скорее всего, будут уменьшаться по мере роста моделей и улучшения обучающих данных, но необычные позы, переплетенные руки и руки, манипулирующие предметами, по-прежнему сложнее, чем простая открытая ладонь. Генерация видео добавляет новую версию проблемы, поскольку пальцы должны оставаться последовательными от кадра к кадру. Для тех, кто судит о подлинности, ручная проверка является слабым сигналом. Деформированная рука по-прежнему предполагает, что изображение было создано, но правильная рука ничего не доказывает. Записи о происхождении и водяные знаки более надежны, чем проверка анатомии.
На раннем портрете Stable Diffusion изображен человек, держащий чашку кофе, обхватив ее шестью пальцами, что является типичной неудачей, когда модель совмещает множество перекрывающихся поз хвата.
В групповой сцене старой модели руки двух людей сливаются в месте их соприкосновения, потому что модель не имеет четкого представления о том, где заканчивается одно тело и начинается другое.
Художник передает в ControlNet OpenPose или карту глубины, созданную на основе фотографии собственной руки, чтобы добиться правильной позы, а затем дорисовывает все оставшиеся ошибки.
Фактчекер отмечает, что у подозреваемого фейка совершенно нормальные руки, что является напоминанием о том, что новые генераторы часто правильно рисуют руки и необходимы другие подсказки.
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Генераторы изображений с искусственным интеллектом ошибаются, потому что руки маленькие, очень гибкие, часто частично скрыты и редко описываются в подписях. Модели изучают, как руки выглядят на поверхности, не изучая их строение, например пять пальцев на руке. Ошибки рук стали общеизвестным признаком синтетических изображений, и понимание того, почему они происходят, объясняет, как улучшились новые модели и почему подсчет пальцев больше не является надежным способом обнаружения подделок.
Модели узнают, как все выглядит статистически. Ничто в обучении не дает им явного правила, что на руке пять пальцев.
Маленькая рука, которая сжимается в восемь раз в каждом измерении, в итоге имеет очень мало места для отображения пяти отдельных пальцев.
Без текста, описывающего позы рук, модель не может связать слова-подсказки со структурой рук.
Версия 5 Midjourney, выпущенная в 2023 году, была широко известна улучшенными руками, что является частью более широкой тенденции масштабирования и улучшения данных.
Увеличение урожая дает руке во время регенерации гораздо больше скрытых клеток, что улучшает ее структуру.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Генераторы изображений AI в художественном классе
Визуальный ИИ