Потеря восприятия и LPIPS
Потеря восприятия измеряет, насколько похожи два изображения для людей, путем сравнения функций глубокой нейронной сети вместо необработанных пикселей.
Обзор
It matters because pixel-by-pixel comparison wrongly punishes tiny shifts and blurs detail, while perceptual loss rewards sharp, realistic results.
Глубокое погружение
Традиционные потери, такие как L2 (среднеквадратическая ошибка), сравнивают изображения попиксельно, поэтому сдвиг на один пиксель или немного другая текстура выглядят как огромная ошибка, даже если люди ее почти не замечают. Вместо этого потеря восприятия пропускает оба изображения через предварительно обученную сеть (часто VGG) и сравнивает активации от промежуточных слоев. Поскольку эти функции кодируют края, текстуры и части объектов, а не точные значения пикселей, потери лучше согласуются с человеческим мнением, обеспечивая четкие, семантически верные результаты. LPIPS (Сходство выученных перцептивных изображений), представленный Чжаном и др. в 2018 году формализует это: он извлекает глубокие особенности, нормализует их и применяет полученные веса, откалиброванные на основе тысяч суждений о сходстве людей, создавая единый показатель расстояния, где более низкий показатель означает более схожий по восприятию.
Техническая информация
LPIPS пропускает оба изображения через фиксированную магистраль (VGG, AlexNet или SqueezeNet), нормализует активации каналов на нескольких уровнях, а затем извлекает квадрат разности в каждом пространственном положении. Небольшой набор изученных весов для каждого канала масштабирует эти различия, прежде чем они будут усреднены в пространстве и суммированы по слоям. Эти веса были обучены на наборе данных BAPPS, основанном на человеческих суждениях с двумя альтернативами и вынужденным выбором, поэтому метрика отражает то, что люди на самом деле воспринимают, а не простое расстояние между признаками.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее потери восприятия и LPIPS
Показатели восприятия смещаются от магистральных сетей CNN к функциям моделей с самоконтролем и преобразователем зрения, таких как DINO и CLIP, которые улавливают более богатую семантику. Ожидайте более тесной интеграции с обучением диффузионной модели и оценкой преобразования текста в изображение, а также оценками восприятия, настроенными на временную согласованность видео. Исследователи также исследуют «слепые зоны» LPIPS: его можно обмануть враждебно, и он слабо коррелирует с качеством при очень высокой точности, что мотивирует появление новых показателей, ориентированных на человека, таких как DISTS и ансамблевые подходы.
Реальная реализация
Обучение сетей сверхвысокого разрешения (например, SRGAN), чтобы увеличенные фотографии выглядели резкими и текстурированными, а не размытыми.
Оценка сжатия изображения и кодеков путем оценки того, насколько близко по восприятию декодированное изображение к оригиналу.
Руководящая передача стиля, при которой контент сопоставляется с помощью глубоких функций VGG, а не точных пикселей.
Сравнительный анализ генераторов изображений GAN и диффузии путем сообщения о расстоянии LPIPS между сгенерированными и реальными изображениями.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Perceptual Loss and LPIPS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Потеря фокуса для несбалансированного обнаружения
Часто задаваемые вопросы
What is Perceptual Loss and LPIPS?
Потеря восприятия измеряет, насколько похожи два изображения для людей, путем сравнения функций глубокой нейронной сети вместо необработанных пикселей. Это важно, потому что попиксельное сравнение ошибочно наказывает за малейшие сдвиги и размывает детали, в то время как потеря восприятия вознаграждает резкие и реалистичные результаты.
Почему потеря L2 на основе пикселей часто неверно оценивает сходство изображений по сравнению с потерей восприятия?
L2 сравнивает пиксели напрямую, поэтому небольшие пространственные сдвиги или различия в текстурах регистрируются как большие ошибки, даже если человеку изображение кажется хорошим.
Что LPIPS в первую очередь сравнивает между двумя изображениями?
LPIPS извлекает глубокие активации функций из фиксированной магистрали и измеряет их расстояние, что лучше соответствует человеческому восприятию, чем пиксели.
Как определялись веса каждого канала в LPIPS?
Веса были изучены для соответствия большому набору данных (BAPPS) человеческих решений о сходстве с двумя альтернативами и вынужденным выбором.
Какая магистральная сеть чаще всего связана с классической потерей восприятия (функций)?
Карты промежуточных объектов VGG стали стандартом для потери восприятия в таких задачах, как сверхразрешение и передача стиля.
Какая задача больше всего выигрывает от использования потери восприятия вместо чистого L2?
Сети со сверхвысоким разрешением, обученные с потерями восприятия, создают более четкие и реалистичные текстуры, тогда как L2 имеет тенденцию давать размытые средние значения.