Визуальное руководство по искусственному интеллекту

Деформируемые свертки

Деформируемые свертки позволяют нейронной сети изгибать свою сетку выборки, чтобы следовать фактической форме объектов, вместо того, чтобы проталкивать ее через жесткое квадратное окно.

2 минуты чтенияПоследнее обновление

Обзор

This makes models far better at handling odd shapes, scale changes, and geometric distortion.

Глубокое погружение

Обычная свертка производит выборку пикселей с фиксированными смещениями — аккуратную сетку 3x3 с центром в каждом месте. Это хорошо работает с текстурами, но плохо работает, когда объекты наклонены, растянуты или имеют странную форму. Деформируемые свертки, представленные Даем и его коллегами в исследовании Microsoft в 2017 году, добавляют небольшое изученное смещение к каждой из этих точек выборки. Сеть смотрит на входные данные и прогнозирует двумерный сдвиг для каждой позиции сетки, поэтому рецептивное поле может деформироваться, охватывая изогнутый край или следуя наклонному отрезку. Деформируемый пул ROI применяет ту же идею к объектам региона. Версия 2 (2018) добавила веса модуляции для каждой точки, позволяя слою ослаблять или усиливать каждую выборку, что повысило точность обнаружения объектов в таких тестах, как COCO.

Техническая информация

Смещения создаются дополнительным слоем свертки, работающим параллельно и выводящим 2N значений для N-точечного ядра (один dx, один dy на точку). Поскольку прогнозируемые смещения являются дробными, значения дискретных пикселей вычисляются с помощью билинейной интерполяции, что обеспечивает дифференцируемость всей операции. Смещения изучаются сквозным путем обычного обратного распространения ошибки — нет отдельного контроля, указывающего сети, где искать. Добавленная стоимость скромна, поскольку ветвь смещения легче по сравнению с картами основных объектов.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее деформируемых сверток

Деформируемое внимание стало основой современного обнаружения: Deformable DETR использует выученные смещения выборки, чтобы сделать трансформирующее внимание разреженным и быстрым, что значительно сокращает время обучения по сравнению с исходным DETR. Ожидается, что принцип деформирования продолжит распространяться на видео, трехмерные облака точек и модели на языке видения, где адаптивная выборка помогает обрабатывать движение, окклюзию и неправильную геометрию. По мере улучшения аппаратной поддержки нерегулярного доступа к памяти деформируемые операторы также должны стать дешевле и более широко применяться на периферийных устройствах.

Реальная реализация

Обнаружение объектов в COCO, где деформируемые слои повышают точность обнаружения вытянутых или повернутых объектов, таких как поезда и жирафы.

Семантическая сегментация уличных сцен, помогающая моделям отслеживать изогнутые линии разметки и неправильные очертания зданий.

Деформируемый DETR для сквозного обнаружения с использованием изученных смещений для повышения эффективности внимания трансформатора

Медицинская визуализация, когда опухоли и органы имеют нежесткую форму, которую плохо фиксируют фиксированные сетки.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deformable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Глубоко отделимые свертки

Часто задаваемые вопросы

What is Deformable Convolutions?

Деформируемые свертки позволяют нейронной сети изгибать свою сетку выборки, чтобы следовать фактической форме объектов, вместо того, чтобы проталкивать ее через жесткое квадратное окно. Благодаря этому модели намного лучше справляются с нестандартными формами, изменениями масштаба и геометрическими искажениями.

Что добавляет деформируемая свертка по сравнению со стандартной сверткой?

Деформируемые свертки прогнозируют изученное смещение (dx, dy) для каждого места выборки, позволяя сетке деформироваться в соответствии с формой объекта.

Как генерируются смещения выборки в деформируемой свертке?

Параллельная ветвь свертки выводит смещения, которые изучаются сквозным методом обратного распространения ошибки.

Поскольку прогнозируемые смещения обычно являются дробными, как отбираются значения пикселей в этих позициях?

Дробные смещения требуют билинейной интерполяции, которая позволяет дифференцировать операцию для обучения.

Что Deformable ConvNets v2 (2018) добавило к оригиналу?

В версии 2 появилась модуляция — изученный вес для каждой точки выборки, который может усиливать или подавлять ее влияние, повышая точность.

Почему деформируемые извилины особенно полезны для объектов неправильной формы?

Изгибая сетку выборки, эффективное рецептивное поле выравнивается по геометрии объекта, а не по жесткому квадрату.