Визуальное руководство по искусственному интеллекту

Обнаружение трансформатора DETR

DETR (DEtection TRansformer) переосмысливает обнаружение объектов как прямую задачу прогнозирования набора, решаемую с помощью преобразователя, удаляя разработанные вручную шаги, такие как якорные коробки и немаксимальное подавление.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it gave detection a clean, end-to-end pipeline that inspired a wave of transformer-based vision models.

Глубокое погружение

DETR, представленный Facebook AI в 2020 году, сочетает в себе магистраль CNN с преобразователем-кодер-декодером. CNN извлекает особенности изображения; кодер смешивает глобальный контекст по всему изображению; а декодер берет фиксированный набор изученных «запросов объектов» и превращает каждый из них либо в обнаруженный объект (класс плюс ограничивающий прямоугольник), либо в результат «нет объекта». Ключевой новинкой является двустороннее сопоставление: во время обучения венгерский алгоритм находит взаимно-однозначное соответствие между предсказаниями и достоверными объектами, поэтому модель учится напрямую выводить уникальный блок для каждого объекта. Это исключает немаксимальное подавление и настройку якоря. Компромиссами были медленная сходимость и более низкая точность при работе с небольшими объектами, что было решено в последующих разработках, таких как Deformable DETR.

Техническая информация

Определяющим механизмом DETR является потеря на основе набора с венгерским сопоставлением. Вместо того, чтобы оценивать тысячи полей привязки, он выдает фиксированное количество прогнозов (часто 100 объектных запросов) и сопоставляет их один к одному с истинными объектами, наказывая как ошибки классификации, так и ошибки блоков в совпавших парах и переводя несовпадающие запросы в состояние «нет объекта». Поскольку сопоставление является взаимно однозначным, обнаружение дубликатов подавляется замыслом, а не отдельным этапом постобработки.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее обнаружения трансформаторов DETR

DETR выпустила целое семейство детекторных трансформаторов. Такие варианты, как Deformable DETR, DAB-DETR, DN-DETR и DINO, значительно ускорили обучение и повысили точность, а модели в стиле DINO достигли вершины тестов обнаружения. Сквозная парадигма, основанная на запросах, теперь распространяется на сегментацию, отслеживание и трехмерное обнаружение, а на ее основе построены детекторы открытого словаря. Ожидайте продолжения конвергенции обнаружения, сегментации и языкового обоснования в унифицированных архитектурах преобразователей, при этом DETR запомнится как ключевой шаг, который устранил созданную вручную эвристику.

Реальная реализация

Обнаружение и группирование пешеходов и транспортных средств в наборах данных исследований автономного вождения

Обеспечение паноптической сегментации при расширении до попиксельного прогнозирования маски

Служит базовой архитектурой для детекторов открытого словаря и заземления.

Поиск объектов на изображениях розничных полок без настройки размеров привязок для каждого набора данных

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DETR Transformer Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Восстановление трансформатора SwinIR

Часто задаваемые вопросы

What is DETR Transformer Detection?

DETR (DEtection TRansformer) переосмысливает обнаружение объектов как прямую задачу прогнозирования набора, решаемую с помощью преобразователя, удаляя разработанные вручную шаги, такие как якорные коробки и немаксимальное подавление. Это важно, потому что оно дало обнаружению чистый, сквозной конвейер, который вдохновил волну моделей машинного зрения на основе трансформаторов.

Что удаляет DETR по сравнению с традиционными детекторами, такими как Faster R-CNN?

DETR является сквозным и прогнозирует набор блоков напрямую, устраняя привязки и этап постобработки немаксимального подавления.

Какой алгоритм использует DETR для сопоставления прогнозов с достоверными объектами во время обучения?

DETR использует венгерский алгоритм для формирования однозначного назначения между предсказаниями и объектами основной истины для потери их набора.

Что такое «объектные запросы» DETR?

Объектные запросы представляют собой фиксированное количество изученных векторов; декодер преобразует каждый из них в предсказание объекта или результат «нет объекта».

Какую общую архитектуру объединяет DETR?

DETR объединяет сверточную магистраль для функций с преобразователем-кодер-декодером для предсказания набора.

Почему DETR не нуждается в немаксимальном подавлении?

Потеря соответствия один к одному учит модель выдавать один прогноз для каждого объекта, поэтому постобработка удаления дубликатов не требуется.