Візуальний AI GUIDE

Виявлення трансформатора DETR

DETR (DEtection TRansformer) перетворює виявлення об’єктів як проблему прямого передбачення набору, що вирішується за допомогою трансформатора, видаляючи розроблені вручну етапи, такі як анкерні коробки та немаксимальне придушення.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it gave detection a clean, end-to-end pipeline that inspired a wave of transformer-based vision models.

Глибоке занурення

DETR, представлений Facebook AI у 2020 році, поєднує магістраль CNN із трансформаторним кодером-декодером. CNN виділяє риси зображення; кодер змішує глобальний контекст по всьому зображенню; і декодер приймає фіксований набір вивчених «запитів об’єктів» і перетворює кожен або на виявлений об’єкт (клас плюс обмежувальна рамка), або на результат «без об’єкта». Ключовою новинкою є двостороннє зіставлення: під час навчання угорський алгоритм знаходить присвоєння один-до-одного між прогнозами та об’єктами базової правди, тому модель навчається виводити унікальний блок безпосередньо для кожного об’єкта. Це усуває немаксимальне придушення та налаштування прив’язки. Компромісами були повільна конвергенція та менша точність дрібних об’єктів, які були спрямовані на наступні заходи, такі як Deformable DETR.

Технічне розуміння

Визначальним механізмом DETR є втрата на основі набору з угорським узгодженням. Замість того, щоб підраховувати тисячі блоків прив’язки, він створює фіксовану кількість прогнозів (часто 100 запитів на об’єкти) і порівнює їх один до одного з справжніми об’єктами, штрафуючи як помилки класифікації, так і помилки блоків у відповідних парах і штовхаючи незбігаються запити до «без об’єктів». Оскільки зіставлення відбувається один-до-одного, виявлення дублікатів пригнічується дизайном, а не окремим кроком постобробки.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє виявлення трансформаторів DETR

DETR випустив цілу сімейку трансформаторів виявлення. Такі варіанти, як деформований DETR, DAB-DETR, DN-DETR і DINO, значно пришвидшили навчання та підвищили точність, а моделі в стилі DINO досягли найвищих показників тестів виявлення. Наскрізна парадигма на основі запитів тепер поширюється на сегментацію, відстеження та 3D-виявлення, а детектори відкритого словника будуються на її основі. Очікуйте продовження конвергенції виявлення, сегментації та обґрунтування мови в уніфіковані трансформаторні архітектури, де DETR згадується як ключовий крок, який усунув створені вручну евристики.

Реалізація в реальному світі

Виявлення та блокування пішоходів і транспортних засобів у наборах даних дослідження автономного водіння

Потужність панорамної сегментації, якщо її розширити до попіксельного передбачення маски

Служить базовою архітектурою для детекторів із відкритим словником і заземленням

Розташування об’єктів на зображеннях роздрібних полиць без налаштування розмірів прив’язки для кожного набору даних

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DETR Transformer Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Відновлення трансформатора SwinIR

Часті запитання

What is DETR Transformer Detection?

DETR (DEtection TRansformer) перетворює виявлення об’єктів як проблему прямого передбачення набору, що вирішується за допомогою трансформатора, видаляючи розроблені вручну етапи, такі як анкерні коробки та немаксимальне придушення. Це важливо, тому що це дало виявлення чистий, наскрізний конвеєр, який надихнув хвилю трансформаторних моделей зору.

Що видаляє DETR порівняно з традиційними детекторами, такими як Faster R-CNN?

DETR є наскрізним і прогнозує набір блоків безпосередньо, усуваючи прив’язки та етап постобробки немаксимального придушення.

Який алгоритм використовує DETR для зіставлення прогнозів із наземними об’єктами під час навчання?

DETR використовує угорський алгоритм для формування однозначного розподілу між передбаченнями та об’єктами наземної правди для його втрати набору.

Що таке "об'єктні запити" DETR?

Об’єктні запити – це фіксована кількість вивчених векторів; декодер перетворює кожен у прогноз об’єкта або результат «без об’єкта».

Яку загальну архітектуру поєднує DETR?

DETR поєднує згорткову магістраль для функцій із трансформаторним кодером-декодером для передбачення набору.

Чому DETR не потребує немаксимального придушення?

Втрата відповідності «один-до-одного» вчить модель створювати єдине передбачення для кожного об’єкта, тому додаткова обробка для видалення дублікатів не потрібна.