РЪКОВОДСТВО за визуален AI

Проследяване на множество обекти

Проследяването на множество обекти (MOT) следва много обекти - пешеходци, коли, играчи - през кадрите на видео, като дава на всеки последователна идентичност във времето.

2 min readПоследна актуализация

Преглед

It's the backbone of autonomous driving perception, sports analytics, and smart-city traffic monitoring.

Дълбоко гмуркане

Проследяването на множество обекти отговаря не само на „какво има във всеки кадър“, но и на „кое откриване във втори кадър е същият обект като в първи кадър“. Доминиращата парадигма е проследяване чрез откриване: детектор на обект (като YOLO) намира ограничаващи кутии за всеки кадър, след което тракер ги свързва във времето в траектории. SORT съчетава филтър на Калман, който предвижда къде ще се движи всеки обект, с унгарския алгоритъм за оптимално съвпадение на кутията. DeepSORT добавя вграждане на научен външен вид, така че обектите да могат да бъдат повторно идентифицирани след оклузия. ByteTrack подобри точността, като също асоциира откривания с ниска степен на сигурност, вместо да ги отхвърля. Основните трудности са оклузия, превключватели на идентичност (размяна на идентификатори, когато обекти се пресичат), пренаселени сцени и обекти, влизащи или излизащи от рамката.

Техническа информация

Тракерът поддържа „трака“ за всеки обект с модел на движение. Филтърът на Калман предвижда следващата позиция на всяка песен; новите засичания се съпоставят с прогнозите чрез изчисляване на цена (припокриване/IoU плюс сходство на външен вид) и решаване на задачата с унгарския алгоритъм. Вграждане на външния вид — компактни вектори на функции от мрежа за повторна идентификация — позволяват на системата да възстанови правилната идентичност, след като обектът е скрит за кратко, предотвратявайки превключванията на ID, които моделите с чисто движение страдат в пренаселени сцени.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на многообектното проследяване

Проследяването се движи към трансформаторни модели от край до край (като TrackFormer и MOTR), които съвместно откриват и асоциират обекти в една мрежа, премахвайки крехкия ръчно настроен етап на съвпадение. Очаквайте по-силно проследяване с множество камери и 3D за автономни превозни средства и големи обекти, плюс проследяване на произволни обекти с отворен речник, а не на фиксирани категории. По-добрата дългосрочна повторна идентификация и устойчивостта при тежка оклузия и тълпи остават активни цели, все повече подпомагани от моделите на основата, които предоставят богати визуални характеристики.

Внедряване в реалния свят

Автономно възприемане на превозни средства, което проследява околните автомобили, велосипедисти и пешеходци, за да предвиди техните пътища и да избегне сблъсъци

Спортни анализи, които следват всеки играч и топката, за да изчислят изминато разстояние, формации и статистики за притежание

Системи за интелигентен градски трафик, които броят и следват превозните средства, за да измерват потока, да откриват задръствания и сигнали за време

Анализи на търговията на дребно и сигурността, които проследяват движението на купувачите през магазин или хората през транзитен център

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Object Tracking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Откриване на обекти

Frequently asked questions

What is Multi-Object Tracking?

Проследяването на множество обекти (MOT) следва много обекти - пешеходци, коли, играчи - през кадрите на видео, като дава на всеки последователна идентичност във времето. Това е гръбнакът на възприемането на автономното шофиране, спортните анализи и наблюдението на интелигентния градски трафик.

Каква е основната цел на проследяването на множество обекти?

MOT присвоява и поддържа постоянен идентификатор за всеки обект, докато се движи през видео, свързвайки откриванията във времето в траектории.

Какво включва парадигмата „проследяване чрез откриване“?

Проследяването чрез откриване изпълнява детектор на обекти за всеки кадър и след това асоциира получените полета във времето в непрекъснати следи.

Каква роля играе филтърът на Калман в тракери като SORT?

Филтърът на Калман моделира движението на всеки обект и прогнозира следващата му позиция, която след това се съпоставя с нови открития.

Какво добави DeepSORT към SORT?

DeepSORT въведе вектори за характеристики на външния вид, така че обектите да могат да бъдат повторно идентифицирани, след като са били скрити за кратко, намалявайки превключвателите за идентичност.

Какво е „превключване на самоличността“ при проследяване на множество обекти?

Превключване на самоличност възниква, когато тракер неправилно преназначава идентификатори между обекти, обикновено когато те се припокриват или пресичат в претъпкани сцени.