РЪКОВОДСТВО за визуален AI

Деформируеми извивки

Деформируемите навивки позволяват на невронната мрежа да огъне своята решетка за вземане на проби, за да следва действителната форма на обектите, вместо да я прокара през твърд квадратен прозорец.

2 min readПоследна актуализация

Преглед

This makes models far better at handling odd shapes, scale changes, and geometric distortion.

Дълбоко гмуркане

Нормалната конволюция взема проби от пиксели при фиксирани отмествания — подредена решетка 3x3, центрирана на всяко място. Това работи добре за текстури, но се затруднява, когато обектите са наклонени, разтегнати или със странна форма. Деформируемите навивки, въведени от Dai и колеги от Microsoft Research през 2017 г., добавят малко научено отместване към всяка от тези точки за вземане на проби. Мрежата разглежда входа и прогнозира 2D изместване за всяка позиция на мрежата, така че възприемащото поле може да се изкриви, за да прегърне извит ръб или да следва наклонен крайник. Обединяването на деформируемата ROI прилага същата идея към характеристиките на региона. Версия 2 (2018) добави тегла на модулация на точка, позволявайки на слоя да смекчи или усили всяка проба, което повиши точността на откриване на обекти при бенчмаркове като COCO.

Техническа информация

Отместванията се произвеждат от допълнителен конволюционен слой, работещ паралелно, извеждащ 2N стойности за N-точково ядро ​​(един dx, един dy на точка). Тъй като прогнозираните отмествания са дробни, стойностите на взетите пиксели се изчисляват с билинейна интерполация, която поддържа цялата операция диференцируема. Отместванията се научават от край до край чрез нормално обратно разпространение — няма отделно наблюдение, което да казва на мрежата къде да търси. Добавените разходи са скромни, тъй като офсетният клон е лек в сравнение с картите на основните характеристики.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на деформируемите извивки

Деформируемото внимание се е превърнало в гръбнака на съвременното откриване: Деформируемият DETR използва научени отмествания на семплиране, за да направи вниманието на трансформатора рядко и бързо, намалявайки драстично времето за обучение в сравнение с оригиналния DETR. Очаквайте деформируемият принцип да продължи да се разпространява във видео, 3D облаци от точки и модели на визуален език, където адаптивното вземане на проби помага да се справят с движението, оклузията и неправилната геометрия. Тъй като хардуерната поддръжка за нередовен достъп до паметта се подобрява, деформируемите оператори също трябва да станат по-евтини и по-широко разгърнати на крайни устройства.

Внедряване в реалния свят

Откриване на обекти на COCO, където деформируемите слоеве повишават точността на удължени или завъртяни обекти като влакове и жирафи

Семантично сегментиране на улични сцени, помагащо на моделите да проследят извити маркировки на платна и неправилни очертания на сгради

Деформируем DETR за откриване от край до край, използвайки научени отмествания, за да направи вниманието на трансформатора ефективно

Медицинско изображение, при което туморите и органите имат нетвърди форми, които фиксираните решетки улавят лошо

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deformable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Дълбокоразделими извивки

Frequently asked questions

What is Deformable Convolutions?

Деформируемите навивки позволяват на невронната мрежа да огъне своята решетка за вземане на проби, за да следва действителната форма на обектите, вместо да я прокара през твърд квадратен прозорец. Това прави моделите много по-добри при справяне със странни форми, промени в мащаба и геометрични изкривявания.

Какво добавя деформируемата намотка в сравнение със стандартната намотка?

Деформируемите навивки предвиждат научено отместване (dx, dy) за всяко място за вземане на проби, позволявайки на решетката да се изкриви, за да съответства на формите на обекта.

Как се генерират отместванията на вземане на проби в деформируема намотка?

Паралелен конволюционен клон извежда отместванията, които се научават от край до край чрез обратно разпространение.

Тъй като предвидените отмествания обикновено са дробни, как се вземат проби от стойностите на пикселите на тези позиции?

Дробните отмествания изискват билинейна интерполация, която поддържа операцията диференцируема за обучение.

Какво добави Deformable ConvNets v2 (2018) към оригинала?

v2 въведе модулация, научено тегло на точка на вземане на проби, което може да усили или потисне влиянието си, подобрявайки точността.

Защо деформируемите извивки са особено полезни за обекти с неправилна форма?

Чрез огъване на решетката за вземане на проби ефективното рецептивно поле се изравнява с геометрията на обекта вместо с твърд квадрат.