РЪКОВОДСТВО за визуален AI

Структура от движение

Structure from Motion (SfM) реконструира геометрията на 3D сцената и позициите на камерата от набор от припокриващи се 2D снимки, направени от различни гледни точки.

2 min readПоследна актуализация

Преглед

It is the backbone of 3D mapping, photogrammetry, and modern reconstruction pipelines.

Дълбоко гмуркане

SfM решава две свързани неизвестни наведнъж: къде е била всяка камера, когато е направила снимка, и къде са разположени 3D точките в света. Започва с откриване на отличителни характерни точки (използвайки детектори като SIFT) във всяко изображение, след което съпоставя една и съща физическа точка в множество снимки. Използвайки тези съответствия и геометрията на това как 3D точките се проектират върху 2D изображения, системата оценява относителните пози на камерата чрез епиполярна геометрия. Точките се триангулират в рядък 3D облак и глобална оптимизация, наречена корекция на пакета, усъвършенства всички камери и точки заедно, за да минимизира грешката при повторна проекция. Резултатът е рядък облак от точки плюс калибрирани позиции на камерата – основното скеле, върху което се основават методите за по-плътна реконструкция.

Техническа информация

Математическото сърце на SfM е настройката на пакета: голяма нелинейна оптимизация на най-малките квадрати, която едновременно настройва позата и вътрешните характеристики на всяка камера и всяка 3D точка, така че техните проекции да съответстват най-добре на наблюдаваните местоположения на 2D елементи. Той минимизира „грешката при повторна проекция“ – пикселното разстояние между мястото, където се приземява точка в изображението и мястото, където текущата 3D оценка казва, че трябва да кацне – обикновено чрез Levenberg-Marquardt.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на структурата от движение

SfM все повече се слива с задълбочено обучение: детектори на научени функции и съпоставители (като SuperPoint и SuperGlue) обработват безтекстурни или повтарящи се сцени, с които класическият SIFT се бори. Той също така захранва представяния на невронни сцени като NeRF и Gaussian Splatting, които се нуждаят от позите на камерата, предоставени от SfM. Очаквайте по-бързи, по-стабилни конвейери от край до край, SfM в реално време на телефони за AR и по-тясно свързване със SLAM за картографиране на живо в роботиката и автономната навигация.

Внедряване в реалния свят

Фотограметрия с дрон, която превръща наборите от въздушни снимки в 3D терен и модели на сгради за геодезия

Възстановяване на пози на камерата за стартиране на NeRF и Gaussian Splatting реконструкции на сцени

Дигитално съхраняване на обекти на културно наследство и статуи като 3D модели от колекции от туристически снимки

Възстановяване на сцени на престъпление или злополука в 3D от снимки на следователи за съдебномедицински анализ

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Structure from Motion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

AnimateDiff Генериране на движение

Frequently asked questions

What is Structure from Motion?

Structure from Motion (SfM) реконструира геометрията на 3D сцената и позициите на камерата от набор от припокриващи се 2D снимки, направени от различни гледни точки. Това е гръбнакът на 3D картографирането, фотограметрията и модерните тръбопроводи за реконструкция.

Кои две неща оценява структурата от движение едновременно?

SfM съвместно решава 3D геометрията на сцената и къде е била всяка камера, когато е заснела всяко изображение.

Каква е ролята на съвпадението на функции в SfM?

Съпоставянето на открити характеристики (напр. SIFT ключови точки) в снимки дава съответствията, необходими за извеждане на геометрията.

Какво оптимизира корекцията на пакета?

Корекцията на пакета е глобално нелинейно прецизиране на най-малките квадрати, минимизиращо разликата в пикселите между наблюдаваните и проектираните точки.

Какъв вид 3D изход обикновено произвежда директно SfM?

SfM дава рядък набор от триъгълни точки и позиции на камерата; по-плътните методи са необходими за цели повърхности.

Коя геометрична концепция свързва съответните точки между два изгледа на камера?

Епиполярната геометрия ограничава къде точка, наблюдавана в едно изображение, може да се появи в друго, позволявайки оценка на позата.