Vizuální průvodce AI

Monokulární odhad hloubky

Monokulární odhad hloubky předpovídá, jak daleko je každý pixel od jedné běžné fotografie – není potřeba žádná stereo kamera, lidar ani hloubkový senzor.

2 minuty čteníNaposledy aktualizováno

Přehled

It lets one camera perceive 3D structure from a flat 2D image.

Hluboký ponor

Lidé mohou posuzovat hloubku z jednoho oka pomocí vodítek, jako je perspektiva, relativní velikost, přechody textury, stínování a okluze. Monokulární odhad hloubky učí neuronové sítě stejnému triku: vloží jeden RGB obrázek a vydá hodnotu hloubky pro každý pixel. Vzhledem k tomu, že 2D obraz je ze své podstaty nejednoznačný, pokud jde o absolutní měřítko, je tento úkol obtížný – mnoho 3D scén může promítat do stejného obrazu. Sítě se učí statistické priority z velkých souborů dat, aby to vyřešily. Trénink přichází ve dvou variantách: pod dohledem, využívající skutečnou hloubku ze senzorů lidar nebo RGB-D, a samokontrolovaný, který se učí hloubku čistě z videa nebo stereo párů tím, že vynucuje, aby předpokládaná hloubka správně přemítala jeden pohled do druhého. Nedávné základní modely jako MiDaS a Depth Anything pozoruhodně zobecňují napříč neviditelnými scénami.

Technický přehled

Metody s vlastním dohledem využívají geometrii místo štítků. Vzhledem ke dvěma pohledům (stereo nebo po sobě jdoucím snímkům videa) a předpokládané hloubkové mapě plus pohybu kamery model deformuje jeden obraz, aby rekonstruoval druhý; chyba rekonstrukce na úrovni pixelu se stává trénovacím signálem. Tato ztráta „syntézy zobrazení“ znamená, že hloubku lze naučit z nezpracovaného, ​​neoznačeného videa. Klíčovým omezením je nejednoznačnost měřítka: monokulární hloubka je často správná pouze do neznámého multiplikátoru, pokud není kalibrována proti známému referenčnímu nebo metrickému dohledu.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost odhadu monokulární hloubky

Generalistické modely hloubkových základů trénované na milionech smíšených snímků se posouvají směrem ke spolehlivé, metrické (skutečné) hloubce v jakékoli scéně, dokonce i v těch, které nebyly při trénování nikdy vidět. Očekávejte těsnější spojení s optickým tokem a SLAM pro úplnou rekonstrukci 3D scény, lehčí modely, které lze živě provozovat na telefonech a náhlavních soupravách, a silnější robustnost zero-shot. Díky tomu bude bohaté prostorové vnímání levné a všudypřítomné, dostupné z jakékoli jednotlivé kamery spíše než z drahých zařízení pro hloubkové snímání.

Real-World Implementace

Portrétový režim smartphonu simulující rozostření pozadí (bokeh) pomocí odhadu vzdálenosti objektu od pozadí

Aplikace pro rozšířenou realitu umísťují virtuální objekty tak, aby správně seděly za nábytkem v reálném světě

Drony a nízkonákladoví roboti, kteří se vyhýbají překážkám pomocí jediné dopředu směřující kamery

Převod 2D fotografií a filmů do 3D odvozením hloubky na pixel pro stereoskopické zobrazení

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is Monocular Depth Estimation?

Monokulární odhad hloubky předpovídá, jak daleko je každý pixel od jedné běžné fotografie – není potřeba žádná stereo kamera, lidar ani hloubkový senzor. Umožňuje jedné kameře vnímat 3D strukturu z plochého 2D obrazu.

Co dělá odhad hloubky „monokulární“?

„Monokulární“ znamená jedno oko/kameru; metoda předpovídá hloubku z jednoho RGB snímku bez stereo nebo aktivních hloubkových senzorů.

Proč je monokulární odhad hloubky zásadně nejednoznačný?

Jediná 2D projekce ztrácí informace o měřítku, takže více 3D uspořádání je konzistentní s jedním obrazem; sítě spoléhají na naučené priory, aby se vyjasnily.

Jak se samokontrolované metody učí hloubku bez nálepek základní pravdy?

Pomocí předpokládané hloubky a pohybu kamery model promítá jeden obraz na druhý; fotometrická chyba dodává signál učení, nejsou potřeba žádné štítky.

Na jaké vodítko se monokulární sítě přímo nespoléhají pro hloubku?

Stereo nesourodost vyžaduje dvě kamery; monokulární metody se spoléhají na jednotlivé snímky, jako je velikost, perspektiva, textura a okluze.

Co je to „nejednoznačnost měřítka“ v monokulární hloubce?

Bez metrické kontroly nebo známé reference poskytuje monokulární hloubka správnou relativní strukturu, ale nejisté absolutní měřítko.