Vizuális MI ÚTMUTATÓ

Monokuláris mélységbecslés

A monokuláris mélységbecslés megjósolja, hogy az egyes pixelek milyen távolságra vannak egyetlen közönséges fényképtől – nincs szükség sztereó kamerára, lidarra vagy mélységérzékelőre.

2 perc olvasásUtoljára frissítve

Áttekintés

It lets one camera perceive 3D structure from a flat 2D image.

Mély merülés

Az emberek az egyik szemből képesek megítélni a mélységet olyan jelzések alapján, mint a perspektíva, a relatív méret, a textúra gradiensek, az árnyékolás és az elzáródás. A monokuláris mélységbecslés ugyanezt a trükköt tanítja meg a neurális hálózatoknak: adjon be egyetlen RGB képet, és adja ki a mélységértéket minden képponthoz. Mivel a 2D-s kép eleve kétértelmű az abszolút léptéket illetően, a feladat nehéz – sok 3D-s jelenet ugyanarra a képre vetíthető. Ennek megoldására a hálózatok statisztikai prioritásokat tanulnak a nagy adatkészletekből. A képzésnek kétféle változata van: felügyelt, a lidar vagy RGB-D érzékelőkből származó alapszintű mélység felhasználásával, és önfelügyelt, amely tisztán videó- ​​vagy sztereópárokból tanulja meg a mélységet azáltal, hogy kikényszeríti, hogy az előre jelzett mélység megfelelően visszavetítse az egyik nézetet a másikba. A legújabb alapozó modellek, mint például a MiDaS és a Depth Anything figyelemreméltóan általánosítják a nem látott jeleneteket.

Technikai betekintés

Az önfelügyelt módszerek a geometriát használják ki címkék helyett. Két nézet (sztereó vagy egymást követő videókockák) és egy előre jelzett mélységtérkép, valamint a kamera mozgása alapján a modell elvetemíti az egyik képet, hogy rekonstruálja a másikat; a pixel szintű rekonstrukciós hiba lesz a tanító jel. Ez a „nézet-szintézis” veszteség azt jelenti, hogy a mélység megtanulható a nyers, címkézetlen videóból. A fő korlát a skála kétértelműsége: a monokuláris mélység gyakran csak egy ismeretlen szorzóig helyes, hacsak nincs kalibrálva egy ismert referencia vagy metrikus felügyelet alapján.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A monokuláris mélységbecslés jövője

A több millió vegyes képre kiképzett generalista mélységi alapozó modellek a megbízható, metrikus (valós léptékű) mélység felé törekszenek minden jelenetben, még az edzésen soha nem látottaknál is. Az optikai áramlással és a SLAM-mel való szorosabb fúzióra számíthat a teljes 3D-s jelenet rekonstrukcióhoz, a telefonokon és fejhallgatókon élőben futtatható könnyebb modellekhez, valamint az erősebb, nulla felvételek robusztusságához. Ez olcsóvá és mindenütt elérhetővé teszi a gazdag térérzékelést, amely bármely egyetlen kamerával elérhető, nem pedig drága mélységérzékelő berendezésekkel.

Valós megvalósítás

Okostelefon portré mód, amely szimulálja a háttér elmosódását (bokeh) a téma és a háttér közötti távolság becslésével

Kiterjesztett valóság-alkalmazások, amelyek virtuális objektumokat helyeznek el, hogy azok megfelelően üljenek a valós bútorok mögött

Drónok és olcsó robotok, amelyek egyetlen előre néző kamerával elkerülik az akadályokat

2D fotók és filmek 3D-vé alakítása pixelenkénti mélység megállapításával sztereoszkópikus megjelenítéshez

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Sztereó mélységbecslés

Gyakran ismételt kérdések

What is Monocular Depth Estimation?

A monokuláris mélységbecslés megjósolja, hogy az egyes pixelek milyen távolságra vannak egyetlen közönséges fényképtől – nincs szükség sztereó kamerára, lidarra vagy mélységérzékelőre. Lehetővé teszi, hogy egy kamera érzékelje a 3D szerkezetet egy lapos 2D képről.

Mitől „monokuláris” a mélységbecslés?

„monokuláris”: egy szem/kamera; a módszer egyetlen RGB kép alapján jósol mélységet sztereó vagy aktív mélységérzékelők nélkül.

Miért alapvetően kétértelmű a monokuláris mélységbecslés?

Egyetlen 2D vetítés elveszíti a léptékinformációkat, így több 3D elrendezés is konzisztens egy képpel; a hálózatok a tanult priorokra támaszkodnak az egyértelművé tétel érdekében.

Hogyan tanulják meg az önfelügyelt módszerek a mélységet az alapigazság címkéi nélkül?

Az előre jelzett mélység és a kamera mozgása segítségével a modell az egyik képet a másikra vetíti; a fotometriai hiba szolgáltatja a tanuló jelet, nincs szükség címkékre.

Melyik jelre NEM támaszkodnak közvetlenül a monokuláris hálózatok a mélység tekintetében?

A sztereó egyenlőtlenséghez két kamera szükséges; A monokuláris módszerek olyan egyképes jelzésekre támaszkodnak, mint a méret, a perspektíva, a textúra és az okklúzió.

Mit jelent a „skálás kétértelműség” monokuláris mélységben?

Metrikus felügyelet vagy ismert referencia nélkül a monokuláris mélység helyes relatív szerkezetet ad, de bizonytalan abszolút skálát.