Mwongozo wa AI unaoonekana

Ukadiriaji wa Kina cha Monocular

Ukadiriaji wa kina cha monocular hutabiri umbali wa kila pikseli kutoka kwa picha moja ya kawaida - hakuna kamera ya stereo, lidar au kihisi cha kina kinahitajika.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It lets one camera perceive 3D structure from a flat 2D image.

Dive ya kina

Wanadamu wanaweza kutathmini kina kutoka kwa jicho moja kwa kutumia viashiria kama vile mtazamo, saizi inayolingana, viwango vya umbile, utiaji kivuli, na kuziba. Ukadiriaji wa kina cha monocular hufunza mitandao ya neural mbinu sawa: lisha katika picha moja ya RGB na toa thamani ya kina kwa kila pikseli. Kwa sababu picha ya 2D ina utata kuhusu ukubwa kamili, kazi ni ngumu - matukio mengi ya 3D yanaweza kuonyesha picha sawa. Mitandao hujifunza mambo ya awali ya takwimu kutoka kwa hifadhidata kubwa ili kutatua hili. Mafunzo huja katika aina mbili: kusimamiwa, kwa kutumia kina cha ukweli kutoka kwa vihisi vya lidar au RGB-D, na kujidhibiti, ambayo hujifunza kwa kina kutoka kwa jozi za video au stereo kwa kulazimisha kwamba kina kilichotabiriwa kinakataa kwa usahihi mtazamo mmoja hadi mwingine. Miundo ya hivi majuzi ya msingi kama vile MiDaS na Depth Anything inajumlisha kikamilifu katika matukio ambayo hayajaonekana.

Ufahamu wa Kiufundi

Njia za kujisimamia hutumia jiometri badala ya lebo. Kwa kuzingatia kutazamwa mara mbili (stereo au fremu za video zinazofuatana) na ramani ya kina iliyotabiriwa pamoja na mwendo wa kamera, kielelezo hupindisha picha moja ili kuunda upya nyingine; hitilafu ya ujenzi wa kiwango cha pixel inakuwa ishara ya mafunzo. Upotevu huu wa 'mwonekano-sanisi' unamaanisha kina kinaweza kujifunza kutoka kwa video mbichi, isiyo na lebo. Kizuizi kikuu ni utata wa kipimo: kina cha monocular mara nyingi ni sahihi hadi kizidishi kisichojulikana isipokuwa kiwe kimesawazishwa dhidi ya marejeleo yanayojulikana au usimamizi wa kipimo.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Ukadiriaji wa Kina cha Monocular

Miundo ya msingi ya kina ya jumla iliyofunzwa kwenye mamilioni ya picha mchanganyiko inasukuma kuelekea kina cha kuaminika, cha kipimo (kiwango halisi) katika tukio lolote, hata zile ambazo hazijawahi kuonekana kwenye mafunzo. Tarajia muunganisho mkali zaidi wa mtiririko wa macho na SLAM kwa uundaji upya wa eneo la 3D, miundo nyepesi inayoendeshwa moja kwa moja kwenye simu na vifaa vya sauti, na uimara thabiti wa picha sifuri. Hii itafanya mtazamo tajiri wa anga kuwa nafuu na upatikane kila mahali, kupatikana kutoka kwa kamera yoyote badala ya vifaa vya gharama kubwa vya kutambua kina.

Utekelezaji wa Ulimwengu Halisi

Hali ya picha ya simu mahiri inayoiga ukungu wa usuli (bokeh) kwa kukadiria umbali wa mada dhidi ya usuli

Programu za uhalisia ulioboreshwa huweka vitu pepe ili vikae ipasavyo nyuma ya fanicha ya ulimwengu halisi

Ndege zisizo na rubani na roboti za bei ya chini zikiepuka vikwazo kwa kutumia kamera moja inayotazama mbele

Kubadilisha picha na filamu za 2D kuwa 3D kwa kukisia kina cha kila pikseli kwa onyesho la stereoscopic

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Ukadiriaji wa Kina cha Stereo

Maswali yanayoulizwa mara kwa mara

What is Monocular Depth Estimation?

Ukadiriaji wa kina cha monocular hutabiri umbali wa kila pikseli kutoka kwa picha moja ya kawaida - hakuna kamera ya stereo, lidar au kihisi cha kina kinahitajika. Huruhusu kamera moja kutambua muundo wa 3D kutoka kwa picha bapa ya 2D.

Ni nini hufanya makadirio ya kina kuwa 'monocular'?

'Monocular' maana yake ni jicho/kamera moja; njia inatabiri kina kutoka kwa picha moja ya RGB bila stereo au vihisi vya kina vinavyotumika.

Kwa nini makadirio ya kina cha monocular kimsingi ni ya utata?

Kadirio moja la 2D hupoteza maelezo ya ukubwa, kwa hivyo mipangilio mingi ya 3D inalingana na picha moja; mitandao hutegemea mambo yaliyojifunza kabla ya kutoelewana.

Njia za kujisimamia hujifunzaje kwa kina bila lebo za ukweli wa msingi?

Kwa kutumia kina kilichotabiriwa na mwendo wa kamera, kielelezo kinakashifu picha moja hadi nyingine; hitilafu ya fotometri hutoa ishara ya kujifunza, hakuna lebo zinazohitajika.

Ni kidokezo gani ambacho mitandao ya monocular HAItegemei moja kwa moja kwa kina?

Tofauti ya stereo inahitaji kamera mbili; mbinu za lugha moja hutegemea viashiria vya picha moja kama vile ukubwa, mtazamo, umbile, na kuziba.

'Utata wa kiwango' ni nini katika kina cha monocular?

Bila usimamizi wa kipimo au rejeleo linalojulikana, kina cha monocular hutoa muundo sahihi wa uwiano lakini kipimo kamili kisicho na uhakika.