Mtazamo wa Riwaya ya Sifuri-1-hadi-3
Sifuri-1-hadi-3 hubadilisha picha moja ya kitu kuwa picha za kitu sawa kinachoonekana kutoka kwa pembe yoyote mpya, kwa kutumia muundo wa uenezaji uliowekwa kwenye mzunguko wa kamera unaouliza.
Muhtasari
It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.
Dive ya kina
Sufuri-1-hadi-3 (kutoka Columbia, 2023) husanikisha Usambazaji Imara ili iweze kufanya usanisi wa mwonekano wa riwaya yenye risasi sifuri kutoka kwa picha moja ya ingizo. Unailisha picha moja pamoja na kibadilishaji cha kamera (mzunguko na tafsiri ndogo), na muundo hutoa jinsi kitu kingeonekana kutoka kwa mtazamo huo mpya. Wazo kuu ni kwamba miundo mikubwa ya uenezaji wa 2D, iliyofunzwa kwenye mkusanyiko mkubwa wa picha za wavuti, imechukua kwa udhahiri vipaumbele vya kijiometri na kimwili kuhusu jinsi vitu vinavyoonekana katika 3D. Kwa kupanga vyema mkusanyiko wa data sanisi wa vitu vinavyotolewa kutoka kwa pembe nyingi za kamera zinazodhibitiwa (kwa kutumia Objaverse), kielelezo hujifunza kuweka ramani za vipengee hivyo kwenye udhibiti wa kamera dhahiri. Mionekano inayozalishwa inaweza kisha kulisha ujenzi wa 3D wa chini.
Ufahamu wa Kiufundi
Masharti ya mfano kwenye picha ya chanzo kwa njia mbili: upachikaji wa CLIP umeshikamana na mkao wa kamera linganifu (azimuth, mwinuko, radius) ili kuelekeza umakini, huku picha mbichi ikiambatanishwa na ile fiche yenye kelele ili maelezo mafupi na utambulisho uhifadhiwe. Mafunzo hutumia sehemu tatu za picha-pozi-picha zinazotolewa kutoka kwa vitu vya CAD, kwa hivyo mtandao hujifunza ramani inayoweza kudhibitiwa kati ya mabadiliko ya mtazamo na mabadiliko ya pikseli.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa Mtazamo wa Riwaya ya Sifuri-1-hadi-3
Sufuri-1-hadi-3 ilipanda wimbi la mabomba ya picha hadi 3D. Wafuasi kama Zero123-XL, SyncDreamer, na One-2-3-45 husukuma kuelekea uthabiti wa mwonekano-nyingi na utoaji wa wavu wa 3D unaotegemeka zaidi, huku kuunganishwa na Gaussian Splatting na miundo mikubwa ya ujenzi upya kunapunguza muda wa uzalishaji kutoka dakika hadi sekunde. Tarajia uthabiti wa mwonekano mgumu zaidi, mwonekano wa juu zaidi, na ujumuishaji wa ulimwengu halisi (sio tu kitu-sanisi) kadri miundo hii ya uenezaji inayoweza kudhibitiwa inapoiva na kuwa zana za kawaida za kuunda maudhui.
Utekelezaji wa Ulimwengu Halisi
Inazalisha mionekano inayoweza kubadilika ya picha ya bidhaa moja ili uorodheshaji wa biashara ya mtandaoni uweze kuonyesha bidhaa kutoka pande zote
Kufunga matundu ya 3D yenye maandishi ya kitu kutoka kwa muhtasari wa simu moja kwa muhtasari wa AR
Kuunda sanaa thabiti ya marejeleo ya pembe nyingi ya mhusika au prop kwa wasanii wa dhana ya mchezo na filamu
Kulisha maoni ya riwaya iliyosanifiwa katika ujenzi wa NeRF au Gaussian Splatting kujaza jiometri isiyoonekana.
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Muhtasari wa Mtazamo wa Riwaya
Maswali yanayoulizwa mara kwa mara
What is Zero-1-to-3 Novel View Diffusion?
Sifuri-1-hadi-3 hubadilisha picha moja ya kitu kuwa picha za kitu sawa kinachoonekana kutoka kwa pembe yoyote mpya, kwa kutumia muundo wa uenezaji uliowekwa kwenye mzunguko wa kamera unaouliza. Ni muhimu kwa sababu hukuruhusu kuunda upya mionekano inayolingana 3D bila hata kuchanganua kitu kutoka pande nyingi.
Je, ingizo la msingi la Zero-1-hadi-3 linahitaji nini pamoja na picha moja ili kutoa mwonekano mpya?
Sufuri-1-hadi-3 imewekwa kwenye picha moja pamoja na mkao wa kamera wa jamaa, kwa hivyo unabainisha mzunguko na tafsiri kwa mtazamo unaohitajika.
Zero-1-to-3 imejengwa kwa kusawazisha ni aina gani ya modeli?
Inaboresha muundo mkubwa wa uenezaji wa 2D uliofunzwa awali ili iweze kutumia vipaumbele vya kijiometri miundo hiyo iliyojifunza kwa njia isiyo wazi kutoka kwa picha za wavuti.
Kwa nini muundo wa uenezaji wa 2D unaweza kufanya usanisi wa riwaya isiyo na risasi hata kidogo?
Mafunzo ya kiwango kikubwa cha 2D hutoa ujuzi kamili wa jinsi vitu vinavyoonekana katika 3D, ambayo urekebishaji mzuri hufanya kudhibitiwa kupitia mkao wa kamera.
Ni seti gani ya data ya vitu vya 3D ilikuwa msingi wa kufunza Zero-1-to-3?
Ilifunzwa kwenye sehemu tatu za picha-pozi-picha zilizotolewa kutoka kwa mkusanyiko mkubwa wa vitu vya 3D kama vile Objaverse.
Maelezo mazuri ya picha ya chanzo yanahifadhiwaje katika kizazi?
Picha mbichi imeambatanishwa na njia iliyofichika yenye kelele (kando ya upachikaji wa CLIP kwa semantiki) ili utambulisho na undani uendelee.