Mwongozo wa AI unaoonekana

Mtazamo wa Riwaya ya Sifuri-1-hadi-3

Sifuri-1-hadi-3 hubadilisha picha moja ya kitu kuwa picha za kitu sawa kinachoonekana kutoka kwa pembe yoyote mpya, kwa kutumia muundo wa uenezaji uliowekwa kwenye mzunguko wa kamera unaouliza.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Dive ya kina

Sufuri-1-hadi-3 (kutoka Columbia, 2023) husanikisha Usambazaji Imara ili iweze kufanya usanisi wa mwonekano wa riwaya yenye risasi sifuri kutoka kwa picha moja ya ingizo. Unailisha picha moja pamoja na kibadilishaji cha kamera (mzunguko na tafsiri ndogo), na muundo hutoa jinsi kitu kingeonekana kutoka kwa mtazamo huo mpya. Wazo kuu ni kwamba miundo mikubwa ya uenezaji wa 2D, iliyofunzwa kwenye mkusanyiko mkubwa wa picha za wavuti, imechukua kwa udhahiri vipaumbele vya kijiometri na kimwili kuhusu jinsi vitu vinavyoonekana katika 3D. Kwa kupanga vyema mkusanyiko wa data sanisi wa vitu vinavyotolewa kutoka kwa pembe nyingi za kamera zinazodhibitiwa (kwa kutumia Objaverse), kielelezo hujifunza kuweka ramani za vipengee hivyo kwenye udhibiti wa kamera dhahiri. Mionekano inayozalishwa inaweza kisha kulisha ujenzi wa 3D wa chini.

Ufahamu wa Kiufundi

Masharti ya mfano kwenye picha ya chanzo kwa njia mbili: upachikaji wa CLIP umeshikamana na mkao wa kamera linganifu (azimuth, mwinuko, radius) ili kuelekeza umakini, huku picha mbichi ikiambatanishwa na ile fiche yenye kelele ili maelezo mafupi na utambulisho uhifadhiwe. Mafunzo hutumia sehemu tatu za picha-pozi-picha zinazotolewa kutoka kwa vitu vya CAD, kwa hivyo mtandao hujifunza ramani inayoweza kudhibitiwa kati ya mabadiliko ya mtazamo na mabadiliko ya pikseli.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Mtazamo wa Riwaya ya Sifuri-1-hadi-3

Sufuri-1-hadi-3 ilipanda wimbi la mabomba ya picha hadi 3D. Wafuasi kama Zero123-XL, SyncDreamer, na One-2-3-45 husukuma kuelekea uthabiti wa mwonekano-nyingi na utoaji wa wavu wa 3D unaotegemeka zaidi, huku kuunganishwa na Gaussian Splatting na miundo mikubwa ya ujenzi upya kunapunguza muda wa uzalishaji kutoka dakika hadi sekunde. Tarajia uthabiti wa mwonekano mgumu zaidi, mwonekano wa juu zaidi, na ujumuishaji wa ulimwengu halisi (sio tu kitu-sanisi) kadri miundo hii ya uenezaji inayoweza kudhibitiwa inapoiva na kuwa zana za kawaida za kuunda maudhui.

Utekelezaji wa Ulimwengu Halisi

Inazalisha mionekano inayoweza kubadilika ya picha ya bidhaa moja ili uorodheshaji wa biashara ya mtandaoni uweze kuonyesha bidhaa kutoka pande zote

Kufunga matundu ya 3D yenye maandishi ya kitu kutoka kwa muhtasari wa simu moja kwa muhtasari wa AR

Kuunda sanaa thabiti ya marejeleo ya pembe nyingi ya mhusika au prop kwa wasanii wa dhana ya mchezo na filamu

Kulisha maoni ya riwaya iliyosanifiwa katika ujenzi wa NeRF au Gaussian Splatting kujaza jiometri isiyoonekana.

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Muhtasari wa Mtazamo wa Riwaya

Maswali yanayoulizwa mara kwa mara

What is Zero-1-to-3 Novel View Diffusion?

Sifuri-1-hadi-3 hubadilisha picha moja ya kitu kuwa picha za kitu sawa kinachoonekana kutoka kwa pembe yoyote mpya, kwa kutumia muundo wa uenezaji uliowekwa kwenye mzunguko wa kamera unaouliza. Ni muhimu kwa sababu hukuruhusu kuunda upya mionekano inayolingana 3D bila hata kuchanganua kitu kutoka pande nyingi.

Je, ingizo la msingi la Zero-1-hadi-3 linahitaji nini pamoja na picha moja ili kutoa mwonekano mpya?

Sufuri-1-hadi-3 imewekwa kwenye picha moja pamoja na mkao wa kamera wa jamaa, kwa hivyo unabainisha mzunguko na tafsiri kwa mtazamo unaohitajika.

Zero-1-to-3 imejengwa kwa kusawazisha ni aina gani ya modeli?

Inaboresha muundo mkubwa wa uenezaji wa 2D uliofunzwa awali ili iweze kutumia vipaumbele vya kijiometri miundo hiyo iliyojifunza kwa njia isiyo wazi kutoka kwa picha za wavuti.

Kwa nini muundo wa uenezaji wa 2D unaweza kufanya usanisi wa riwaya isiyo na risasi hata kidogo?

Mafunzo ya kiwango kikubwa cha 2D hutoa ujuzi kamili wa jinsi vitu vinavyoonekana katika 3D, ambayo urekebishaji mzuri hufanya kudhibitiwa kupitia mkao wa kamera.

Ni seti gani ya data ya vitu vya 3D ilikuwa msingi wa kufunza Zero-1-to-3?

Ilifunzwa kwenye sehemu tatu za picha-pozi-picha zilizotolewa kutoka kwa mkusanyiko mkubwa wa vitu vya 3D kama vile Objaverse.

Maelezo mazuri ya picha ya chanzo yanahifadhiwaje katika kizazi?

Picha mbichi imeambatanishwa na njia iliyofichika yenye kelele (kando ya upachikaji wa CLIP kwa semantiki) ili utambulisho na undani uendelee.