Vizuális MI ÚTMUTATÓ

Zero-1-to-3 Novel View diffúzió

A nulla 1-től 3-ig egy objektum egyetlen fényképét ugyanazon objektum képeivé alakítja, bármilyen új szögből nézve, egy diffúziós modellt használva, amely a kamera kért elforgatásától függ.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Mély merülés

A Zero-1-to-3 (Columbia, 2023) finomhangolja a stabil diffúziót, így egyetlen bemeneti képről nulla felvételű újszerű nézetszintézist hajthat végre. Egyetlen képet, plusz egy relatív kameratranszformációt (egy elforgatást és egy kis fordítást) ad hozzá, és a modell létrehozza, hogyan nézne ki az objektum abból az új nézőpontból. A kulcsötlet az, hogy a nagyméretű 2D-s diffúziós modellek, amelyeket hatalmas webes képgyűjteményekre képeztek ki, implicit módon elnyelték a geometriai és fizikai prioritásokat arról, hogyan néznek ki az objektumok 3D-ben. A számos ellenőrzött kameraállásból renderelt objektumok szintetikus adatkészletének finomhangolásával (az Objaverse használatával) a modell megtanulja leképezni ezeket az előzőeket az explicit kameravezérlésre. A generált nézetek ezután továbbíthatják a 3D rekonstrukciót.

Technikai betekintés

A modellfeltételek a forrásképen kétféleképpen állnak rendelkezésre: a CLIP beágyazás összefűződik a kamera relatív pózával (azimut, magasság, sugár), hogy irányítsa a keresztfigyelést, míg a nyers képet csatorna-összefűzi a zajos látenshez, így a finom részletek és azonosság megmarad. A képzés CAD-objektumokból előállított kép-pozíció-kép hármasokat használ, így a hálózat megtanulja a vezérelhető leképezést a nézőpontváltozás és az ebből eredő pixelváltás között.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A nulla-1-től 3-ig terjedő regénynézetek jövője

A Zero-1-to-3 kép-3D folyamatok hullámát indította el. Az olyan utódok, mint a Zero123-XL, a SyncDreamer és a One-2-3-45 a többnézetű konzisztencia és a gyorsabb, megbízhatóbb 3D mesh kimenet felé törekednek, míg a Gaussian Splatting és a nagy rekonstrukciós modellekkel való integráció percekről másodpercekre csökkenti a generálási időt. Szorosabb nézetkonzisztenciára, nagyobb felbontásra és valós (nem csak szintetikus objektumokra vonatkozó) általánosításra számíthat, mivel ezek a nézőpont-vezérelhető diffúziós modellek a tartalomkészítés szabványos eszközévé válnak.

Valós megvalósítás

A lemezjátszó nézeteinek létrehozása egyetlen termékfotóról, így az e-kereskedelmi listán minden oldalról megjelenítheti a tételt

Egy objektum texturált 3D-s hálójának beindítása egy hétköznapi telefonos pillanatfelvételből AR-előnézetekhez

Egy karakter vagy kellék konzisztens többszögű referenciaművészete létrehozása játék- és filmkoncepció művészek számára

Szintetizált új nézetek betáplálása NeRF vagy Gauss-Splatting rekonstrukcióba, hogy kitöltse a láthatatlan geometriát

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Zero-1-to-3 Novel View Diffusion?

A nulla 1-től 3-ig egy objektum egyetlen fényképét ugyanazon objektum képeivé alakítja, bármilyen új szögből nézve, egy diffúziós modellt használva, amely a kamera kért elforgatásától függ. Ez azért fontos, mert lehetővé teszi a 3D-konzisztens nézetek rekonstruálását anélkül, hogy az objektumot több oldalról is be kellene vizsgálni.

Mire van szüksége a Zero-1-to-3 alapbemenetre egyetlen képen kívül egy új nézet létrehozásához?

A nulla 1-től 3-ig feltétele egyetlen kép, valamint egy relatív kamerapóz, így Ön határozza meg az elforgatást és a kívánt nézőpontra történő fordítást.

A Zero-1-to-3 melyik modell finomhangolásával épül fel?

Finomhangol egy nagy előre betanított 2D diffúziós modellt, így képes kihasználni a webes képekből implicit módon megtanult modellek geometriai előzményeit.

Miért tud egyáltalán egy 2D diffúziós modell nulla felvételű, újszerű nézetszintézist végrehajtani?

A nagyszabású 2D képzés implicit tudást ad arról, hogy az objektumok hogyan jelennek meg 3D-ben, amit a finomhangolás a kamera pózán keresztül vezérelhetővé tesz.

A 3D objektumok melyik adatkészlete volt központi a Zero-1-to-3 képzésében?

Kép-póz-kép hármasokra képezték, amelyeket nagy szintetikus 3D-s objektumgyűjteményekből, például az Objaverse-ből rendereltek le.

Hogyan őrzi meg a forráskép finom részleteit a generáció?

A nyers kép csatorna-összefűzve van a zajos látenshez (a szemantikai célú CLIP beágyazás mellett), így az azonosság és a részletek áthaladnak.