GHID AI vizual

Zero-1-to-3 Novel View Diffusion

Zero-1-to-3 transformă o singură fotografie a unui obiect în imagini ale aceluiași obiect văzut din orice unghi nou, folosind un model de difuzie condiționat de rotația camerei pe care o solicitați.

2 minute de lecturăUltima actualizare

Prezentare generală

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Scufundare în profunzime

Zero-1-to-3 (din Columbia, 2023) reglează fin Stable Diffusion, astfel încât să poată realiza o sinteză a vizualizării noi de la o singură imagine de intrare. Îi alimentezi o singură imagine plus o transformare relativă a camerei (o rotație și o mică translație), iar modelul generează cum ar arăta obiectul din acel nou punct de vedere. Ideea cheie este că modelele mari de difuzie 2D, antrenate pe colecții uriașe de imagini web, au absorbit în mod implicit antecedente geometrice și fizice despre cum arată obiectele în 3D. Prin reglarea fină a unui set de date sintetice de obiecte redate din mai multe unghiuri controlate ale camerei (folosind Objaverse), modelul învață să mapeze acele anterioare pe controlul explicit al camerei. Vederile generate pot alimenta apoi reconstrucția 3D în aval.

Perspectivă tehnică

Modelul condiționează imaginea sursă în două moduri: o încorporare CLIP este concatenată cu poziția relativă a camerei (azimut, elevație, rază) pentru a dirija atenția încrucișată, în timp ce imaginea brută este concatenată pe canal la zgomotul latent, astfel încât detaliile fine și identitatea sunt păstrate. Antrenamentul utilizează triplete imagine-poziție-imagine redate din obiecte CAD, astfel încât rețeaua învață maparea controlabilă dintre o schimbare a punctului de vedere și schimbarea pixelilor rezultată.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul difuzării vizuale a romanului Zero-1-to-3

Zero-1-to-3 a generat un val de conducte de imagine-la-3D. Succesori precum Zero123-XL, SyncDreamer și One-2-3-45 împing către consistența vizualizării multiple și o ieșire 3D mai rapidă și mai fiabilă, în timp ce integrarea cu Gaussian Splatting și modelele mari de reconstrucție micșorează timpul de generare de la minute la secunde. Așteptați-vă la o consistență mai strictă a vizualizării, o rezoluție mai mare și la generalizare în lumea reală (nu doar obiecte sintetice), deoarece aceste modele de difuzare controlabile din punct de vedere se maturizează în instrumente standard pentru crearea de conținut.

Implementare în lumea reală

Generarea de vizualizări de plată a unei singure fotografii de produs, astfel încât o listă de comerț electronic să poată afișa articolul din toate părțile

Bootstrapping o rețea 3D texturată a unui obiect dintr-un instantaneu casual de telefon pentru previzualizări AR

Crearea unei arte de referință consecventă în mai multe unghiuri a unui personaj sau recuzită pentru artiștii de conceptie de jocuri și film

Introducerea de noi vederi sintetizate într-o reconstrucție NeRF sau Gaussian Splatting pentru a completa geometria nevăzută

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Întrebări frecvente

What is Zero-1-to-3 Novel View Diffusion?

Zero-1-to-3 transformă o singură fotografie a unui obiect în imagini ale aceluiași obiect văzut din orice unghi nou, folosind un model de difuzie condiționat de rotația camerei pe care o solicitați. Este important pentru că vă permite să reconstruiți vederi consistente 3D fără a scana vreodată obiectul din mai multe părți.

De ce intrare de bază are nevoie Zero-1-to-3 în plus față de o singură imagine pentru a genera o nouă vizualizare?

Zero-1-to-3 este condiționat de o singură imagine plus o poziție relativă a camerei, astfel încât să specificați rotația și translația la punctul de vedere dorit.

Zero-1-to-3 este construit prin reglarea fină ce fel de model?

Reglează fin un model de difuzie 2D mare, preantrenat, astfel încât să poată exploata antecedentele geometrice ale acele modele învățate implicit din imaginile web.

De ce poate un model de difuzie 2D să realizeze o sinteză a vederii noi cu zero-shot?

Antrenamentul 2D la scară largă oferă cunoștințe implicite despre modul în care apar obiectele în 3D, pe care reglarea fină o face controlată prin poziția camerei.

Ce set de date de obiecte 3D a fost esențial pentru antrenamentul Zero-1-to-3?

A fost instruit pe triplete imagine-poziție-imagine redate din colecții mari de obiecte sintetice 3D, cum ar fi Objaverse.

Cum se păstrează detaliile fine ale imaginii sursă în generație?

Imaginea brută este concatenată de canal la latentul zgomotos (împreună cu o încorporare CLIP pentru semantică), astfel încât identitatea și detaliile să fie transmise.