GHID AI vizual

Estimarea adâncimii de difuzie a gălbenelelor

Marigold reutilizează un model de difuzie de generare de imagini preantrenată (difuziune stabilă) pentru a prezice hărți foarte detaliate de adâncime.

2 minute de lecturăUltima actualizare

Prezentare generală

It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.

Scufundare în profunzime

Marigold (ETH Zurich, CVPR 2024 Best Paper Onorable Mention) reformulează estimarea adâncimii ca o problemă de generare condiționată. În loc să antreneze o rețea de adâncime de la zero, reglează Stable Diffusion pentru a „genera” o hartă de adâncime condiționată de o imagine de intrare. Perspectiva este că un model antrenat pentru a sintetiza imagini fotorealiste a învățat deja geometria scenei, iluminarea și structura adânc în spațiul său latent, exact antecedentele utile pentru adâncime. În mod remarcabil, Marigold a fost reglat fin numai pe seturi de date sintetice (cum ar fi Hypersim și Virtual KITTI), dar se generalizează bine la fotografiile reale cu zero. Produce o adâncime relativă invariabilă afine cu detalii excepțional de fine, deși dezgomotul iterativ îl face mai lent decât modelele cu feed-forward precum DepthAnything.

Perspectivă tehnică

Galbenele operează în spațiul latent al lui Stable Diffusion. Atât imaginea, cât și harta de adâncime sunt codificate de același VAE; U-Net este reglat fin pentru a elimina o adâncime latentă condiționată de imaginea curată latentă. La inferență, rulează bucla standard iterativă de dezgomot, apoi decodifică adâncimea latentă. Deoarece eșantionează, mai multe execuții pot fi asamblate pentru stabilitate, tranzacționând calculul pentru precizie. Ulterior, „LCM” și versiunile distilate într-un singur pas reduc zecile de pași la o singură trecere.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul estimării adâncimii de difuzie a gălbenelelor

Rețeta de gălbenele, reglarea fină a priorităților de difuzie pentru predicția densă, se generalizează dincolo de adâncime la normalele de suprafață, descompunerea intrinsecă a imaginii și estimarea materialului. Variantele distilate mai rapide și modelele de consistență reduc decalajul de viteză cu rețelele de tip feed-forward, făcând viabilă percepția bazată pe difuzie în instrumentele interactive. Așteptați-vă la o tendință mai largă în care o coloană generativă preantrenată este adaptată la multe sarcini de geometrie și percepție, reducând nevoia de seturi de date mari etichetate specifice sarcinii.

Implementare în lumea reală

Extragerea adâncimii cu granulație fină din fotografiile arhitecturale și ale produselor pentru reiluminare și machete 3D.

Generarea de hărți de adâncime cu detalii ridicate utilizate ca condiționare pentru generarea de imagini și videoclipuri controlabile.

Sprijinirea echipelor de film și VFX în lucrul mat și paralax acolo unde precizia marginilor contează.

Servind ca bază de cercetare care arată cum să adaptăm prioritățile generative la sarcini de predicție dense.

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Estimarea adâncimii monoculare

Întrebări frecvente

What is Marigold Diffusion Depth Estimation?

Marigold reutilizează un model de difuzie de generare de imagini preantrenată (difuziune stabilă) pentru a prezice hărți foarte detaliate de adâncime. Acesta arată că puteți transforma cunoștințele vizuale bogate ale unui generator într-un instrument de percepție precis, cu date de antrenament surprinzător de puține.

Pe ce model preantrenat se construiește Marigold?

Marigold ajustează modelul de difuzie latentă Stable Diffusion pentru a produce hărți de adâncime.

Cum încadrează Marigold sarcina de estimare a adâncimii?

Tratează adâncimea ca pe ceva ce trebuie „generat” condiționat de imaginea de intrare, reutilizand mașinile de difuzie.

Ce a fost surprinzător la datele de antrenament ale lui Marigold?

Marigold a fost reglat fin pe date sintetice precum Hypersim și Virtual KITTI, dar generalizează zero-shot la fotografii reale.

De ce este de obicei Marigold mai lent decât modelele cu adâncime de avans?

Modelele de difuzie reduc zgomotul în mai mulți pași, făcând inferența mai lentă decât o singură trecere înainte.

În ce spațiu își realizează Gălbenelele procesul de difuzie?

Atât imaginea, cât și adâncimea sunt codificate în spațiul latent VAE unde U-Net face dezgomot.