GUIDA AI visiva

Splatting gaussiano

Lo splatting gaussiano rappresenta una scena 3D sotto forma di milioni di minuscole macchie colorate e semitrasparenti che possono essere renderizzate in tempo reale.

2 minuti di letturaUltimo aggiornamento

Panoramica

Offre un fotorealismo simile a NeRF mentre funziona abbastanza velocemente per la visualizzazione interattiva.

Immersione profonda

Introdotto al SIGGRAPH 2023, il 3D Gaussian Splatting ricostruisce scene da foto come NeRF ma utilizza una rappresentazione esplicita invece di una rete neurale nascosta. Ogni scena è una nuvola di gaussiane 3D, macchie ellissoidali sfocate e ogni macchia memorizza una posizione, una dimensione e un orientamento (la sua covarianza), un'opacità e un colore. Invece di sparare lentamente i raggi attraverso una rete, il metodo "splatta" questi blob direttamente sullo schermo e li fonde, un processo più vicino alla rasterizzazione tradizionale e quindi molto veloce. L'addestramento inizia da una nuvola di punti sparsa prodotta dalla calibrazione della fotocamera, quindi ottimizza i blob aggiungendo in modo adattivo dettagli dove la scena è sotto-ricostruita e sfoltendo dove è sovrappopolata. Il risultato è un rendering in tempo reale a 1080p con una qualità che rivaleggia con i migliori NeRF, motivo per cui si è diffuso rapidamente attraverso la grafica e gli strumenti di acquisizione.

Approfondimento tecnico

La chiave è un rasterizzatore differenziabile basato su tessere. Le gaussiane 3D sono proiettate in 2D, ordinate per profondità e con fusione alfa per riquadro dello schermo, quindi il rendering evita la marcia dei raggi per pixel che rallenta NeRF. Il colore viene memorizzato con armoniche sferiche, consentendo a ogni blob di cambiare aspetto in base all'angolo di visione per catturare i riflessi. Poiché l'intera pipeline è differenziabile, la stessa discesa del gradiente di corrispondenza fotografica utilizzata da NeRF ottimizza le posizioni, le forme, le opacità e i colori dei blob, mentre una fase di densificazione aumenta o divide le gaussiane per aggiungere dettagli mancanti.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro dello splatting gaussiano

Il Gaussian Splatting si sta spostando rapidamente dalla ricerca ai prodotti per l'acquisizione 3D, la mappatura e la produzione virtuale, in parte perché esegue il rendering in tempo reale sulle GPU consumer e persino sui browser. Il lavoro attivo mira a ridurre le dimensioni dei file (le scene possono essere grandi), gestire scene dinamiche e animate, riaccendere e modificare singoli oggetti. Aspettatevi un'integrazione più stretta con i motori di gioco e AR/VR, metodi ibridi che combinano simboli con mesh e cattura video dal telefono. È sempre più visto come un complemento pratico o un sostituto del NeRF ovunque sia importante la velocità interattiva.

Implementazione nel mondo reale

Creazione di acquisizioni 3D esplorabili in tempo reale di stanze o prodotti per il web

Produzione virtuale e previsualizzazione cinematografica con set fotorealistici e navigabili

Scansione 3D rapida di oggetti e ambienti da un telefono o da un video di un drone

Creazione di scene AR/VR interattive che funzionano senza problemi sull'hardware consumer

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gaussian Splatting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Domande frequenti

Cos'è lo splatting gaussiano?

Lo splatting gaussiano rappresenta una scena 3D sotto forma di milioni di minuscole macchie colorate e semitrasparenti che possono essere renderizzate in tempo reale. Offre un fotorealismo simile a NeRF mentre funziona abbastanza velocemente per la visualizzazione interattiva.

In che modo lo splatting gaussiano rappresenta una scena 3D?

La scena è una nuvola esplicita di gaussiane 3D, ciascuna un ellissoide sfocato con posizione, forma, opacità e colore.

Perché il rendering dello splatting gaussiano è molto più veloce rispetto al NeRF originale?

La proiezione e la fusione dei blob tramite la rasterizzazione basata su piastrelle evita la lenta marcia dei raggi per pixel di NeRF, consentendo velocità in tempo reale.

Quali informazioni memorizza ciascuna gaussiana 3D?

Ogni blob porta una posizione, una covarianza (dimensione e orientamento), un'opacità e informazioni sul colore.

Cosa viene utilizzato per far cambiare colore a un blob in base all'angolo di visualizzazione?

Il colore è codificato con armoniche sferiche, quindi ogni gaussiana può apparire diversa da direzioni diverse, catturando i riflessi.

Come inizia tipicamente l'allenamento nello splatting gaussiano?

Si inizia con punti sparsi provenienti dalla calibrazione della telecamera struttura-dal-movimento, quindi si ottimizzano le gaussiane da lì.