PRZEWODNIK Wizualnej AI

Plenoxele i pola promieniowania wokseli

Plenoxels pokazał, że można zrekonstruować scenę 3D z jakością NeRF bez jakiejkolwiek sieci neuronowej — wystarczy siatka wokseli przechowujących kolor i gęstość.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

The result trains roughly 100x faster than the original NeRF while matching its visual quality.

Głębokie nurkowanie

NeRF osiąga fotorealizm, ale jest powolny, ponieważ każda próbka wymaga przejścia do przodu przez głęboką sieć neuronową, a szkolenie może zająć godziny lub dni. Plenoxels (Sara Fridovich-Keil, Alex Yu i in., 2022) zadał prowokacyjne pytanie: czy sieć jest w ogóle konieczna? Ich odpowiedź brzmiała: nie. Reprezentują scenę jako rzadką siatkę wokseli 3D. Każdy zajęty woksel przechowuje pojedynczą wartość krycia oraz współczynniki harmonii sferycznej, które kodują kolor zależny od widoku. Aby wyrenderować piksel, system interpoluje trójliniowo te wartości wzdłuż promienia i łączy je ze standardowym renderowaniem objętości. Ponieważ nie ma sieci, całość jest optymalizowana bezpośrednio poprzez gradientowe opadanie wartości wokseli, uregulowane pod kątem gładkości. Główny wynik: jakość porównywalna z NeRF, trenowana w ciągu kilku minut na jednym procesorze graficznym.

Wgląd techniczny

Kolor zależny od widoku jest sprytną częścią. Zamiast sieci wysyłającej sygnał RGB dla każdego kąta widzenia, każdy woksel przechowuje mały zestaw współczynników harmonicznych sferycznych (SH) na kanał koloru. Ocena podstawy SH w kierunku promienia rekonstruuje, jak zmienia się kolor tego punktu w zależności od punktu widzenia – wychwytując odblaski i odbicia. Krycie jest niezależne od kierunku. Różniczkowa interpolacja trójliniowa plus renderowanie objętości sprawia, że ​​każdą wartość woksela można bezpośrednio wyszkolić, więc optymalizacja jest prostym, niewymagającym sieci dopasowaniem w stylu najmniejszych kwadratów.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość plenokseli i pól promieniowania wokseli

Plenoxels udowodnił, że to reprezentacja, a nie sieć neuronowa, wpływa na jakość NeRF — odkrycie to zmieniło całą dziedzinę. Bezpośrednio zainspirowało to metody jawne i hybrydowe, takie jak siatki mieszające Instant-NGP i ostatecznie trójwymiarowe rozpryskiwanie gaussowskie, które obecnie dominuje w renderowaniu promieniowania w czasie rzeczywistym. Spodziewaj się ciągłego ruchu w kierunku wyraźnych, przyjaznych dla GPU prymitywów, które uczą się w ciągu kilku sekund i renderują w czasie rzeczywistym, z sieciami neuronowymi używanymi selektywnie, a nie jako główny magazyn scen.

Implementacja w świecie rzeczywistym

Szybka rekonstrukcja przechwyconego obiektu na zasób 3D w ciągu kilku minut na potrzeby handlu elektronicznego lub digitalizacji muzeów, zamiast czekać godzinami.

Szybkie prototypowanie nowatorskiej syntezy na jednym konsumenckim procesorze graficznym do celów badawczych i edukacyjnych.

Generowanie edytowalnych, wyraźnych scen wokselowych, które artyści mogą bezpośrednio przeglądać i przycinać, w przeciwieństwie do nieprzezroczystych wag sieciowych.

Służy jako przykład pouczający, że reprezentacja sceny, a nie głębokie uczenie się, daje fotorealistyczne rezultaty.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Plenoxels and Voxel Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Pola promieniowania neuronowego

Często zadawane pytania

What is Plenoxels and Voxel Radiance Fields?

Plenoxels pokazał, że można zrekonstruować scenę 3D z jakością NeRF bez jakiejkolwiek sieci neuronowej — wystarczy siatka wokseli przechowujących kolor i gęstość. W rezultacie trenuje około 100 razy szybciej niż oryginalny NeRF, zachowując jednocześnie jakość wizualną.

Jaki jest najbardziej zaskakujący wybór projektu Plenoxels w porównaniu z NeRF?

Plenoxels przechowuje scenę bezpośrednio w siatce wokseli i optymalizuje te wartości bez konieczności stosowania sieci neuronowej.

Co przechowuje każdy zajęty woksel w Plenoxels, aby uchwycić kolor zależny od widoku?

Każdy woksel zawiera nieprzezroczystość oraz współczynniki harmonii sferycznej na kanał koloru, które kodują zmianę koloru w zależności od kierunku patrzenia.

O ile szybciej trenował Plenoxels w porównaniu z oryginalnym NeRF?

Dzięki wyeliminowaniu przejść sieciowych przypadających na próbkę, Plenoxels trenował około 100 razy szybciej, kończąc w ciągu kilku minut.

W jaki sposób wartości są pobierane z siatki wokseli wzdłuż promienia?

Plenoxels wykorzystuje różniczkowalną interpolację trójliniową, aby płynnie odczytywać kolor i przezroczystość pomiędzy środkami wokseli.

Jaki szerszy wniosek wykazał w praktyce Plenoxels?

Dopasowując jakość NeRF do braku sieci, firma Plenoxels pokazała, że ​​za wyniki odpowiadała reprezentacja i optymalizacja, a nie MLP.