PRZEWODNIK Wizualnej AI

Pola promieniowania Mip-NeRF i antyaliasingu

Mip-NeRF naprawia rozmyte, postrzępione artefakty, które nękają oryginalny NeRF, gdy renderujesz sceny w różnych odległościach i rozdzielczościach.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Robi to poprzez śledzenie stożków zamiast nieskończenie cienkich promieni, dzięki czemu renderowanie scen 3D jest ostrzejsze i szybsze w trenowaniu.

Głębokie nurkowanie

Oryginalny NeRF próbkuje scenę wzdłuż cienkich promieni, jeden punkt na raz i wprowadza każdą pozycję 3D do sieci neuronowej. Problem: pojedynczy punkt ignoruje faktyczną część sceny zajmowaną przez piksel. Piksel w pobliżu kamery widzi niewielki obszar; ten sam piksel w oddali widzi ogromny. Próbkowanie ich w identyczny sposób powoduje aliasing — migotanie i postrzępienie podczas powiększania lub przesuwania. Mip-NeRF (Barron et al., 2021) zastępuje każdy promień stożkiem i dzieli go na stożkowe ścięty. Zamiast kodować punkt, koduje obszar wewnątrz każdej ściętej struktury przy użyciu zintegrowanego kodowania pozycyjnego (IPE), przybliżając objętość za pomocą Gaussa. Dzięki temu pojedyncza sieć wieloskalowa może renderować dowolną rozdzielczość w sposób czysty, znacznie zmniejszając liczbę błędów i czas uczenia.

Wgląd techniczny

Kluczową sztuczką jest zintegrowane kodowanie pozycyjne. Standardowy NeRF odwzorowuje punkt poprzez funkcje sinus i cosinus na wielu częstotliwościach. Zamiast tego Mip-NeRF przybliża stożek ścięty jako wielowymiarowy Gauss i oblicza oczekiwaną wartość tych sinusoid na podstawie tego Gaussa. Funkcje wysokiej częstotliwości, które znacznie się różnią w obrębie dużej ściętej struktury, są automatycznie tłumione w kierunku zera, natomiast obszary o dużej częstotliwości wykorzystują wyłącznie stabilne informacje o niskich częstotliwościach — dokładnie tak samo, jak antyaliasingowe zachowanie mipmap w klasycznej grafice.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość pól promieniowania Mip-NeRF i antyaliasingu

Mip-NeRF wprowadził na rynek rodzinę pól antyaliasingowych. Mip-NeRF 360 rozszerzył stożki na nieograniczone sceny zewnętrzne z wypaczeniem skurczowym, a Zip-NeRF połączył antyaliasing oparty na stożkach z szybkimi reprezentacjami siatki mieszającej, aby uzyskać zarówno jakość, jak i szybkość. Można się spodziewać, że koncepcja zintegrowanej konstrukcji ściętej będzie nadal migrować do rozprysków gaussowskich i potoków czasu rzeczywistego, gdzie wieloskalowe renderowanie bez aliasów na telefonach i zestawach słuchawkowych jest celem AR, mapowania i przechwytywania wciągającego.

Implementacja w świecie rzeczywistym

Czyste renderowanie przechwyconego obiektu w przeglądarce produktów, która umożliwia użytkownikom powiększanie widoku całego pomieszczenia do drobnych szczegółów powierzchni bez migotania.

Rekonstrukcja dużych scen plenerowych (za pomocą Mip-NeRF 360) na potrzeby wirtualnej turystyki i spacerów po nieruchomościach, gdzie kamera porusza się w szerokim zakresie głębokości.

Generowanie spójnych obrazów szkoleniowych w wielu rozdzielczościach dla robotyki lub symulatorów jazdy autonomicznej.

Tworzenie ostrych, syntetycznych, nowatorskich klatek do filmów i wstępnej wizualizacji efektów wizualnych, w których aliasing mógłby popsuć ujęcie.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mip-NeRF and Anti-Aliased Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Pola promieniowania neuronowego

Często zadawane pytania

Co to są pola promieniowania Mip-NeRF i antyaliasing?

Mip-NeRF naprawia rozmyte, postrzępione artefakty, które nękają oryginalny NeRF, gdy renderujesz sceny w różnych odległościach i rozdzielczościach. Robi to poprzez śledzenie stożków zamiast nieskończenie cienkich promieni, dzięki czemu renderowanie scen 3D jest ostrzejsze i szybsze w trenowaniu.

Jaki kształt geometryczny Mip-NeRF wyznacza w scenie zamiast cienkiego promienia używanego przez oryginalny NeRF?

Mip-NeRF rzuca z kamery stożek przez każdy piksel i dzieli go na stożkowe elementy ścięte, przechwytując objętość faktycznie pokrywaną przez piksel.

Jak nazywa się kodowanie Mip-NeRF, które zastępuje standardowe kodowanie pozycyjne?

Mip-NeRF wprowadza zintegrowane kodowanie pozycyjne, które koduje obszar (ścięcie w przybliżeniu Gaussa), a nie pojedynczy punkt.

Dlaczego oryginalny NeRF generuje aliasing, gdy zmienia się odległość kamery?

Próbka punktowa o cienkim promieniu ignoruje ślad piksela, więc bliskie i odległe piksele są traktowane identycznie, co powoduje postrzępienie i migotanie.

W jaki sposób Mip-NeRF przybliża obszar wewnątrz stożkowej ściętej części do kodowania?

Każde ścięcie jest aproksymowane za pomocą wielowymiarowego Gaussa, a kodowanie oblicza oczekiwaną wartość sinusoid względem tego Gaussa.

Co dzieje się z funkcjami kodowania wysokiej częstotliwości wewnątrz dużej ściętej struktury?

Ponieważ sinusoidy o wysokiej częstotliwości różnią się znacznie w dużej ściętej strukturze, całkowanie po Gaussa kieruje je w stronę zera, zapewniając antyaliasing podobny do mipmapy.