GUIDE DE L'IA Visuelle

Champs de rayonnement neuronal

Les champs de radiance neuronale (NeRF) reconstruisent une scène entièrement en 3D à partir d'une poignée de photos ordinaires, vous permettant ainsi de piloter l'appareil photo vers de tout nouveaux points de vue.

2 minutes de lectureDernière mise à jour

Aperçu

It reframed 3D capture as training a tiny neural network rather than building a mesh.

Plongée profonde

Introduit en 2020 par Mildenhall et ses collègues, NeRF stocke une scène entière dans un petit réseau neuronal (un perceptron multicouche). Étant donné un point 3D et une direction de visualisation, le réseau affiche la couleur de ce point et son opacité. Pour restituer un pixel, NeRF envoie un rayon dans la scène, échantillonne les points le long de celui-ci, interroge le réseau et mélange les résultats à l'aide du rendu de volume. Étant donné que l'ensemble de ce processus est différenciable, le réseau est entraîné en comparant les pixels rendus aux photos réelles d'entrée et en les ajustant jusqu'à ce qu'ils correspondent. Le résultat est un photoréalisme saisissant, y compris des effets dépendants de la vue, tels que des reflets et des reflets brillants qui changent à mesure que vous vous déplacez. Les inconvénients sont que chaque scène nécessite sa propre séquence d'entraînement, et la méthode originale était lente à la fois à l'entraînement et au rendu.

Aperçu technique

NeRF représente une scène comme une fonction 5D continue : saisissez une position (x, y, z) plus une direction de visualisation (deux angles), et le MLP renvoie la couleur RVB et la densité du volume. Un détail crucial est le codage de position, qui mappe les coordonnées via des fonctions sinus et cosinus haute fréquence afin que le réseau puisse capturer des détails nets au lieu de produire une sortie floue. Le rendu intègre la couleur et la densité le long de chaque rayon de caméra, pondérant plus lourdement les échantillons plus proches et plus opaques, exactement les mathématiques du rendu de volume classique rendu entraînable.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir des champs de rayonnement neuronal

La recherche NeRF a explosé après 2020, avec des suivis comme Instant-NGP réduisant la formation de quelques heures à quelques secondes à l'aide d'encodages de grille de hachage, et Mip-NeRF améliorant la qualité à toutes les échelles. Le domaine fusionne de plus en plus avec ou est contesté par le Splatting gaussien, qui rend le rendu plus rapide. Attendez-vous à des techniques dérivées du NeRF en matière de cartographie, de vues de produits de commerce électronique, d'effets visuels de films et d'AR/VR, ainsi qu'à une croissance des NeRF dynamiques qui gèrent les scènes en mouvement et les captures « dans la nature » avec un éclairage changeant. Les grands thèmes sont la vitesse, la possibilité de modification et la capture de scènes à partir de photos moins nombreuses et plus compliquées.

Mise en œuvre dans le monde réel

Transformer une vidéo téléphonique d'un objet en une vue 3D sur laquelle vous pouvez orbiter pour faire des achats en ligne

Reconstruire des lieux réels comme décors photoréalistes pour des films et des effets visuels

Créer des scènes 3D immersives pour des expériences de réalité virtuelle et augmentée

Préserver numériquement les sites et les artefacts du patrimoine culturel à partir de séries de photos

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Mip-NeRF et champs de rayonnement anticrénelés

Questions fréquemment posées

What is Neural Radiance Fields?

Les champs de radiance neuronale (NeRF) reconstruisent une scène entièrement en 3D à partir d'une poignée de photos ordinaires, vous permettant ainsi de piloter l'appareil photo vers de tout nouveaux points de vue. Il a recadré la capture 3D comme la formation d’un petit réseau neuronal plutôt que la construction d’un maillage.

Quel est l’objectif principal d’un champ de radiance neuronale ?

NeRF construit une représentation 3D à partir d'un ensemble d'images, permettant un rendu photoréaliste à partir de points de vue ne figurant pas dans les photos originales.

Que produit le réseau neuronal NeRF pour une entrée donnée ?

Pour une position 3D et une direction de visualisation, le MLP renvoie la couleur et la densité (opacité) à ce point.

Quelles sont les entrées de la fonction 5D de NeRF ?

NeRF prend un emplacement 3D (x, y, z) et une direction de visualisation (deux angles), totalisant cinq entrées.

Comment NeRF transforme-t-il ses sorties réseau en une couleur de pixel finale ?

NeRF échantillonne des points le long de chaque rayon et intègre leur couleur pondérée par la densité, l'équation classique de rendu de volume rendue différentiable.

Pourquoi NeRF utilise-t-il le codage de position sur les coordonnées d'entrée ?

La cartographie des coordonnées via des fonctions sinus/cosinus haute fréquence permet au MLP de représenter des détails fins au lieu de résultats flous.