GUIDE DE L'IA Visuelle

Estimation de la profondeur monoculaire

L’estimation de la profondeur monoculaire prédit à quelle distance se trouve chaque pixel d’une seule photo ordinaire – aucune caméra stéréo, lidar ou capteur de profondeur n’est requis.

2 minutes de lectureDernière mise à jour

Aperçu

It lets one camera perceive 3D structure from a flat 2D image.

Plongée profonde

Les humains peuvent juger de la profondeur à partir d’un œil à l’aide d’indices tels que la perspective, la taille relative, les dégradés de texture, l’ombrage et l’occlusion. L'estimation de la profondeur monoculaire enseigne aux réseaux de neurones la même astuce : alimenter une seule image RVB et générer une valeur de profondeur pour chaque pixel. Étant donné qu’une image 2D est intrinsèquement ambiguë quant à son échelle absolue, la tâche est difficile : de nombreuses scènes 3D peuvent être projetées sur la même image. Les réseaux apprennent les statistiques a priori à partir de grands ensembles de données pour résoudre ce problème. La formation se décline en deux versions : supervisée, utilisant la profondeur de la vérité sur le terrain à partir de capteurs lidar ou RVB-D, et auto-supervisée, qui apprend la profondeur uniquement à partir de paires vidéo ou stéréo en veillant à ce que la profondeur prédite reprojete correctement une vue dans une autre. Les modèles de fondation récents comme MiDaS et Depth Anything se généralisent remarquablement à des scènes inédites.

Aperçu technique

Les méthodes auto-supervisées exploitent la géométrie au lieu des étiquettes. Étant donné deux vues (images vidéo stéréo ou consécutives) et une carte de profondeur prédite ainsi que le mouvement de la caméra, le modèle déforme une image pour reconstruire l'autre ; l'erreur de reconstruction au niveau du pixel devient le signal d'entraînement. Cette perte de « vue-synthèse » signifie que la profondeur peut être apprise à partir d'une vidéo brute et non étiquetée. Une limitation clé est l'ambiguïté de l'échelle : la profondeur monoculaire n'est souvent correcte que jusqu'à un multiplicateur inconnu à moins qu'elle ne soit calibrée par rapport à une référence connue ou à une supervision métrique.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir de l'estimation de la profondeur monoculaire

Les modèles de base de profondeur généralistes entraînés sur des millions d’images mixtes s’orientent vers une profondeur métrique (à échelle réelle) fiable dans n’importe quelle scène, même celles jamais vues en formation. Attendez-vous à une fusion plus étroite avec le flux optique et le SLAM pour une reconstruction complète de scènes 3D, à des modèles plus légers qui fonctionnent en direct sur des téléphones et des casques, et à une plus grande robustesse du tir zéro. Cela rendra la perception spatiale riche, bon marché et omniprésente, disponible à partir de n’importe quelle caméra unique plutôt que de coûteux appareils de détection de profondeur.

Mise en œuvre dans le monde réel

Mode portrait sur smartphone simulant le flou d'arrière-plan (bokeh) en estimant la distance entre le sujet et l'arrière-plan

Applications de réalité augmentée plaçant des objets virtuels pour qu'ils soient correctement placés derrière des meubles du monde réel

Drones et robots à faible coût évitant les obstacles à l'aide d'une seule caméra orientée vers l'avant

Conversion de photos et de films 2D en 3D en déduisant la profondeur par pixel pour un affichage stéréoscopique

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Estimation stéréo de la profondeur

Questions fréquemment posées

What is Monocular Depth Estimation?

L’estimation de la profondeur monoculaire prédit à quelle distance se trouve chaque pixel d’une seule photo ordinaire – aucune caméra stéréo, lidar ou capteur de profondeur n’est requis. Il permet à une caméra de percevoir la structure 3D à partir d’une image 2D plate.

Qu'est-ce qui rend l'estimation de la profondeur « monoculaire » ?

« Monoculaire » signifie un œil/une caméra ; la méthode prédit la profondeur à partir d'une seule image RVB sans capteurs de profondeur stéréo ou actifs.

Pourquoi l’estimation de la profondeur monoculaire est-elle fondamentalement ambiguë ?

Une seule projection 2D perd les informations d'échelle, de sorte que plusieurs arrangements 3D sont cohérents avec une seule image ; les réseaux s’appuient sur des a priori appris pour lever l’ambiguïté.

Comment les méthodes auto-supervisées apprennent-elles en profondeur sans étiquettes de vérité terrain ?

En utilisant la profondeur prévue et le mouvement de la caméra, le modèle reprojete une image sur une autre ; l'erreur photométrique fournit le signal d'apprentissage, aucune étiquette n'est nécessaire.

Sur quel signal les réseaux monoculaires ne s'appuient-ils PAS directement pour la profondeur ?

La disparité stéréo nécessite deux caméras ; les méthodes monoculaires s'appuient sur des indicateurs d'image unique tels que la taille, la perspective, la texture et l'occlusion.

Qu'est-ce que « l'ambiguïté d'échelle » en profondeur monoculaire ?

Sans supervision métrique ni référence connue, la profondeur monoculaire donne une structure relative correcte mais une échelle absolue incertaine.