GUIDE DE L'IA Visuelle

Estimation stéréo de la profondeur

L'estimation stéréo de la profondeur permet de déterminer la distance qui sépare les objets en comparant deux vues de caméra légèrement décalées, tout comme le font vos deux yeux.

2 minutes de lectureDernière mise à jour

Aperçu

It turns flat images into 3D distance maps that robots, cars, and phones rely on to understand space.

Plongée profonde

L’estimation stéréo de la profondeur utilise deux caméras distantes d’une distance fixe (la ligne de base). Le même point du monde atterrit à des positions horizontales légèrement différentes dans les images de gauche et de droite, et ce décalage est appelé disparité. Les objets proches bougent beaucoup ; les lointains bougent à peine. La profondeur est calculée comme (distance focale x ligne de base) / disparité, donc la profondeur et la disparité sont inversement liées. La partie la plus difficile consiste à faire correspondre les pixels entre les deux images, en particulier sur des murs unis, des motifs répétitifs ou des surfaces réfléchissantes où de nombreux pixels semblent identiques. Les méthodes classiques telles que Semi-Global Matching analysent le long des lignes de balayage, tandis que les réseaux profonds modernes tels que PSMNet et RAFT-Stereo apprennent des fonctionnalités riches et affinent les disparités de manière itérative, produisant une profondeur dense et précise même dans les régions difficiles.

Aperçu technique

Les deux images sont d'abord rectifiées afin que les points correspondants se trouvent sur la même ligne horizontale, réduisant ainsi la recherche à une seule dimension. Un volume de coûts est construit en testant la disparité de chaque candidat pour chaque pixel, en mesurant dans quelle mesure les caractéristiques gauche et droite concordent. Les réseaux agrègent ce volume avec des convolutions 3D ou des mises à jour récurrentes, puis évaluent les disparités pour obtenir une précision inférieure au pixel. La relation inverse entre la disparité et la profondeur signifie que la profondeur lointaine est intrinsèquement plus bruyante que la profondeur proche.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L’avenir de l’estimation stéréo de la profondeur

Attendez-vous à une fusion plus étroite de la stéréo avec les signaux LiDAR, radar et monoculaires afin que les systèmes se dégradent gracieusement lorsqu'un capteur tombe en panne. La correspondance basée sur un transformateur et la formation auto-supervisée (apprentissage à partir d'une vidéo brute sans profondeur de vérité terrain) réduisent le besoin de données étiquetées coûteuses. L'efficacité sur les appareils s'améliore rapidement, en mettant la stéréo en temps réel sur les drones, les lunettes AR et les robots bon marché. Les caméras événementielles et les modèles actifs appris promettent une profondeur fiable même dans des scènes de faible luminosité, de flou de mouvement et sans texture qui vont à l'encontre des méthodes actuelles.

Mise en œuvre dans le monde réel

Les systèmes de conduite autonome et d'aide à la conduite utilisent des caméras stéréo pour évaluer la distance par rapport aux voitures, aux piétons et aux trottoirs pour le freinage et le maintien de la voie.

Les robots d'entrepôt et agricoles créent des cartes 3D pour saisir des objets, éviter les obstacles et cueillir des fruits à la bonne profondeur.

Les casques AR/VR comme les appareils passthrough estiment la géométrie de la pièce afin que les objets virtuels soient correctement placés sur les surfaces réelles.

Les rovers martiens (par exemple Perseverance) utilisent des caméras de navigation stéréo pour planifier des chemins sûrs sur des terrains rocheux sans GPS.

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stereo Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Estimation de la profondeur de diffusion des soucis

Questions fréquemment posées

What is Stereo Depth Estimation?

L'estimation stéréo de la profondeur permet de déterminer la distance qui sépare les objets en comparant deux vues de caméra légèrement décalées, tout comme le font vos deux yeux. Il transforme des images plates en cartes de distance 3D sur lesquelles les robots, les voitures et les téléphones s'appuient pour comprendre l'espace.

Qu'est-ce que la « disparité » en vision stéréo ?

La disparité est la distance dans laquelle un point correspondant se déplace horizontalement entre les deux vues rectifiées ; une plus grande disparité signifie que l’objet est plus proche.

Quel est le lien entre la profondeur et la disparité ?

Profondeur = (distance focale x ligne de base) / disparité, de sorte que à mesure que la disparité diminue, la profondeur estimée augmente. Les objets lointains ont une infime disparité.

Pourquoi les images sont-elles « rectifiées » avant de correspondre ?

La rectification déforme les deux images afin que les correspondances soient confinées à une seule ligne horizontale, transformant ainsi une recherche 2D en une recherche 1D rapide.

Quel scénario est le plus difficile pour la correspondance stéréo ?

Les surfaces sans texture ou répétitives donnent à de nombreux pixels une apparence identique, de sorte que l'algorithme ne peut pas trouver la correspondance correcte avec certitude.

À quoi fait référence la « ligne de base » ?

La ligne de base est la séparation entre les deux centres de la caméra ; une ligne de base plus large améliore la précision des objets distants.