ΟΔΗΓΟΣ οπτικού AI

Στερεοφωνική εκτίμηση βάθους

Η στερεοφωνική εκτίμηση βάθους ανακτά πόσο μακριά είναι τα πράγματα συγκρίνοντας δύο ελαφρώς μετατοπισμένες προβολές κάμερας, όπως ακριβώς κάνουν τα δύο μάτια σας.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It turns flat images into 3D distance maps that robots, cars, and phones rely on to understand space.

Βαθιά κατάδυση

Η στερεοφωνική εκτίμηση βάθους χρησιμοποιεί δύο κάμερες σε σταθερή απόσταση μεταξύ τους (η γραμμή βάσης). Το ίδιο σημείο στον κόσμο προσγειώνεται σε ελαφρώς διαφορετικές οριζόντιες θέσεις στην αριστερή και τη δεξιά εικόνα, και αυτή η μετατόπιση ονομάζεται ανισότητα. Τα κοντινά αντικείμενα μετατοπίζονται πολύ. οι μακρινοί μετά βίας κινούνται. Το βάθος υπολογίζεται ως (εστιακή απόσταση x γραμμή βάσης) / ανισότητα, επομένως το βάθος και η ανισότητα σχετίζονται αντιστρόφως. Το δύσκολο κομμάτι είναι η αντιστοίχιση pixel μεταξύ των δύο εικόνων, ειδικά σε απλούς τοίχους, επαναλαμβανόμενα μοτίβα ή ανακλαστικές επιφάνειες όπου πολλά εικονοστοιχεία φαίνονται πανομοιότυπα. Κλασικές μέθοδοι όπως το Semi-Global Matching σαρώνουν κατά μήκος γραμμών σάρωσης, ενώ τα σύγχρονα δίκτυα σε βάθος όπως το PSMNet και το RAFT-Stereo μαθαίνουν πλούσιες δυνατότητες και βελτιώνουν την ανισότητα επαναληπτικά, παράγοντας πυκνό, ακριβές βάθος ακόμη και σε δύσκολες περιοχές.

Τεχνική διορατικότητα

Και οι δύο εικόνες διορθώνονται πρώτα, ώστε τα σημεία που ταιριάζουν να βρίσκονται στην ίδια οριζόντια σειρά, μειώνοντας την αναζήτηση σε μία διάσταση. Ένας όγκος κόστους δημιουργείται δοκιμάζοντας κάθε υποψήφια διαφορά για κάθε pixel, μετρώντας πόσο καλά συμφωνούν τα αριστερά και τα δεξιά χαρακτηριστικά. Τα δίκτυα συγκεντρώνουν αυτόν τον τόμο με τρισδιάστατες συνελεύσεις ή επαναλαμβανόμενες ενημερώσεις και, στη συνέχεια, λαμβάνουν ένα soft-argmin πέρα ​​από τις ανισότητες για να λάβουν ακρίβεια υποπίξελ. Η αντίστροφη σχέση μεταξύ της ανισότητας και του βάθους σημαίνει ότι το μακρινό βάθος είναι εγγενώς πιο θορυβώδες από το κοντινό βάθος.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

The Future of Stereo Depth Estimation

Αναμένετε στενότερη σύντηξη στερεοφωνικού με LiDAR, ραντάρ και μονόφθαλμα, ώστε τα συστήματα να υποβαθμίζονται με χάρη όταν ένας αισθητήρας αποτυγχάνει. Η αντιστοίχιση που βασίζεται σε μετασχηματιστές και η αυτοεποπτευόμενη εκπαίδευση (μάθηση από ακατέργαστο βίντεο χωρίς βάθος εδαφικής αλήθειας) μειώνουν την ανάγκη για ακριβά δεδομένα με ετικέτα. Η απόδοση στη συσκευή βελτιώνεται γρήγορα, τοποθετώντας στερεοφωνικό σε πραγματικό χρόνο σε drones, γυαλιά AR και φθηνά ρομπότ. Οι κάμερες εκδηλώσεων και τα μαθημένα ενεργά μοτίβα υπόσχονται αξιόπιστο βάθος ακόμη και σε συνθήκες χαμηλού φωτισμού, θαμπώματος κίνησης και σκηνών χωρίς υφή που νικούν τις σημερινές μεθόδους.

Υλοποίηση σε πραγματικό κόσμο

Τα συστήματα αυτοοδήγησης και υποβοήθησης οδηγού χρησιμοποιούν στερεοφωνικές κάμερες για τη μέτρηση της απόστασης από τα αυτοκίνητα, τους πεζούς και τα κράσπεδα για το φρενάρισμα και τη διατήρηση της λωρίδας.

Ρομπότ αποθηκών και αγροτικών προϊόντων κατασκευάζουν τρισδιάστατους χάρτες για να πιάνουν αντικείμενα, να αποφεύγουν τα εμπόδια και να μαζεύουν φρούτα στο σωστό βάθος.

Τα ακουστικά AR/VR, όπως οι συσκευές διέλευσης, υπολογίζουν τη γεωμετρία του δωματίου, ώστε τα εικονικά αντικείμενα να κάθονται σωστά σε πραγματικές επιφάνειες.

Τα ρόβερ του Άρη (π.χ. Perseverance) χρησιμοποιούν στερεοφωνικές κάμερες πλοήγησης για να σχεδιάζουν ασφαλείς διαδρομές σε βραχώδες έδαφος χωρίς GPS.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stereo Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Εκτίμηση βάθους διάχυσης κατιφέ

Συχνές ερωτήσεις

What is Stereo Depth Estimation?

Η στερεοφωνική εκτίμηση βάθους ανακτά πόσο μακριά είναι τα πράγματα συγκρίνοντας δύο ελαφρώς μετατοπισμένες προβολές κάμερας, όπως ακριβώς κάνουν τα δύο μάτια σας. Μετατρέπει επίπεδες εικόνες σε τρισδιάστατους χάρτες απόστασης στους οποίους βασίζονται τα ρομπότ, τα αυτοκίνητα και τα τηλέφωνα για να κατανοήσουν το διάστημα.

Τι είναι η «ανισότητα» στη στερεοφωνική όραση;

Η ανισότητα είναι το πόσο μακριά ένα αντίστοιχο σημείο μετακινείται οριζόντια μεταξύ των δύο διορθωμένων όψεων. μεγαλύτερη διαφορά σημαίνει ότι το αντικείμενο είναι πιο κοντά.

Πώς σχετίζεται το βάθος με την ανισότητα;

Βάθος = (εστιακή απόσταση x γραμμή βάσης) / ανισότητα, έτσι καθώς η ανισότητα συρρικνώνεται, το εκτιμώμενο βάθος αυξάνεται. Τα μακρινά αντικείμενα έχουν μικροσκοπικές διαφορές.

Γιατί οι εικόνες «διορθώνονται» πριν ταιριάζουν;

Η διόρθωση παραμορφώνει και τις δύο εικόνες, ώστε οι αντιστοιχίσεις να περιορίζονται σε μία οριζόντια γραμμή, μετατρέποντας τη διδιάστατη αναζήτηση σε γρήγορη αναζήτηση 1Δ.

Ποιο σενάριο είναι πιο δύσκολο για στερεοφωνική αντιστοίχιση;

Οι επιφάνειες χωρίς υφή ή επαναλαμβανόμενες επιφάνειες κάνουν πολλά pixel να φαίνονται πανομοιότυπα, επομένως ο αλγόριθμος δεν μπορεί να βρει με σιγουριά τη σωστή αντιστοίχιση.

Σε τι αναφέρεται η «βασική γραμμή»;

Η βασική γραμμή είναι ο διαχωρισμός μεταξύ των δύο κέντρων κάμερας. μια ευρύτερη γραμμή βάσης βελτιώνει την ακρίβεια για μακρινά αντικείμενα.