Απώλεια τριπλής και μετρική εκμάθηση
Η απώλεια τριπλής διδάσκει σε ένα νευρωνικό δίκτυο να τοποθετεί παρόμοια αντικείμενα κοντά μεταξύ τους και ανόμοια αντικείμενα μακριά το ένα από το άλλο σε έναν χώρο ενσωμάτωσης.
Επισκόπηση
It is the foundation behind face recognition, image search, and recommendation systems that need to compare things rather than just classify them.
Βαθιά κατάδυση
Η μετρική εκμάθηση εκπαιδεύει ένα μοντέλο να παράγει ενσωματώσεις, διανύσματα όπου η απόσταση αντανακλά ομοιότητα. Η απώλεια τριπλής το κάνει αυτό χρησιμοποιώντας τρεις εισόδους κάθε φορά: μια άγκυρα, μια θετική (ίδια κατηγορία με την άγκυρα) και μια αρνητική (διαφορετική κλάση). Ο στόχος ωθεί την άγκυρα πιο κοντά στο θετικό παρά στο αρνητικό κατά τουλάχιστον ένα σταθερό περιθώριο. Τυπικά, η απώλεια είναι max(0, d(a,p) - d(a,n) + περιθώριο), όπου d είναι συνήθως Ευκλείδεια απόσταση. Το FaceNet του 2015 του Google έκανε δημοφιλή αυτή την προσέγγιση, μαθαίνοντας απευθείας ενσωματώσεις προσώπων 128 διαστάσεων. Αφού εκπαιδευτείτε, συγκρίνετε οποιαδήποτε δύο στοιχεία υπολογίζοντας την απόσταση, χωρίς να χρειάζεται επανεκπαίδευση για νέες ταυτότητες. Αυτή η δυνατότητα ανοιχτού συνόλου είναι ο λόγος για τον οποίο η ταξινόμηση των εργασιών επαλήθευσης και ανάκτησης δυνάμεων μετρικής εκμάθησης δεν μπορεί να χειριστεί εύκολα.
Τεχνική διορατικότητα
Το περιθώριο είναι αυτό που κάνει την απώλεια τριπλής να λειτουργεί. Χωρίς αυτό, το μοντέλο θα μπορούσε να συμπτύξει επιπόλαια όλες τις ενσωματώσεις σε ένα μόνο σημείο, καθιστώντας κάθε απόσταση μηδέν και την παραγγελία χωρίς νόημα. Το περιθώριο αναγκάζει ένα buffer: το αρνητικό πρέπει να είναι τουλάχιστον περιθώριο πιο μακριά από το θετικό πριν η απώλεια φτάσει στο μηδέν. Οι ενσωματώσεις τυπικά κανονικοποιούνται L2 σε μια υπερσφαιρική μονάδα, έτσι οι αποστάσεις παραμένουν περιορισμένες και συγκρίσιμες. Η επιλογή του περιθωρίου (συχνά γύρω στο 0,2) αντισταθμίζει το πόσο στενά συγκεντρώνονται οι κατηγορίες έναντι του διαχωρισμού μεταξύ τους.
Στρατηγικός αντίκτυπος
Σαφέστερες αποφάσεις
Σας βοηθά να διαχωρίσετε σαφείς τεχνικούς ισχυρισμούς από τη γλώσσα μάρκετινγκ.
Κόστος και προϋπολογισμός
Μπορείτε να κάνετε καλύτερες ερωτήσεις εφαρμογής προτού ξοδέψετε χρήματα ή χρόνο.
Ομάδα και ροή εργασίας
Οι ομάδες με κοινή κατανόηση λαμβάνουν καλύτερες αποφάσεις για προϊόντα, πολιτικές και μάθηση.
Το μέλλον της απώλειας τριπλών και της μετρικής μάθησης
Η καθαρή απώλεια τριπλής αντικαθίσταται ολοένα και περισσότερο από αντικειμενικούς στόχους σε επίπεδο παρτίδας, όπως απώλειες πολλαπλής ομοιότητας, αγκύρωσης μεσολάβησης και απώλειες αντίθεσης (InfoNCE) που συγκρίνουν πολλά ζεύγη ανά βήμα και συγκλίνουν πιο γρήγορα. Οι αυτοεποπτευόμενες μέθοδοι όπως το SimCLR δείχνουν ότι η εκμάθηση μετρήσεων μπορεί να λειτουργήσει χωρίς ετικέτες, αντιμετωπίζοντας τις επαυξημένες προβολές ως θετικές. Καθώς οι διανυσματικές βάσεις δεδομένων και η επαυξημένη παραγωγή με ανάκτηση αυξάνονται, οι μαθημένες ενσωματώσεις στηρίζουν τη σημασιολογική αναζήτηση σε κλίμακα δισεκατομμυρίων στοιχείων, έτσι η βασική ιδέα της απόστασης ως ομοιότητας γίνεται πιο κεντρική, ακόμη και όταν η συγκεκριμένη διατύπωση τριπλέτας εξασθενεί.
Υλοποίηση σε πραγματικό κόσμο
Επαλήθευση προσώπου σε στυλ FaceNet: τα τηλέφωνα και οι πύλες διαβατηρίων επιβεβαιώνουν την ταυτότητα ελέγχοντας εάν δύο ενσωματώσεις προσώπων εμπίπτουν σε ένα όριο απόστασης.
Οπτική αναζήτηση προϊόντων: οι ιστότοποι ηλεκτρονικού εμπορίου επιτρέπουν στους αγοραστές να ανεβάζουν μια φωτογραφία και να ανακτούν οπτικά παρόμοια αντικείμενα μέσω αναζήτησης ενσωμάτωσης του πλησιέστερου γείτονα.
Επαλήθευση ομιλητή: Οι βοηθοί φωνής ενσωματώνουν ένα δείγμα φωνής και το συγκρίνουν με ένα εγγεγραμμένο προφίλ για να επιβεβαιώσουν ποιος μιλάει.
Επαλήθευση υπογραφής και χειρόγραφου: οι τράπεζες ενσωματώνουν υπογραφές αναφοράς και ερωτήματα και επισημαίνουν πλαστές σημαίες όταν η απόσταση υπερβαίνει ένα μαθημένο περιθώριο.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Διαφορετικές ομάδες μπορεί να χρησιμοποιούν τον ίδιο όρο με διαφορετικό τρόπο, επομένως ορίστε το πεδίο εφαρμογής νωρίς.
Τα σημεία αναφοράς μπορεί να φαίνονται ισχυρά ενώ η απόδοση στον πραγματικό κόσμο είναι άνιση.
Η αγνόηση της ποιότητας των δεδομένων και των σχεδίων αξιολόγησης δημιουργεί συχνά εύθραυστα αποτελέσματα.
Οδικός Χάρτης Εφαρμογής
Ξεκινήστε με έναν ορισμό σε απλή γλώσσα του αποτελέσματος που χρειάζεστε.
Επιλέξτε μία μέτρηση επιτυχίας και μία συνθήκη αποτυχίας πριν από τη δοκιμή.
Εκτελέστε ένα μικρό πιλότο με αντιπροσωπευτικά δεδομένα, όχι ένα εκλεπτυσμένο σετ επίδειξης.
Τεκμηριώστε πού βοηθάει η Απώλεια Τριπλών και η Μετρική Εκμάθηση και πού είναι καλύτερες οι απλούστερες μέθοδοι.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Triplet Loss and Metric Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Σιαμέζικα δίκτυα και απώλεια τριπλών
Συχνές ερωτήσεις
What is Triplet Loss and Metric Learning?
Η απώλεια τριπλής διδάσκει σε ένα νευρωνικό δίκτυο να τοποθετεί παρόμοια αντικείμενα κοντά μεταξύ τους και ανόμοια αντικείμενα μακριά το ένα από το άλλο σε έναν χώρο ενσωμάτωσης. Είναι το θεμέλιο πίσω από τα συστήματα αναγνώρισης προσώπου, αναζήτησης εικόνων και συστάσεων που πρέπει να συγκρίνουν τα πράγματα αντί να τα ταξινομούν απλώς.
Ποιες τρεις εισροές συνθέτουν μια τριάδα σε απώλεια τριπλής;
Ένα τρίδυμο αποτελείται από μια άγκυρα, μια θετική που μοιράζεται την κατηγορία της άγκυρας και μια αρνητική από μια διαφορετική κατηγορία.
Γιατί η απώλεια τριπλής περιλαμβάνει όρο περιθωρίου;
Χωρίς περιθώριο, το μοντέλο μπορούσε να χαρτογραφήσει τα πάντα στο ίδιο σημείο, μηδενίζοντας όλες τις αποστάσεις και ικανοποιώντας επιπόλαια την απώλεια. Το περιθώριο αναγκάζει τον πραγματικό διαχωρισμό.
Ποιο διάσημο σύστημα του 2015 έκανε δημοφιλή την απώλεια τριπλέτας για την αναγνώριση προσώπου;
Το FaceNet του Google χρησιμοποίησε απώλεια τριπλής για να μάθει συμπαγείς ενσωματώσεις προσώπου και να θέσει ένα σημείο αναφοράς στην επαλήθευση προσώπου.
Τι βγάζει ένα εκπαιδευμένο μοντέλο μετρικής εκμάθησης για κάθε είσοδο;
Το μοντέλο αντιστοιχίζει εισόδους σε ενσωματωμένα διανύσματα. Στη συνέχεια συγκρίνετε τα στοιχεία μετρώντας την απόσταση μεταξύ των ενσωματώσεών τους.
Γιατί η εκμάθηση μετρήσεων είναι κατάλληλη για προβλήματα ανοιχτού συνόλου, όπως η προσθήκη νέων προσώπων;
Επειδή η αναγνώριση βασίζεται στην απόσταση ενσωμάτωσης, μπορείτε να εγγράψετε μια νέα ταυτότητα απλώς αποθηκεύοντας την ενσωμάτωσή της, χωρίς να απαιτείται επανεκπαίδευση μοντέλου.