Strata trójek i uczenie się metryk
Utrata trójek uczy sieć neuronową umieszczania podobnych elementów blisko siebie i odmiennych elementów daleko od siebie w przestrzeni osadzania.
Przegląd
It is the foundation behind face recognition, image search, and recommendation systems that need to compare things rather than just classify them.
Głębokie nurkowanie
Uczenie się metryczne uczy model tworzenia osadzonych wektorów, w których odległość odzwierciedla podobieństwo. Utrata potrójna odbywa się przy użyciu trzech danych wejściowych jednocześnie: kotwicy, dodatniej (ta sama klasa co kotwica) i ujemnej (inna klasa). Cel przesuwa kotwicę bliżej pozytywu niż negatywu przynajmniej o ustalony margines. Formalnie strata wynosi max(0, d(a,p) - d(a,n) + margines), gdzie d jest zwykle odległością euklidesową. Sieć FaceNet Google z 2015 r. spopularyzowała to podejście, ucząc się bezpośrednio 128-wymiarowego osadzania twarzy. Po przeszkoleniu porównujesz dowolne dwa elementy, obliczając odległość, bez konieczności ponownego szkolenia w celu uzyskania nowych tożsamości. Dzięki tej możliwości zbioru otwartego klasyfikacja zadań związanych z weryfikacją i wyszukiwaniem danych nie jest łatwa do wykonania.
Wgląd techniczny
Marża jest tym, co sprawia, że strata tripletowa działa. Bez tego model mógłby w trywialny sposób zwinąć wszystkie osady w jeden punkt, czyniąc każdą odległość zerową i kolejność bez znaczenia. Margines wymusza bufor: margines ujemny musi znajdować się co najmniej dalej niż margines dodatni, zanim strata osiągnie zero. Osadzenia są zazwyczaj normalizowane przez L2 do hipersfery jednostkowej, więc odległości pozostają ograniczone i porównywalne. Wybór marginesu (często około 0,2) równoważy stopień skupienia klas w stosunku do separacji między nimi.
Wpływ strategiczny
Jaśniejsze decyzje
Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.
Koszt i budżet
Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.
Zespół i przepływ pracy
Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.
Przyszłość utraty trójek i uczenia się metryk
Czystą stratę tripletową coraz częściej zastępuje się celami obejmującymi całą partię, takimi jak wielokrotne podobieństwo, kotwica zastępcza i straty kontrastowe (InfoNCE), które porównują wiele par na krok i szybciej zbiegają się. Metody samonadzorowane, takie jak SimCLR, pokazują, że uczenie się metryk może działać bez etykiet, traktując widoki rozszerzone jako pozytywne. W miarę wzrostu wektorowych baz danych i generacji wspomaganej wyszukiwaniem, wyuczone osadzania stanowią podstawę wyszukiwania semantycznego w skali miliardów elementów, więc podstawowa idea odległości jako podobieństwa staje się coraz bardziej centralna, nawet gdy konkretne sformułowanie trójki zanika.
Implementacja w świecie rzeczywistym
Weryfikacja twarzy w stylu FaceNet: telefony i bramki paszportowe potwierdzają tożsamość, sprawdzając, czy dwie wizerunki twarzy mieszczą się w określonym progu odległości.
Wizualne wyszukiwanie produktów: witryny handlu elektronicznego umożliwiają kupującym przesyłanie zdjęć i pobieranie wizualnie podobnych produktów poprzez wyszukiwanie najbliższego sąsiada.
Weryfikacja mówiącego: asystenci głosowi osadzają próbkę głosu i porównują ją z zarejestrowanym profilem, aby potwierdzić, kto mówi.
Weryfikacja podpisów i pisma ręcznego: banki osadzają referencje i wysyłają zapytania o podpisy oraz flagi podrabiane, gdy odległość przekracza wyuczony margines.
Zagrożenia i poręcze
Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.
Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.
Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.
Plan wdrożenia
Zacznij od jasnej definicji potrzebnego wyniku.
Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.
Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.
Dokument, w którym pomaga strata potrójna i uczenie się metryk, a w których prostsze metody są lepsze.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Triplet Loss and Metric Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Sieci syjamskie i utrata trójek
Często zadawane pytania
What is Triplet Loss and Metric Learning?
Utrata trójek uczy sieć neuronową umieszczania podobnych elementów blisko siebie i odmiennych elementów daleko od siebie w przestrzeni osadzania. Stanowi podstawę systemów rozpoznawania twarzy, wyszukiwania obrazów i rekomendacji, które muszą porównywać rzeczy, a nie tylko je klasyfikować.
Jakie trzy wejścia składają się na trójkę przy utracie trójki?
Trójka składa się z kotwicy, pozytywu należącego do klasy kotwicy i negatywu z innej klasy.
Dlaczego strata potrójna obejmuje termin depozytu zabezpieczającego?
Bez marginesu model mógłby odwzorować wszystko w tym samym punkcie, sprawiając, że wszystkie odległości były zerowe i w trywialny sposób zaspokajał stratę. Margines wymusza prawdziwą separację.
Który słynny system z 2015 r. spopularyzował utratę trójek w rozpoznawaniu twarzy?
Sieć FaceNet firmy Google wykorzystała utratę trójek, aby nauczyć się osadzania kompaktowych twarzy i ustanowić punkt odniesienia w weryfikacji twarzy.
Co daje wyszkolony model uczenia się metryk dla każdego wejścia?
Model odwzorowuje dane wejściowe na wektory osadzania; następnie porównujesz elementy, mierząc odległość między ich osadzeniem.
Dlaczego uczenie się metryczne dobrze sprawdza się w przypadku problemów o zbiorach otwartych, takich jak dodawanie nowych twarzy?
Ponieważ rozpoznawanie opiera się na odległości osadzania, możesz zarejestrować nową tożsamość, po prostu zapisując jej osadzenie, bez konieczności ponownego uczenia modelu.