Cele InfoNCE i SimCLR
InfoNCE to strata kontrastowa, która uczy model łączenia pasujących par i rozsuwania niedopasowanych par w przestrzeni osadzania.
Przegląd
SimCLR is a landmark framework that used this loss to learn powerful image representations from unlabeled data, rivaling supervised pretraining.
Głębokie nurkowanie
InfoNCE (szacowanie kontrastu szumu dla wzajemnych informacji) uczy kodera tak, aby zapytanie i jego prawdziwy wynik pozytywny miały wyższy wynik podobieństwa niż zapytanie i wiele negatywów. Zasadniczo jest to entropia krzyżowa typu softmax względem wyników podobieństwa: w przypadku kotwicy to, co pozytywne, powinno wygrać z negatywnymi. W SimCLR (2020) wykorzystano to w przypadku obrazów: wykonaj jeden obraz, zastosuj dwa losowe rozszerzenia, aby utworzyć dodatnią parę, przepuść oba przez współdzielony koder i głowicę projekcyjną i użyj znormalizowanej entropii krzyżowej skalowanej temperaturowo (NT-Xent, wariant InfoNCE), aby dwa rozszerzone widoki przyciągały się, podczas gdy wszystkie pozostałe obrazy w partii zachowywały się jak negatywy. SimCLR wykazało, że znaczne zwiększenie danych, nieliniowa głowica projekcyjna, duże rozmiary partii i dostrojona temperatura razem pozwalają samonadzorowanym modelom dopasowywać się do nadzorowanych w ImageNet — bez żadnych etykiet podczas wstępnego uczenia.
Wgląd techniczny
NT-Xent oblicza podobieństwo cosinus między osadzaniami znormalizowanymi L2, dzieli przez temperaturę τ i stosuje entropię krzyżową softmax, traktując dodatnią klasę jako właściwą spośród wszystkich przykładów wsadowych. Niższe τ wyostrza rozkład i bardziej karze twarde negatywy. Głowica projekcyjna SimCLR (MLP) jest używana tylko podczas wstępnego szkolenia i wyrzucana później — reprezentacje przed głowicą są lepiej przenoszone. Duże partie mają znaczenie, ponieważ dostarczają wiele negatywów w jednym kroku.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość celów InfoNCE i SimCLR
Kontrastowe cele wykraczają daleko poza SimCLR: CLIP dopasowuje obrazy do tekstu za pomocą InfoNCE w różnych modalnościach, a te same straty napędzają modele audio, wideo i wyszukiwania. Badania zmniejszają obecnie zależność od ogromnych partii i wielu negatywów za pośrednictwem banków pamięci (MoCo) lub całkowicie usuwają jawne negatywy (BYOL, SimSiam, DINO). Spodziewaj się ciągłego łączenia wstępnego szkolenia kontrastowego, destylacji i modelowania maskowanego z multimodalnym dopasowaniem (tekst, obraz, dźwięk) jako dominującą granicą dla modeli podstawowych.
Implementacja w świecie rzeczywistym
SimCLR wstępnie szkoli koder obrazu na nieoznakowanych zdjęciach, a następnie dostraja mały, oznaczony zestaw do klasyfikacji.
CLIP wykorzystujący obiektyw InfoNCE do dopasowywania obrazów do ich podpisów, umożliwiając klasyfikację obrazów metodą zero-shot.
Budowanie wizualnego wyszukiwania/odzyskiwania, w którym podobne obrazy znajdują się blisko siebie w wyuczonej przestrzeni osadzania.
Samonadzorowane szkolenie wstępne w zakresie zdjęć medycznych lub satelitarnych, w przypadku których etykiet jest niewiele, ale jest mnóstwo surowych danych.
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfoNCE and SimCLR Objectives quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Lookahead i Lion Optimizery
Często zadawane pytania
What is InfoNCE and SimCLR Objectives?
InfoNCE to strata kontrastowa, która uczy model łączenia pasujących par i rozsuwania niedopasowanych par w przestrzeni osadzania. SimCLR to przełomowa platforma, która wykorzystała tę stratę do poznania potężnych reprezentacji obrazów z nieoznaczonych danych, co stanowi konkurencję dla nadzorowanego szkolenia wstępnego.
Do czego cel InfoNCE zachęca modelkę?
InfoNCE to softmax oparty na podobieństwach, który nagradza wysokie podobieństwo w przypadku prawdziwych pozytywów i niskie podobieństwo w przypadku negatywów.
Jak w SimCLR tworzy się pozytywna para?
SimCLR generuje parę dodatnią z dwóch rozszerzonych widoków tego samego obrazu źródłowego; inne obrazy służą jako negatywy.
Jaką rolę odgrywa temperatura τ w NT-Xent/InfoNCE?
Dzielenie podobieństw przez τ przed softmaxem kontroluje, jak ostro strata odróżnia pozytywów od twardych negatywów.
Co dzieje się z głowicą projekcyjną SimCLR po treningu wstępnym?
SimCLR stwierdziło, że funkcje przed głowicą projekcyjną są lepiej przenoszone, więc głowa jest wyrzucana po treningu wstępnym.
Dlaczego SimCLR polegał na dużych seriach?
W SimCLR pozostałe obrazy w partii działają jak negatywy, więc większe partie dają więcej negatywów i lepsze uczenie się.