PRZEWODNIK techniczny

Cele InfoNCE i SimCLR

InfoNCE to strata kontrastowa, która uczy model łączenia pasujących par i rozsuwania niedopasowanych par w przestrzeni osadzania.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

SimCLR is a landmark framework that used this loss to learn powerful image representations from unlabeled data, rivaling supervised pretraining.

Głębokie nurkowanie

InfoNCE (szacowanie kontrastu szumu dla wzajemnych informacji) uczy kodera tak, aby zapytanie i jego prawdziwy wynik pozytywny miały wyższy wynik podobieństwa niż zapytanie i wiele negatywów. Zasadniczo jest to entropia krzyżowa typu softmax względem wyników podobieństwa: w przypadku kotwicy to, co pozytywne, powinno wygrać z negatywnymi. W SimCLR (2020) wykorzystano to w przypadku obrazów: wykonaj jeden obraz, zastosuj dwa losowe rozszerzenia, aby utworzyć dodatnią parę, przepuść oba przez współdzielony koder i głowicę projekcyjną i użyj znormalizowanej entropii krzyżowej skalowanej temperaturowo (NT-Xent, wariant InfoNCE), aby dwa rozszerzone widoki przyciągały się, podczas gdy wszystkie pozostałe obrazy w partii zachowywały się jak negatywy. SimCLR wykazało, że znaczne zwiększenie danych, nieliniowa głowica projekcyjna, duże rozmiary partii i dostrojona temperatura razem pozwalają samonadzorowanym modelom dopasowywać się do nadzorowanych w ImageNet — bez żadnych etykiet podczas wstępnego uczenia.

Wgląd techniczny

NT-Xent oblicza podobieństwo cosinus między osadzaniami znormalizowanymi L2, dzieli przez temperaturę τ i stosuje entropię krzyżową softmax, traktując dodatnią klasę jako właściwą spośród wszystkich przykładów wsadowych. Niższe τ wyostrza rozkład i bardziej karze twarde negatywy. Głowica projekcyjna SimCLR (MLP) jest używana tylko podczas wstępnego szkolenia i wyrzucana później — reprezentacje przed głowicą są lepiej przenoszone. Duże partie mają znaczenie, ponieważ dostarczają wiele negatywów w jednym kroku.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość celów InfoNCE i SimCLR

Kontrastowe cele wykraczają daleko poza SimCLR: CLIP dopasowuje obrazy do tekstu za pomocą InfoNCE w różnych modalnościach, a te same straty napędzają modele audio, wideo i wyszukiwania. Badania zmniejszają obecnie zależność od ogromnych partii i wielu negatywów za pośrednictwem banków pamięci (MoCo) lub całkowicie usuwają jawne negatywy (BYOL, SimSiam, DINO). Spodziewaj się ciągłego łączenia wstępnego szkolenia kontrastowego, destylacji i modelowania maskowanego z multimodalnym dopasowaniem (tekst, obraz, dźwięk) jako dominującą granicą dla modeli podstawowych.

Implementacja w świecie rzeczywistym

SimCLR wstępnie szkoli koder obrazu na nieoznakowanych zdjęciach, a następnie dostraja mały, oznaczony zestaw do klasyfikacji.

CLIP wykorzystujący obiektyw InfoNCE do dopasowywania obrazów do ich podpisów, umożliwiając klasyfikację obrazów metodą zero-shot.

Budowanie wizualnego wyszukiwania/odzyskiwania, w którym podobne obrazy znajdują się blisko siebie w wyuczonej przestrzeni osadzania.

Samonadzorowane szkolenie wstępne w zakresie zdjęć medycznych lub satelitarnych, w przypadku których etykiet jest niewiele, ale jest mnóstwo surowych danych.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfoNCE and SimCLR Objectives quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Lookahead i Lion Optimizery

Często zadawane pytania

What is InfoNCE and SimCLR Objectives?

InfoNCE to strata kontrastowa, która uczy model łączenia pasujących par i rozsuwania niedopasowanych par w przestrzeni osadzania. SimCLR to przełomowa platforma, która wykorzystała tę stratę do poznania potężnych reprezentacji obrazów z nieoznaczonych danych, co stanowi konkurencję dla nadzorowanego szkolenia wstępnego.

Do czego cel InfoNCE zachęca modelkę?

InfoNCE to softmax oparty na podobieństwach, który nagradza wysokie podobieństwo w przypadku prawdziwych pozytywów i niskie podobieństwo w przypadku negatywów.

Jak w SimCLR tworzy się pozytywna para?

SimCLR generuje parę dodatnią z dwóch rozszerzonych widoków tego samego obrazu źródłowego; inne obrazy służą jako negatywy.

Jaką rolę odgrywa temperatura τ w NT-Xent/InfoNCE?

Dzielenie podobieństw przez τ przed softmaxem kontroluje, jak ostro strata odróżnia pozytywów od twardych negatywów.

Co dzieje się z głowicą projekcyjną SimCLR po treningu wstępnym?

SimCLR stwierdziło, że funkcje przed głowicą projekcyjną są lepiej przenoszone, więc głowa jest wyrzucana po treningu wstępnym.

Dlaczego SimCLR polegał na dużych seriach?

W SimCLR pozostałe obrazy w partii działają jak negatywy, więc większe partie dają więcej negatywów i lepsze uczenie się.