PODSTAWOWY PRZEWODNIK

Rezygnacja z pracy i regularyzacja stochastyczna

Rezygnacja to sztuczka regularyzacyjna, która losowo wyłącza część neuronów na każdym etapie uczenia, zmuszając sieć do tworzenia nadmiarowych, solidnych reprezentacji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It became one of the most influential techniques for fighting overfitting in deep learning.

Głębokie nurkowanie

Metoda porzucania nauki, wprowadzona przez grupę Hintona około 2012 r., odnosi się do kluczowej słabości dużych sieci: neurony mogą się współadaptować, ucząc się wzajemnego naprawiania błędów w sposób, który działa tylko na danych szkoleniowych. Przy każdym przejściu do przodu podczas treningu, przerwa losowo ustawia wyjście każdego neuronu na zero z pewnym prawdopodobieństwem p (często 0,5 w gęstych warstwach). Ponieważ dowolny neuron może zniknąć, sieć nie może opierać się na kruchych partnerstwach i musi rozpowszechniać przydatne informacje pomiędzy wieloma jednostkami. Działa to jak trenowanie ogromnego zestawu rozrzedzonych sieci o wspólnych wagach. W czasie testu odrzucanie jest wyłączone i wykorzystywana jest cała sieć, a aktywacje są skalowane w taki sposób, aby oczekiwane dane wyjściowe odpowiadały treningowi. Rezultatem jest zazwyczaj lepsze uogólnienie kosztem nieco dłuższego szkolenia.

Wgląd techniczny

Podczas uczenia każda jednostka jest zachowywana z prawdopodobieństwem (1 minus p) za pomocą losowej maski binarnej, więc w każdej partii próbkowane są różne podsieci. Nowoczesne frameworki wykorzystują odwrócone przerywanie: pozostałe aktywacje są dzielone przez (1 minus p) w czasie pociągu, więc przy wnioskowaniu nie jest potrzebne żadne skalowanie. Ta losowość wprowadza szum, który zniechęca do współadaptacji i przybliża uśrednianie na wykładniczej liczbie podsieci o współdzielonej wadze, co jest tanią formą łączenia.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość porzucenia i regularyzacji stochastycznej

W sieciach z wizją splotową normalizacja wsadowa w dużej mierze wyparła standardowe zaniki, ale warianty rozwijają się gdzie indziej: transformatory stosują zaniki do warstw uwagi i przekazywania, a DropPath (głębokość stochastyczna) usuwa całe bloki resztkowe. Do oszacowania niepewności modelu wykorzystuje się rezygnację Monte Carlo, która utrzymuje tę eliminację aktywną przy wnioskowaniu. Oczekuj, że regularyzacja stochastyczna pozostanie elastycznym zestawem narzędzi, dostosowanym do architektury, a nie pojedynczą ustaloną receptą.

Implementacja w świecie rzeczywistym

Dodanie warstwy Dropout z p około 0,5 pomiędzy gęstymi warstwami klasyfikatora obrazu lub tekstu w PyTorch lub Keras

Modele transformatorowe stosujące zanik ciężarów uwagi i aktywacje wyprzedzające podczas treningu wstępnego

Rezygnacja z Monte Carlo, w przypadku której rezygnacja pozostaje włączona podczas wnioskowania w celu uzyskania szacunków niepewności dla prognoz medycznych lub krytycznych dla bezpieczeństwa

Głębokość stochastyczna (DropPath) losowo pomija bloki resztkowe w celu uregulowania bardzo głębokich sieci, takich jak ResNets i transformatory wizyjne

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie pomaga rezygnacja z nauki i regularyzacja stochastyczna oraz gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Stochastyczne opadanie gradientu z pędem

Często zadawane pytania

What is Dropout and Stochastic Regularization?

Rezygnacja to sztuczka regularyzacyjna, która losowo wyłącza część neuronów na każdym etapie uczenia, zmuszając sieć do tworzenia nadmiarowych, solidnych reprezentacji. Stała się jedną z najbardziej wpływowych technik zwalczania nadmiernego dopasowania w uczeniu głębokim.

Co robi rezygnacja z treningu?

Rezygnacja losowo zeruje każdy neuron z prawdopodobieństwem p podczas uczenia, więc na każdym etapie używana jest inna rozrzedzona podsieć.

Dlaczego rezygnacja z nauki sprzyja uogólnianiu?

Losowe usuwanie jednostek uniemożliwia neuronom tworzenie delikatnych powiązań, które działają tylko na danych szkoleniowych, co poprawia niezawodność.

Co dzieje się z porzuceniem w czasie testu (wnioskowania)?

Podsumowując, cała sieć działa z wyłączoną funkcją przerywania, a aktywacje są skalowane w taki sposób, aby oczekiwane wyniki odpowiadały rozkładowi szkoleniowemu.

Co w przybliżeniu oznacza współczynnik rezygnacji p = 0,5 w warstwie podczas treningu?

Przy p = 0,5 każdy neuron ma 50% szans na wyzerowanie, więc średnio około połowa zostaje usunięta przy każdym przejściu do przodu.

Co jest często określane jako przybliżone?

Próbkowanie różnych podsieci na każdym etapie jest przybliżeniem uśredniania wykładniczej liczby sieci o współdzielonej wadze, co jest formą taniego zestawu.