PODSTAWOWY PRZEWODNIK

Spadek masy ciała i regularyzacja L2

Zmniejszanie masy ciała to prosta, ale skuteczna technika, która podczas treningu przesuwa ciężar modelu w kierunku zera, zniechęcając go do nadmiernego polegania na jakiejkolwiek pojedynczej funkcji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Zmniejsza nadmierne dopasowanie i jest jednym z najczęściej stosowanych regularizatorów w głębokim uczeniu.

Głębokie nurkowanie

Kiedy model trenuje, może wykorzystać szum w danych, tworząc duże, precyzyjnie dostrojone wagi, które idealnie pasują do zbioru uczącego, ale słabo uogólniają. Regularyzacja L2 zwalcza ten problem, dodając karę proporcjonalną do sumy kwadratów wag do funkcji straty. Optymalizator ma teraz dwa cele: dopasować dane i zachować małą wagę, aby skupić się na płynniejszych i solidniejszych rozwiązaniach. Spadek masy to ściśle powiązana koncepcja zmniejszania każdej masy o niewielki ułamek na każdym etapie aktualizacji. W przypadku zwykłego gradientu oba są matematycznie równoważne, ale w przypadku optymalizatorów adaptacyjnych, takich jak Adam, różnią się, dlatego też AdamW został wprowadzony, aby oddzielić zanik od aktualizacji opartej na gradiencie i sprawić, by zachowywał się poprawnie.

Wgląd techniczny

Regularyzacja L2 dodaje lambdę pomnożoną przez sumę kwadratów wag do straty, więc jej gradient dodaje człon proporcjonalny do każdej wagi, ciągnąc go w stronę zera. Oddzielony zanik masy zamiast tego mnoży każdą wagę bezpośrednio przez współczynnik (1 minus współczynnik uczenia się razy lambda). W metodach adaptacyjnych połączenie L2 ze stratą pozwala skalowaniu według parametrów zniekształcić karę, więc AdamW stosuje skurcz oddzielnie, przywracając zamierzone równomierne przyciąganie w kierunku mniejszych ciężarów.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość utraty wagi i regularyzacji L2

Zanik masy ciała pozostaje domyślnym składnikiem receptur szkoleniowych dla dużych modeli językowych i transformatorów wizyjnych, a AdamW jest obecnie ich standardowym optymalizatorem. Trwają badania nad interakcją rozpadu z harmonogramami szybkości uczenia się, warstwami normalizacyjnymi i skalą modelu, ponieważ jego efektywna siła zmienia się wraz z rozwojem modeli. W miarę dojrzewania zautomatyzowanego wyszukiwania hiperparametrów i badań nad prawem skalowania można spodziewać się bardziej opartego na zasadach strojenia, być może na poziomie warstwy lub uwzględniającego harmonogram.

Implementacja w świecie rzeczywistym

Dodanie Weight_decay w optymalizatorze AdamW lub SGD firmy PyTorch podczas uczenia klasyfikatorów obrazu w celu ograniczenia nadmiernego dopasowania

Dostrajanie współczynnika lambda w regresji grzbietowej, klasycznego modelu liniowego z karą L2, w celu ustabilizowania przewidywań dotyczących skorelowanych cech

Recepty na wstępne szkolenie modelu dużego języka, które ustalają niewielki spadek masy (często około 0,1) wraz z harmonogramem tempa uczenia się

Łączenie spadku masy ciała ze zwiększeniem i utratą danych, aby mały model obrazowania medycznego nie zapamiętywał ograniczonych skanów treningowych

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie pomaga spadek masy ciała i regularyzacja L2, a gdzie lepsze są prostsze metody.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

Czym jest spadek wagi i regularizacja L2?

Zmniejszanie masy ciała to prosta, ale skuteczna technika, która podczas treningu przesuwa ciężar modelu w kierunku zera, zniechęcając go do nadmiernego polegania na jakiejkolwiek pojedynczej funkcji. Redukuje nadmierne dopasowanie i jest jednym z najczęściej stosowanych regularyzatorów w głębokim uczeniu się.

Co regularyzacja L2 dodaje do funkcji straty?

Regularyzacja L2 dodaje lambdę razy sumę kwadratów wag, karząc duże wagi i zachęcając do mniejszych, płynniejszych rozwiązań.

Jaki jest główny problem, któremu pomaga zapobiegać utrata masy ciała?

Utrzymując małe wagi, zanik wagi zniechęca model do dopasowywania szumu, co poprawia uogólnianie na nowe dane.

W jakim kierunku zanik masy przesuwa ciężary modelu?

Zanik wagi zmniejsza ciężary do zera przy każdej aktualizacji i dlatego czasami określa się to jako „zmniejszanie” ciężarów.

Dlaczego wprowadzono AdamaW?

W Adamie złożenie L2 na stratę źle oddziałuje ze skalowaniem według parametrów; AdamW stosuje rozpad oddzielnie, aby przywrócić zamierzony równomierny skurcz.

W przypadku zwykłego stochastycznego gradientu, jak powiązane są ze sobą regularyzacja L2 i spadek masy?

W przypadku zwykłego SGD dodanie kary L2 do straty powoduje tę samą aktualizację, co bezpośrednie zmniejszenie ciężarów, więc oba są równoważne.