PRZEWODNIK techniczny

Stochastyczne uśrednianie wagi

Stochastyczne uśrednianie wagi (SWA) pobiera prostą średnią ciężarów modelu z kilku punktów na koniec treningu, zamiast po prostu zachowywać końcowy obraz.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Ta tania sztuczka często umieszcza model w bardziej płaskim, szerszym obszarze krajobrazu strat, który ma tendencję do zauważalnie lepszego uogólniania niewidocznych danych.

Głębokie nurkowanie

Wprowadzony przez Izmailova, Wilsona i współpracowników w 2018 roku, SWA wykorzystuje obserwację, że SGD o stałym lub cyklicznym tempie uczenia się nie zbiega się do jednego punktu – odbija się od krawędzi szerokiej, płaskiej doliny. Zamiast wybierać jeden z tych hałaśliwych punktów zatrzymania, SWA stosuje umiarkowanie wysoką (często stałą lub cykliczną) szybkość uczenia się dla końcowych epok i uśrednia odwiedzane wagi, zazwyczaj dla każdej epoki. Uśrednione wagi znajdują się bliżej środka płaskiego obszaru. Ponieważ statystyki normalizacji wsadowej są obliczane dla określonych wag, SWA wymaga jednego dodatkowego przejścia w przód danych w celu ponownego obliczenia bieżących średnich i wariancji BN dla uśrednionego modelu. Koszt jest zasadniczo bezpłatny, a przyrost dokładności jest stały we wszystkich klasyfikatorach obrazów i poza nimi.

Wgląd techniczny

SWA utrzymuje średnią kroczącą w_SWA = (n·w_SWA + w_i)/(n+1) aktualizowaną w każdym cyklu, podczas gdy działający model SGD kontynuuje eksplorację ze stosunkowo dużą szybkością uczenia się. Uśrednianie w przestrzeni wag jest przybliżeniem zbioru w przestrzeni funkcji, ale przy wnioskowaniu kosztuje jeden model, a nie wiele. Kluczowym mechanizmem jest to, że płaskie minima są odporne na zakłócenia wagowe, więc powierzchnie strat szkoleniowych/testowych pozostają wyrównane, zmniejszając lukę uogólniającą.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość stochastycznego uśredniania masy

SWA stworzyło warianty, takie jak SWA-Gaussian (SWAG) dla taniej niepewności bayesowskiej, a koncepcja uśredniania stanowi obecnie podstawę sztuczek wykładniczej średniej ruchomej szeroko stosowanych w modelach dyfuzyjnych, samonadzorowanym uczeniu się i wstępnym szkoleniu dużych modeli. Można się spodziewać, że uśrednianie wagi pozostanie domyślnym „darmowym lunchem” w przepisach szkoleniowych, a badania rozszerzą je na łączenie niezależnie wyszkolonych modeli (zupy modelowe) i poprawę kalibracji wraz z samą surową dokładnością.

Implementacja w świecie rzeczywistym

Zwiększanie dokładności testów klasyfikatorów obrazów ResNet i DenseNet w CIFAR i ImageNet bez dodatkowych kosztów wnioskowania.

SWAG (SWA-Gaussian) generujący skalibrowane szacunki niepewności dla prognoz wrażliwych na bezpieczeństwo na podstawie pojedynczego przebiegu szkoleniowego.

EMA wag stabilizujących sieć próbkowania w generatorach obrazu dyfuzyjnego, takich jak Stable Diffusion.

Konstruowanie „zup modelowych” poprzez uśrednianie wielu precyzyjnie dostrojonych punktów kontrolnych w celu poprawy niezawodności bez konieczności ponownego szkolenia.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Weight Averaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

Co to jest stochastyczne uśrednianie masy ciała?

Stochastyczne uśrednianie wagi (SWA) pobiera prostą średnią ciężarów modelu z kilku punktów na koniec treningu, zamiast po prostu zachowywać końcowy obraz. Ta tania sztuczka często umieszcza model w bardziej płaskim, szerszym obszarze krajobrazu strat, który ma tendencję do zauważalnie lepszego uogólniania niewidocznych danych.

Co właściwie uśrednia stochastyczne uśrednianie wagi?

SWA uśrednia parametry modelu (wagi) zebrane w kilku punktach kontrolnych podczas końcowej fazy szkolenia, a nie prognozy lub gradienty.

Dlaczego SWA ma tendencję do poprawiania generalizacji?

Uśrednianie przesuwa rozwiązanie w kierunku środka płaskiego obszaru powierzchni strat, a płaskie minima lepiej uogólniają, ponieważ straty pociągowe i testowe pozostają wyrównane.

Jakiego dodatkowego kroku wymaga SWA w przypadku sieci korzystających z normalizacji wsadowej?

Ponieważ statystyki BN zależą od konkretnych wag, uśredniony model wymaga jednego dodatkowego przejścia danych, aby ponownie obliczyć bieżące średnie i wariancje.

Jakie zachowanie związane z szybkością uczenia się jest zwykle stosowane podczas fazy uśredniania SWA?

SWA utrzymuje umiarkowanie wysoki, stały lub cykliczny współczynnik uczenia się, więc SGD kontynuuje eksplorację szerokiego, płaskiego obszaru, którego punkty są następnie uśredniane.

Jak koszt wnioskowania SWA wypada w porównaniu z tradycyjnym zestawem N modeli?

SWA łączy wiele punktów kontrolnych w jeden uśredniony zestaw wag, więc wnioskowanie kosztuje tyle samo, co pojedynczy model, a nie N.