PODSTAWOWY PRZEWODNIK

Hipoteza dotycząca losu na loterię

Hipoteza losu na loterię mówi, że wewnątrz dużej, losowo inicjowanej sieci neuronowej kryje się mała podsieć — „zwycięski los”, która wyszkolona samodzielnie na podstawie tych samych początkowych wag może dorównać dokładnością całej sieci.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it suggests we are training far more parameters than we actually need.

Głębokie nurkowanie

Hipoteza zaproponowana przez Jonathana Frankle i Michaela Carbina z MIT w 2018 roku wyrosła z badań nad przycinaniem. Zwykle można przyciąć wyszkoloną sieć do 10–20% jej wag bez utraty dokładności, ale szkolenie tej małej sieci od zera kończy się niepowodzeniem. Frankle i Carbin znaleźli sposób: zachowaj oryginalne wagi początkowe pozostałych połączeń. Ta rzadka podsieć – zwycięski bilet – następnie trenuje z pełną dokładnością w izolacji, czasami szybciej niż gęsty oryginał. Zidentyfikowali bilety poprzez „iteracyjne przycinanie wielkości”: trenuj, przycinaj ciężarki o najmniejszej wielkości, przewijaj resztę do wartości początkowych i powtarzaj. Wynik sugeruje, że gęsta nadparametryzacja pomaga głównie optymalizacji w znalezieniu dobrej, rzadkiej struktury, a nie, że wszystkie te wagi są indywidualnie potrzebne.

Wgląd techniczny

Podstawową procedurą jest iteracyjne przycinanie wielkości z przewijaniem ciężarków: po treningu usuń odważniki o najniższej wielkości, zresetuj pozostałe odważniki do ich pierwotnej inicjalizacji (lub punktu kontrolnego na początku treningu, udoskonalenie zwane „przewijaniem”), a następnie przetrenuj ponownie. Kombinacja konkretnej maski rzadkiej ORAZ jej dopasowanej inicjalizacji sprawia, że ​​bilet „wygrywa” — losowa ponowna inicjalizacja tej samej maski niszczy efekt.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość hipotezy dotyczącej losów na loterię

Losy na loterię napędzają badania nad szkoleniem rzadkich sieci od samego początku w celu oszczędzania mocy obliczeniowej i energii, a także nad tym, czy bilety mogą być przesyłane między zbiorami danych i zadaniami. Skalowanie iteracyjnego przycinania do modeli miliardowych parametrów pozostaje kosztowne, dlatego trwają prace nad tanim znalezieniem losów lub udowodnieniem ich istnienia (hipoteza „silnego” losu na loterię mówi, że losy istnieją w momencie inicjalizacji, bez żadnego szkolenia). Spodziewaj się powiązań z wydajnymi modelami na urządzeniach i ekologiczną sztuczną inteligencją.

Implementacja w świecie rzeczywistym

Kompresja dużego klasyfikatora obrazu do poniżej 20% jego wag w celu wdrożenia na telefonie przy zachowaniu dokładności

Przyspieszenie uczenia poprzez identyfikację i uczenie tylko rzadkiej, zwycięskiej podsieci

Badanie możliwości przenoszenia ciężaru poprzez ponowne wykorzystanie biletu znalezionego w jednym zestawie danych w celu szybkiego rozpoczęcia treningu na pokrewnym

Zmniejszanie energii wnioskowania i pamięci w urządzeniach brzegowych poprzez wysyłkę przyciętego zwycięskiego biletu zamiast gęstego modelu

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokument, w którym hipoteza losu loteryjnego jest pomocna i gdzie lepsze są prostsze metody.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lottery Ticket Hypothesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szkolenie optymalne pod kątem obliczeń dla szynszyli

Często zadawane pytania

What is Lottery Ticket Hypothesis?

Hipoteza losu na loterię mówi, że wewnątrz dużej, losowo inicjowanej sieci neuronowej kryje się mała podsieć — „zwycięski los”, która wyszkolona samodzielnie na podstawie tych samych początkowych wag może dorównać dokładnością całej sieci. Ma to znaczenie, ponieważ sugeruje, że trenujemy znacznie więcej parametrów, niż faktycznie potrzebujemy.

Czym jest „zwycięski bilet” w tej hipotezie?

Zwycięski bilet to mała podsieć, która trenowana w izolacji od tych samych początkowych wag osiąga dokładność porównywalną z gęstą siecią.

Dlaczego szkolenie oczyszczonej podsieci zwykle kończy się niepowodzeniem, chyba że zrobisz coś specjalnego?

Kluczowym spostrzeżeniem jest to, że maska ​​rzadka działa tylko w połączeniu z dopasowaną oryginalną inicjalizacją; losowa ponowna inicjalizacja przerywa to.

Kto zaproponował hipotezę dotyczącą losu na loterię?

Jonathan Frankle i Michael Carbin przedstawili tę hipotezę w swoim artykule MIT z 2018 roku.

Jakiej techniki używa się do wyszukiwania zwycięskich biletów?

Iteracyjne przycinanie wielkości wielokrotnie trenuje, usuwa wagi o najmniejszej wielkości i przewija resztę do wartości początkowych.

Co sugeruje hipoteza na temat dużych, przeparametryzowanych sieci?

Odkrycie sugeruje, że nadparametryzacja pomaga w poszukiwaniu możliwej do wytrenowania rzadkiej podsieci, a nie konieczności stosowania każdej wagi.