Alapok ÚTMUTATÓ

Súlycsökkenés és L2-szabályozás

A súlycsökkentés egy egyszerű, hatékony technika, amely a modell súlyát nulla felé tolja edzés közben, és elriasztja attól, hogy túlságosan támaszkodjon egyetlen jellemzőre.

2 perc olvasásUtoljára frissítve

Áttekintés

It reduces overfitting and is one of the most widely used regularizers in deep learning.

Mély merülés

Amikor egy modell edz, akkor képes az adatokban lévő zajra azáltal, hogy nagy, finoman hangolt súlyokat növeszt, amelyek tökéletesen illeszkednek az edzéskészlethez, de rosszul általánosítanak. Az L2 regularizáció ezt úgy küzdi le, hogy a veszteségfüggvényhez a súlyok négyzetének összegével arányos büntetést ad. Az optimalizálónak most két célja van: az adatok illeszkedése és a súlyok kicsiben tartása, így simább, robusztusabb megoldások mellett dönt. A súlycsökkentés az a szorosan összefüggő ötlet, hogy minden egyes súlyt egy kis töredékével csökkentsünk minden frissítési lépésnél. A sima gradiens süllyedés esetén a kettő matematikailag egyenértékű, de az adaptív optimalizálóknál, mint például az Adam, különböznek egymástól, ezért mutatták be az AdamW-t, hogy leválasztja a csökkenést a gradiens alapú frissítésről, és helyesen viselkedjen.

Technikai betekintés

Az L2 regularizáció a súlyok négyzetösszegének lambda-szorosát adja a veszteséghez, így a gradiense minden súlyhoz arányos tagot ad, és nulla felé húzza azt. A függetlenített súlycsökkenés ehelyett minden súlyt közvetlenül megszoroz egy tényezővel, például (1 mínusz tanulási sebesség szorozva lambda). Az adaptív módszerekben az L2 veszteséghez való csatolása lehetővé teszi, hogy a paraméterenkénti skálázás torzítsa a büntetést, így AdamW külön alkalmazza a zsugorodást, visszaállítva a kisebb súlyok felé tervezett egyenletes húzást.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A súlycsökkenés és az L2-szabályozás jövője

A súlycsökkenés továbbra is a nagy nyelvi modellek és látástranszformátorok képzési receptjeinek alapértelmezett összetevője, és az AdamW mostantól a szabványos optimalizáló ezekhez. Folytatódik a kutatás arra vonatkozóan, hogy a hanyatlás miként lép kölcsönhatásba a tanulási ütem ütemezésével, a normalizálási rétegekkel és a modellskálával, mivel a hatékony ereje a modellek növekedésével változik. Elvibb, esetleg rétegenkénti vagy ütemterv-tudatos csillapítási hangolásra számíthat, ahogy az automatizált hiperparaméter-keresés és a skálázási törvényi tanulmányok érnek.

Valós megvalósítás

A weight_decay hozzáadása a PyTorch AdamW vagy SGD optimalizálójában a képosztályozók képzésekor a túlillesztés megfékezése érdekében

A lambda-együttható hangolása a gerinc regresszióban, a klasszikus L2-vel büntetett lineáris modellben, hogy stabilizálja a korrelált jellemzőkre vonatkozó előrejelzéseket

Nagy nyelvi modell előképzési receptek, amelyek kis súlycsökkenést (gyakran 0,1 körül) határoznak meg a tanulási ütem ütemezése mellett

A súlycsökkenés kombinálása az adatok növekedésével és a lemorzsolódással, hogy egy kis orvosi képalkotó modell ne memorizálja a korlátozott edzési szkenneléseket

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, hol segít a súlycsökkenés és az L2-szabályozás, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Weight Decay and L2 Regularization?

A súlycsökkentés egy egyszerű, hatékony technika, amely a modell súlyát nulla felé tolja edzés közben, és elriasztja attól, hogy túlságosan támaszkodjon egyetlen jellemzőre. Csökkenti a túlillesztést, és az egyik legszélesebb körben használt rendszeresítő a mély tanulásban.

Mit ad hozzá a veszteségfüggvényhez az L2 regularizáció?

Az L2 szabályosítás a lambda-szorosát adja a súlyok négyzetének összegének, büntetve a nagy súlyokat, és kisebb, simább megoldásokat ösztönöz.

Mi az a fő probléma, amelyet a súlycsökkenés segít megelőzni?

A súlyok kicsiben tartásával a súlycsökkenés eltántorítja a modellt a zaj illesztésétől, és javítja az új adatok általánosítását.

Milyen irányba tolja a súlycsökkenés a modell súlyát?

A súlycsökkenés minden frissítéskor nullára zsugorítja a súlyokat, ezért néha a súlyok „csökkentésének” nevezik.

Miért mutatták be az AdamW-t?

Adamben az L2 veszteségbe hajtása rossz kölcsönhatásban van a paraméterenkénti skálázással; Az AdamW külön alkalmazza a csillapítást a tervezett egyenletes zsugorodás helyreállítása érdekében.

Sima sztochasztikus gradiens süllyedés esetén hogyan függ össze az L2 regularizáció és a súlycsökkenés?

A sima SGD esetén egy L2 büntetés hozzáadásával a veszteség ugyanazt a frissítést eredményezi, mint a közvetlenül zsugorító súlyok, tehát a kettő egyenértékű.