GHID de fundamente

Scăderea greutății și regularizarea L2

Scăderea greutății este o tehnică simplă și puternică care împinge greutățile unui model spre zero în timpul antrenamentului, descurajându-l să se bazeze prea mult pe orice caracteristică.

2 minute de lecturăUltima actualizare

Prezentare generală

It reduces overfitting and is one of the most widely used regularizers in deep learning.

Scufundare în profunzime

Când un model se antrenează, se poate fixa pe zgomotul din date prin creșterea greutăților mari, fin reglate, care se potrivesc perfect setului de antrenament, dar se generalizează slab. Regularizarea L2 combate acest lucru prin adăugarea unei penalități proporționale cu suma ponderilor pătrate la funcția de pierdere. Optimizatorul are acum două obiective: potrivirea datelor și menținerea greutăților mici, astfel încât să opteze pentru soluții mai simple și mai robuste. Scăderea greutății este ideea strâns legată de a micșora fiecare greutate cu o mică fracțiune la fiecare pas de actualizare. Cu o coborâre în gradient simplă, cele două sunt echivalente din punct de vedere matematic, dar cu optimizatori adaptivi precum Adam diferă, motiv pentru care AdamW a fost introdus pentru a decupla dezintegrarea de actualizarea bazată pe gradient și pentru a o face să se comporte corect.

Perspectivă tehnică

Regularizarea L2 adaugă lambda ori suma ponderilor pătrate la pierdere, astfel încât gradientul său adaugă un termen proporțional cu fiecare greutate, trăgând-o spre zero. Decăderea greutății decuplate în schimb înmulțește fiecare greutate cu un factor de genul (1 minus learning_rate ori lambda) direct. În metodele adaptive, cuplarea L2 la pierdere permite scalarea pe parametru să distorsioneze penalizarea, astfel că AdamW aplică contracția separat, restabilind tracțiunea uniformă dorită către greutăți mai mici.

Impact strategic

Decizii mai clare

Vă ajută să separați afirmațiile tehnice clare de limbajul de marketing.

Cost și buget

Puteți pune întrebări de implementare mai bune înainte de a cheltui bani sau timp.

Echipa și fluxul de lucru

Echipele cu înțelegere comună iau decizii mai bune despre produse, politici și învățare.

Viitorul scăderii greutății și regularizării L2

Scăderea greutății rămâne un ingredient implicit în rețetele de antrenament pentru modele mari de limbaj și transformatoare de viziune, iar AdamW este acum optimizatorul standard pentru acestea. Cercetările continuă asupra modului în care dezintegrarea interacționează cu programele ratei de învățare, straturile de normalizare și scara modelului, deoarece puterea sa efectivă se schimbă pe măsură ce modelele cresc. Așteptați-vă la o reglare mai bazată pe principii, posibil pe strat sau în funcție de program, pe măsură ce căutarea automată a hiperparametrilor și studiile de lege de scalare se maturizează.

Implementare în lumea reală

Adăugarea de weight_decay în optimizatorul AdamW sau SGD de la PyTorch atunci când antrenați clasificatorii de imagini pentru a reduce supraadaptarea

Reglarea coeficientului lambda în regresia crestei, modelul liniar clasic penalizat cu L2, pentru a stabiliza predicțiile privind caracteristicile corelate

Rețete mari de pre-antrenare cu model de limbaj care stabilesc o scădere mică a greutății (adesea în jurul valorii de 0,1) alături de un program al ratei de învățare

Combinând scăderea greutății cu creșterea datelor și abandonul pentru a împiedica un model mic de imagistică medicală să memoreze scanări limitate de antrenament

Riscuri și balustrade

Echipe diferite pot folosi același termen în mod diferit, așa că definiți domeniul de aplicare din timp.

Benchmark-urile pot părea puternice, în timp ce performanța în lumea reală este neuniformă.

Ignorarea calității datelor și a planurilor de evaluare generează adesea rezultate fragile.

Foaia de parcurs de implementare

1

Începeți cu o definiție simplă a rezultatului de care aveți nevoie.

2

Alegeți o măsură de succes și o condiție de eșec înainte de testare.

3

Rulați un pilot mic cu date reprezentative, nu un set demonstrativ bine definit.

4

Documentați unde vă ajută Weight Decay și L2 Regularization și unde metodele mai simple sunt mai bune.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Întrebări frecvente

What is Weight Decay and L2 Regularization?

Scăderea greutății este o tehnică simplă și puternică care împinge greutățile unui model spre zero în timpul antrenamentului, descurajându-l să se bazeze prea mult pe orice caracteristică. Reduce supraadaptarea și este unul dintre cei mai folosiți regulatori în deep learning.

Ce adaugă regularizarea L2 la funcția de pierdere?

Regularizarea L2 adaugă lambda ori suma greutăților pătrate, penalizând greutățile mari și încurajând soluții mai mici și mai fine.

Care este principala problemă pe care o ajută la prevenirea scăderii în greutate?

Prin menținerea greutăților mici, scăderea greutății descurajează modelul să se potrivească cu zgomotul, îmbunătățind generalizarea la date noi.

În ce direcție scăderea greutății împinge greutățile modelului?

Decăderea greutății micșorează greutățile spre zero la fiecare actualizare, motiv pentru care uneori este descrisă ca „descăderea” greutăților.

De ce a fost introdus AdamW?

În Adam, plierea L2 în pierdere interacționează prost cu scalarea pe parametru; AdamW aplică degradarea separat pentru a restabili contracția uniformă dorită.

Pentru o coborâre simplă a gradientului stocastic, cum se leagă regularizarea L2 și scăderea greutății?

Cu SGD simplu, adăugarea unei penalități L2 la pierdere produce aceeași actualizare ca și ponderile care se micșorează direct, astfel încât cele două sunt echivalente.