GHID de fundamente

Abandonul și regularizarea stocastică

Abandonul este un truc de regularizare care oprește aleatoriu o fracțiune de neuroni în timpul fiecărei etape de antrenament, forțând rețeaua să construiască reprezentări redundante și robuste.

2 minute de lecturăUltima actualizare

Prezentare generală

It became one of the most influential techniques for fighting overfitting in deep learning.

Scufundare în profunzime

Introdusă de grupul lui Hinton în jurul anului 2012, abandonul abordează o slăbiciune cheie a rețelelor mari: neuronii se pot co-adapta, învățând să repare greșelile reciproc în moduri care funcționează doar pe datele de antrenament. La fiecare trecere înainte în timpul antrenamentului, abandonul setează aleatoriu ieșirea fiecărui neuron la zero cu o anumită probabilitate p (adesea 0,5 în straturi dense). Deoarece orice neuron ar putea dispărea, rețeaua nu se poate baza pe parteneriate fragile și trebuie să răspândească informații utile în mai multe unități. Acest lucru acționează ca antrenamentul unui ansamblu imens de rețele subțiate care împart greutăți. În timpul testului, abandonul este dezactivat și se utilizează întreaga rețea, cu activări scalate astfel încât rezultatul așteptat să se potrivească antrenamentului. Rezultatul este de obicei o generalizare mai bună cu prețul unui antrenament puțin mai lung.

Perspectivă tehnică

În timpul antrenamentului, fiecare unitate este păstrată cu probabilitate (1 minus p) printr-o mască binară aleatorie, astfel încât diferite subrețele sunt eșantionate în fiecare lot. Cadrele moderne folosesc abandon inversat: activările supraviețuitoare sunt împărțite la (1 minus p) în timpul trenului, deci nu este necesară scalarea la inferență. Această aleatorie injectează zgomot care descurajează coadaptarea și aproximează media pentru un număr exponențial de subrețele cu greutate partajată, o formă ieftină de asamblare.

Impact strategic

Decizii mai clare

Vă ajută să separați afirmațiile tehnice clare de limbajul de marketing.

Cost și buget

Puteți pune întrebări de implementare mai bune înainte de a cheltui bani sau timp.

Echipa și fluxul de lucru

Echipele cu înțelegere comună iau decizii mai bune despre produse, politici și învățare.

Viitorul abandonului școlar și al regularizării stocastice

În rețelele de viziune convoluțională, normalizarea loturilor a înlocuit în mare măsură abandonul standard, dar variantele prosperă în alte părți: transformatoarele aplică o abandonare asupra straturilor de atenție și feed-forward, iar DropPath (adâncimea stocastică) scade blocuri reziduale întregi. Abandonul Monte Carlo, care menține abandonul activ la inferență, este utilizat pentru a estima incertitudinea modelului. Așteptați-vă ca regularizarea stocastică să rămână un set de instrumente flexibil, adaptat pe arhitectură, mai degrabă decât o singură rețetă fixă.

Implementare în lumea reală

Adăugarea unui strat Dropout cu p în jur de 0,5 între straturile dense ale unui clasificator de imagine sau text în PyTorch sau Keras

Modele de transformatoare care aplică o renunțare la greutăți de atenție și activări anticipate în timpul antrenamentului preliminar

Abandonul Monte Carlo, unde abandonul rămâne la inferență pentru a produce estimări de incertitudine pentru predicții medicale sau critice pentru siguranță

Adâncimea stocastică (DropPath) omite aleatoriu blocurile reziduale pentru a regulariza rețelele foarte adânci, cum ar fi ResNets și transformatoare de viziune

Riscuri și balustrade

Echipe diferite pot folosi același termen în mod diferit, așa că definiți domeniul de aplicare din timp.

Benchmark-urile pot părea puternice, în timp ce performanța în lumea reală este neuniformă.

Ignorarea calității datelor și a planurilor de evaluare generează adesea rezultate fragile.

Foaia de parcurs de implementare

1

Începeți cu o definiție simplă a rezultatului de care aveți nevoie.

2

Alegeți o măsură de succes și o condiție de eșec înainte de testare.

3

Rulați un pilot mic cu date reprezentative, nu un set demonstrativ bine definit.

4

Documentul în care abandonul și regularizarea stochastică ajută și unde metodele mai simple sunt mai bune.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Coborâre cu gradient stocastic cu impuls

Întrebări frecvente

What is Dropout and Stochastic Regularization?

Abandonul este un truc de regularizare care oprește aleatoriu o fracțiune de neuroni în timpul fiecărei etape de antrenament, forțând rețeaua să construiască reprezentări redundante și robuste. A devenit una dintre cele mai influente tehnici de combatere a supraadaptarii în învățarea profundă.

Ce face abandonul în timpul antrenamentului?

Abandonul pune la zero în mod aleatoriu fiecare neuron cu probabilitatea p în timpul antrenamentului, astfel încât la fiecare pas este utilizată o subrețea subțire diferită.

De ce abandonul îmbunătățește generalizarea?

Prin eliminarea aleatorie a unităților, abandonul îi împiedică pe neuroni să formeze parteneriate fragile care funcționează doar pe datele de antrenament, îmbunătățind robustețea.

Ce se întâmplă cu abandonul la momentul testării (inferenței)?

La deducere, întreaga rețea rulează cu abandonul dezactivat, iar activările sunt scalate astfel încât rezultatele așteptate să se potrivească cu distribuția de antrenament.

O rată de abandon de p = 0,5 într-un strat înseamnă aproximativ ce înseamnă în timpul antrenamentului?

Cu p = 0,5 fiecare neuron are o șansă de 50 la sută de a fi pus la zero, deci, în medie, aproximativ jumătate sunt aruncate pe trecere înainte.

Ce este adesea descris ca fiind aproximativ abandonul?

Eșantionarea unei subrețele diferite la fiecare pas aproximează media pe un număr exponențial de rețele cu greutate partajată, o formă de asamblare ieftină.