Parẹ ati Bugbamu Gradients
Nigbati ikẹkọ awọn nẹtiwọọki ti o jinlẹ, awọn ifihan agbara aṣiṣe dinku si odo tabi fẹ soke si ailopin bi wọn ṣe rin irin-ajo sẹhin nipasẹ ọpọlọpọ awọn ipele.
Akopọ
This makes deep and recurrent models painfully slow or impossible to train without specific fixes.
Jin Dive
Awọn nẹtiwọọki nkankikan kọ ẹkọ nipasẹ isọdọtun, eyiti o ṣe isodipupo ipele gradients nipasẹ Layer ni lilo ofin pq. Nigbati o ba ṣe akopọ ọpọlọpọ awọn fẹlẹfẹlẹ, awọn ifosiwewe fun-Layer wọnyẹn ni isodipupo papọ. Ti ifosiwewe kọọkan ba kere ju 1 lọ, ọja naa dinku ni iwọn ati pe awọn ipele ti o tete ni imudojuiwọn - iṣoro gradient ti o ti sọnu. Ti ifosiwewe kọọkan ba tobi ju 1 lọ, ọja naa gbamu, ti n ṣe awọn imudojuiwọn aiduro nla tabi awọn iye NaN. Awọn iṣẹ ṣiṣe saturating bii sigmoid ati tanh, eyiti awọn itọsẹ wọn ga julọ ni 0.25 ati 1, jẹ awọn ẹlẹṣẹ Ayebaye. Ọrọ naa nira julọ ni awọn netiwọki ifunni jinlẹ ati ni awọn nẹtiwọọki loorekoore (RNNs) sisẹ awọn ilana gigun, nibiti a ti tun matrix iwuwo kanna ni gbogbo igba, ti o npọ ipa naa ni iyalẹnu.
Imọ-imọ-ẹrọ
Ni ẹhin ẹhin, gradient ni ipele kutukutu jẹ ọja ti ọpọlọpọ awọn ọrọ Jakobu ati iwuwo. Ni aijọju, awọn irẹjẹ ifihan agbara bii ifosiwewe-Layer ti o dide si ijinle. Awọn iye labẹ ibajẹ 1 si odo; iye lori 1 dagba lai dè. Fun ohun RNN unrolled lori T awọn igbesẹ ti, awọn ti ako oro huwa bi awọn loorekoore àdánù ti o tobi eigenvalue si agbara T, ki ani kekere iyapa lati 1 nu tabi gbamu lori gun lesese.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Asannu ati Bugbamu Gradients
Awọn iyokuro pataki - awọn asopọ ti o ku (foo), isọdi deede, gating, ati ibẹrẹ iṣọra - jẹ boṣewa ni bayi, nitorinaa awọn gradients ti o sọnu ṣọwọn ṣe idiwọ ikẹkọ ti awọn faaji ode oni. Awọn Ayirapada da ọna idapọ loorekoore ni igbọkanle nipa lilo akiyesi lori ọkọọkan dipo atunwi atunwi ti matrix kan. Iwadi tẹsiwaju lori awọn nẹtiwọọki ikẹkọ ẹgbẹẹgbẹrun awọn ipele ti o jinlẹ, lori awọn awoṣe ipo-iduro gigun pupọ, ati lori awọn irinṣẹ imọ-jinlẹ bii ekuro tangent nkankikan ti o sọ asọtẹlẹ itankale ifihan ṣaaju igbesẹ ikẹkọ kan ṣoṣo.
Real-World imuse
Awọn awoṣe ede RNN ni kutukutu tiraka lati so awọn ọrọ pọ si awọn gbolohun ọrọ gigun nitori awọn gradients ti sọnu ni ọpọlọpọ awọn igba, iwuri LSTMs ati awọn GRUs.
ResNet ṣiṣẹ ikẹkọ ti awọn kilasika aworan Layer 100+ nipa fifi awọn asopọ fofo kun ti o fun awọn gradients ni taara, ọna ti ko ni ilọpo pada sẹhin.
Olùgbéejáde kan rii ipadanu ikẹkọ lojiji di NaN - ami asọye ti awọn gradients exploding - ati ṣafikun gige gradient lati mu duro.
Awọn irinṣẹ ibojuwo ni PyTorch tabi Idite TensorFlow fun awọn iwuwasi gradient-Layer ki awọn onimọ-ẹrọ le rii ipele kan ti awọn gradients rẹ ti ṣubu si isunmọ odo.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vanishing and Exploding Gradients quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Ṣiṣayẹwo Gradient
Awọn ibeere ti a beere nigbagbogbo
What is Vanishing and Exploding Gradients?
Nigbati ikẹkọ awọn nẹtiwọọki ti o jinlẹ, awọn ifihan agbara aṣiṣe dinku si odo tabi fẹ soke si ailopin bi wọn ṣe rin irin-ajo sẹhin nipasẹ ọpọlọpọ awọn ipele. Eyi jẹ ki awọn awoṣe ti o jinlẹ ati loorekoore ni irora lọra tabi ko ṣee ṣe lati ṣe ikẹkọ laisi awọn atunṣe kan pato.
Iṣiṣẹ mathematiki wo ni isọdọtun jẹ idi gbòǹgbò ti sisọnu ati bugbamu gradients?
Backpropagation kan awọn pq ofin, isodipupo ọpọlọpọ fun-Layer ifosiwewe jọ; awọn ọja ti iye labẹ 1 asonu ati awọn ọja lori 1 gbamu.
Kini idi ti awọn iṣẹ ṣiṣe sigmoid ati tanh ṣe pataki si awọn gradients ti sọnu?
Awọn oke itọsẹ Sigmoid ni 0.25 ati tanh ni 1; ni awọn agbegbe ti o kun fun awọn mejeeji sunmọ odo, nitorinaa tito wọn ṣe awakọ awọn gradients si odo.
Iru faaji wo ni o ni ipa pupọ julọ nipasẹ awọn iṣoro gradient lori awọn ilana gigun?
RNN kan tun kan matrix iwuwo loorekoore kanna ni gbogbo igba, nitorinaa ni ọkọọkan gigun awọn ipa agbo bi eigenvalue matrix yẹn ti o dide si ipari ọkọọkan.
Ri ipadanu ikẹkọ lojiji yipada si NaN ṣe afihan iṣoro wo?
Exploding gradients gbe awọn tobi pupo awọn imudojuiwọn ti o àkúnwọsílẹ si infinity tabi NaN; afẹnuka gradients dipo fa pipadanu lati da duro.
Bawo ni awọn asopọ ti o ku (foo) ṣe ṣe iranlọwọ pẹlu sisọnu gradients?
Rekọja awọn isopọ ṣafikun ọna idanimọ kan ki awọn gradients le ṣàn sẹhin laisi jijẹ leralera nipasẹ awọn ipele agbedemeji.