Műszaki ÚTMUTATÓ

Adam és az adaptív optimalizálók

Adam a legtöbb modern neurális hálózat mögött álló igásló optimalizáló, amely minden paraméterhez automatikusan külön tanulási sebességet hangol.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it makes training deep models faster and far less finicky than plain gradient descent.

Mély merülés

Adam (Adaptive Moment Estimation), amelyet Kingma és Ba 2014-ben mutatott be, két ötletet ötvöz. Először is a lendület: megtartja a múltbeli gradiensek exponenciálisan csökkenő átlagát (az első pillanatban), így a frissítések konzisztens irányban építik fel a sebességet. Másodszor, paraméterenkénti skálázás: nyomon követi a négyzetes gradiensek átlagát (a második pillanat), és minden lépést eloszt az érték négyzetgyökével, így a nagy, zajos gradiensekkel rendelkező paraméterek kisebb, a ritkán frissített paraméterek pedig nagyobb lépéseket tesznek. Ez az alkalmazkodóképesség azt jelenti, hogy gyakran használhat egy tanulási sebességet az egész hálózaton. Egy változat, az AdamW, leválasztja a súlycsökkenést a gradiens-frissítésről, és ez lett az alapértelmezett a nagy transzformátorok és nyelvi modellek betanításában.

Technikai betekintés

Adam paraméterenként két futóátlagot tart fenn: m (gradiens) és v (négyzetes gradiens), frissítve a béta1 (általában 0,9) és a béta2 (általában 0,999) csillapítási arányokkal. Mivel mindkettő nulláról kezdődik, a torzítás korrigálása (1 - béta^t) való osztással történik. A frissítés a theta = theta - lr * m_hat / (sqrt(v_hat) + epsilon), ahol az epsilon (körülbelül 1e-8) megakadályozza a nullával való osztást. Ez az oka annak, hogy Adamnek kevés tanulási sebességű hangolásra van szüksége a sima SGD-hez képest.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

Adam és az adaptív optimalizálók jövője

Adam és AdamW továbbra is domináns, de a kutatások a trillió paraméteres modellek hatékonyságát növelik, ahol súlyonként két plusz érték tárolása költséges. A memóriakönnyű változatok, mint például az Adafactor, a 8 bites Adam, és az újabb optimalizálók, mint például a Lion (amely csak jelalapú lendületet használ) és a Sophia célja, hogy Adam minőségét kevesebb memóriával vagy gyorsabb konvergenciával párosítsa. A kifejezetten elosztott, kis pontosságú képzéshez hangolt adaptív optimalizálók folyamatosan fejlődnek.

Valós megvalósítás

Olyan nagy nyelvi modellek betanítása, mint a GPT és a Llama, amelyek az AdamW-t szabványos optimalizálóként használják.

Egy előre betanított képosztályozó (pl. ResNet) finomhangolása egyéni adatkészleten, csak az alapértelmezett Adam tanulási sebességgel.

Képgenerátorok, például a Stable Diffusion mögötti diffúziós modellek betanítása.

A 8 bites Adam futtatása olyan könyvtárakban, mint a bitsandbyte, hogy az optimalizáló állapotait a korlátozott GPU memóriába illessze.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Adam and Adaptive Optimizers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

ZeRO és Sharded Optimizers

Gyakran ismételt kérdések

What is Adam and Adaptive Optimizers?

Adam a legtöbb modern neurális hálózat mögött álló igásló optimalizáló, amely minden paraméterhez automatikusan külön tanulási sebességet hangol. Ez azért fontos, mert gyorsabbá és kevésbé bonyolulttá teszi a mély modellek képzését, mint a sima gradiens süllyedés.

Milyen két mennyiséget követ Ádám minden paraméterhez?

Adam minden paraméterre megtartja a gradiensek (első pillanat) és a gradiens négyzetes (második pillanat) exponenciálisan csökkenő átlagát.

Miért alkalmaz Adam torzításkorrekciót a pillanatbecsléseinél?

Az m és a v is nullára van inicializálva, így a korai becslések torzítása alacsony; az (1 - béta^t)-vel való osztás kijavítja ezt.

Mi a fő különbség Adam és AdamW között?

Az AdamW a súlycsökkentést közvetlenül a súlyokra alkalmazza, ahelyett, hogy az adaptív gradiens tagba keverné, ami javítja a transzformátorok általánosítását.

Milyen szerepet játszik a kis epszilon kifejezés Ádám frissítési szabályában?

Epszilon (körülbelül 1e-8) hozzáadódik a nevezőhöz, hogy a nullához közeli négyzetes gradiens átlagú paraméterek ne okozzanak robbanást.

Miért nevezik Ádámot gyakran „adaptívnak”?

Adam az egyes paraméterek gradiens-átlagának négyzetgyökével osztva a lépések méretét paraméterenként skálázza ahelyett, hogy egyetlen globális értéket használna.