RMSNorm és Pre-Layer Normalization
Az RMSNorm egy könnyű normalizálási réteg, amely átskálázza az aktiválásokat az átlagos négyzetek alapján, és a réteg előtti normalizálási helyeket, amelyek az egyes alrétegek elé lépnek, nem pedig utána.
Áttekintés
Together they make deep transformers train stably without warmup tricks.
Mély merülés
A Standard LayerNorm kivonja az átlagot és elosztja a szórással egy jellemzővektoron, majd alkalmazza a tanult skálát és eltolást. Az RMSNorm, amelyet Zhang és Sennrich 2019-ben vezetett be, teljesen elveti az átlagközpontosítást és a torzítást: egyszerűen elosztja az egyes vektorokat elemeinek négyzetes átlagával, és megszorozza a tanult jellemzőnkénti erősítéssel. Ez eltávolít egy statisztikát és több műveletet, ami nagyjából 10-50%-kal csökkenti a számítást a normál rétegben, miközben az illesztési pontosságot biztosítja. Külön-külön a „Pre-LN” elhelyezés (normál a figyelem/MLP előtt, körülötte tiszta maradék úttal) a gradiens nagyságát az inicializáláskor korlátozottan tartja, így az olyan modellek, mint a GPT-3, a LLaMA és a PaLM, tanulási sebességű bemelegítési hackek nélkül dolgoznak, amelyeket az eredeti Post-LN transzformátor igényel.
Technikai betekintés
Egy d dimenziójú x vektor esetén az RMSNorm kiszámítja az x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon), ahol g egy tanult erősítési vektor. Nincs átlagos kivonás és nincs torzítás. Mivel a pre-LN blokkban lévő maradék adatfolyam megkerüli a normalizálást, az identitásút érintetlen marad, és a gradiensek közvetlenül áramlanak a kimenetről a bemenetre, ezért a nagyon mély veremek konvergálnak.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
Az RMSNorm és a réteg előtti normalizálás jövője
Az RMSNorm most az alapértelmezett a legtöbb nyitott súlyú LLM-ben (LLaMA, Mistral, Qwen, Gemma), ezért számítson rá, hogy továbbra is szabványos marad. A kutatás finomítja a receptet: a QK-norm az RMSNorm-ot alkalmazza a figyelemfelhívásokra és a logit növekedés megfékezésére szolgáló kulcsokra, és egyes laboratóriumok kombinálják a normát megelőző és utáni („szendvics” vagy „peri-LN”) további stabilitást billió paraméteres léptékben. A hardveres kernelek folyamatosan összeolvasztják a műveletet a sebesség érdekében.
Valós megvalósítás
A LLaMA, a Mistral és a Qwen a LayerNorm-ot RMSNorm-ra cseréli, hogy minden tokennél csökkentse a következtetési késleltetést
A Pre-LN lehetővé teszi a GPT-stílusú modellek edzését a tanulási sebesség bemelegítés nélkül, amelyre a 2017-es Post-LN transzformátornak szüksége volt
A QK-normalizálás az RMSNorm-ot használja a figyelemfelhívásokhoz és kulcsokhoz, hogy megakadályozza a logitok felrobbanását a nagy modellekben
A mobil- és éltranszformátorok alkalmazzák az RMSNorm-ot, mivel az átlagos és a torzítás csökkentése csökkenti a memóriaforgalmat
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the RMSNorm and Pre-Layer Normalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Réteg normalizálása
Gyakran ismételt kérdések
What is RMSNorm and Pre-Layer Normalization?
Az RMSNorm egy könnyű normalizálási réteg, amely átskálázza az aktiválásokat az átlagos négyzetek alapján, és a réteg előtti normalizálási helyeket, amelyek az egyes alrétegek elé lépnek, nem pedig utána. Együtt bemelegítési trükkök nélkül stabilan edzenek a mélytranszformátorok.
Mit hagy ki az RMSNorm a szabványos LayerNormhoz képest?
Az RMSNorm kihagyja az átlag kiszámítását és kivonását, és csak az aktiválások négyzetes középértékével normalizál.
Milyen mennyiséggel osztja el az RMSNorm az egyes aktiválási vektorokat?
Az RMSNorm elosztja sqrt-vel a négyzetes elemek átlagát, azaz a négyzetgyököt, majd tanult erősítést alkalmaz.
Mi a réteg előtti normalizálás fő előnye a réteg utáni normalizáláshoz képest?
Ha a normát minden alréteg elé helyezzük tiszta maradék útvonallal, akkor behatároljuk a gradiens nagyságait, és szükségtelenné válik a tanulási sebesség bemelegítése.
Egy pre-LN blokkban milyen utat hagy szándékosan érintetlenül a normalizációs réteg?
A pre-LN normalizálja a bemenetet egy alrétegre, de a maradék parancsikon megkerüli azt, megőrizve a tiszta gradiens autópályát.
Mely modern, nyitott súlyú modellcsaládok használnak alapértelmezés szerint RMSNormot?
Az RMSNorm lett a standard normalizálás a LLaMA, a Mistral, a Qwen, a Gemma és a legújabb LLM-ekben.