技術指南

RMSNorm 和預層標準化

RMSNorm 是一個輕量級歸一化層,它透過均方根重新調整活化值,並且預層歸一化將該步驟放置在每個子層之前而不是之後。

閱讀時間約2分鐘最後更新

概述

Together they make deep transformers train stably without warmup tricks.

深入探討

Standard LayerNorm 減去平均值並除以特徵向量的標準差,然後應用學習到的縮放和移位。張和 Sennrich 在 2019 年提出的 RMSNorm 完全放棄了均值中心化和偏差:它只是將每個向量除以其元素的均方根,然後乘以學習的每個特徵增益。這消除了一項統計數據和多項操作,在標準層中將計算量減少了大約 10-50%,同時匹配了準確性。另外,「Pre-LN」放置(注意力/MLP 之前的範數,周圍有乾淨的殘差路徑)在初始化時保持梯度幅度有界,因此像 GPT-3、LLaMA 和 PaLM 這樣的模型在訓練時無需進行原始 Post-LN 變壓器所需的學習率預熱駭客攻擊。

技術洞察

對於維度 d 的向量 x,RMSNorm 計算 x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon),其中 g 是學習的增益向量。沒有均值減法,也沒有偏差。由於 Pre-LN 區塊中的殘差流繞過了歸一化,因此恆等路徑保持不變,並且梯度直接從輸出流向輸入,這就是非常深的堆疊收斂的原因。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

RMSNorm 與預層標準化的未來

RMSNorm 現在是大多數開放權重 LLM(LLaMA、Mistral、Qwen、Gemma)的預設值,因此預計它會保持標準狀態。研究正在完善配方:QK-norm 將 RMSNorm 應用於注意力查詢和控制 logit 成長的關鍵,一些實驗室將前範數和後範數(「三明治」或「peri-LN」)結合起來,以實現萬億參數規模的額外穩定性。硬體核心不斷融合操作以提高速度。

現實世界的實施

LLaMA、Mistral 和 Qwen 均以 RMSNorm 取代 LayerNorm,以減少每個令牌的推理延遲

Pre-LN 允許 GPT 式模型進行訓練,無需 2017 年 Post-LN 變壓器所需的學習率預熱

QK 標準化在註意力查詢和鍵上使用 RMSNorm 來阻止大型模型中的 logits 爆炸

行動和邊緣變壓器採用 RMSNorm,因為降低平均值和偏差會減少記憶體流量

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RMSNorm and Pre-Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is RMSNorm and Pre-Layer Normalization?

RMSNorm 是一個輕量級歸一化層,它透過均方根重新調整活化值,並且預層歸一化將該步驟放置在每個子層之前而不是之後。它們一起使深層變形金剛無需熱身技巧即可穩定訓練。

與標準 LayerNorm 相比,RMSNorm 省略了什麼?

RMSNorm 跳過計算和減去平均值,僅透過活化的均方根進行歸一化。

RMSNorm 將每個激活向量除以什麼數量?

RMSNorm 除以平方元素平均值的 sqrt(即均方根),然後套用學習增益。

層前標準化相對於層後標準化的主要好處是什麼?

將範數放置在具有乾淨殘差路徑的每個子層之前限制梯度幅度,從而消除了學習率預熱的需要。

在 Pre-LN 區塊中,歸一化層故意保持不變的路徑是什麼?

Pre-LN 將輸入歸一化到子層,但剩餘捷徑繞過它,保留了乾淨的梯度高速公路。

哪些現代開放權重模型系列預設使用 RMSNorm?

RMSNorm 成為 LLaMA、Mistral、Qwen、Gemma 和最近的法學碩士的標準標準化。