層歸一化
層歸一化透過重新調整每個範例中的活化來穩定訓練,使它們具有零均值和單位方差。
概述
It is a quiet but essential ingredient that makes deep transformers trainable.
深入探討
Ba、Kiros 和 Hinton 於 2016 年提出,層歸一化 (LayerNorm) 解決了當訊號穿過多個層時,深層網路內部的活化可能會漂移到截然不同的規模,從而減慢或不穩定學習的問題。與批量歸一化不同的是,批量歸一化對小批量中範例的每個特徵進行歸一化,而 LayerNorm 則對單一範例的特徵進行歸一化。這使得它獨立於批量大小,並且同樣可用於訓練和推理,並且它可以自然地與可變長度序列一起工作,這就是為什麼它成為支援現代語言模型的變壓器的標準。標準化後,它應用可學習的尺度(gamma)和移位(beta),以便網路可以恢復它需要的任何表示。
技術洞察
對於特徵向量 x,LayerNorm 計算該向量元素的平均值和方差,然後輸出 gamma * (x - 平均值) / sqrt(variance + epsilon) + beta。由於統計數據來自單一樣本,因此無論批次有 1 個樣本還是 1000 個樣本,行為都是相同的。一個更簡單的變體 RMSNorm 跳過均值減法,僅除以均方根,從而節省了計算量;它用於 Llama 等模型。放置也很重要:「前規範」(在每個子層之前規範化)使深層變壓器比「後規範」更容易訓練。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
層標準化的未來
正在簡化標準化以提高規模效率。在較新的大型語言模型中,RMSNorm 已在很大程度上取代了 LayerNorm,因為它更便宜且效果同樣好,並且預規範放置現在是非常深的堆疊的預設。研究人員繼續探索無歸一化的架構,而是使用仔細的初始化或縮放技巧,旨在減少開銷,同時保持歸一化提供的訓練穩定性。
現實世界的實施
穩定 GPT 和 BERT 等語言模型中的每個轉換器區塊。
啟用 RMSNorm 作為 Llama 系列車型中較輕的標準化選擇。
對批量大小不同的語音和翻譯模型中的可變長度序列資料進行標準化。
允許批量大小為 1 的可靠訓練,例如在某些強化學習設定中。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Layer Normalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Layer Normalization?
層歸一化透過重新調整每個範例中的活化來穩定訓練,使它們具有零均值和單位方差。它是一種安靜但必不可少的成分,可以使深度變形金剛變得可訓練。
層歸一化透過什麼計算其平均值和變異數?
LayerNorm 對單一樣本的特徵維度進行歸一化,使其獨立於批次中的其他樣本。
為什麼在 Transformer 中層歸一化優於批量歸一化?
由於其統計資料來自單一範例,因此無論批次大小如何,LayerNorm 都會表現一致,並且適合可變長度的文字序列。
可學習參數 gamma 和 beta 讓 LayerNorm 做什麼?
歸一化至零均值和單位變異數後,伽瑪尺度和貝塔會改變結果,因此模型不會被迫進入固定分佈。
RMSNorm 與標準 LayerNorm 有何不同?
RMSNorm 省略了均值中心化步驟,並透過活化的均方根進行縮放,這更便宜並且在 Llama 等模型中使用。
層歸一化主要幫助解決深度網路中的什麼問題?
當訊號穿過多層時,它們的規模可能會放大或縮小。歸一化使活化保持在穩定的範圍內,因此梯度表現良好。