技术指南

RMSNorm 和预层标准化

RMSNorm 是一个轻量级归一化层,它通过均方根重新调整激活值,并且预层归一化将该步骤放置在每个子层之前而不是之后。

阅读时间:2分钟最后更新

概述

Together they make deep transformers train stably without warmup tricks.

深入探讨

Standard LayerNorm 减去平均值并除以特征向量的标准差,然后应用学习到的缩放和偏移。张和 Sennrich 在 2019 年提出的 RMSNorm 完全放弃了均值中心化和偏差:它只是将每个向量除以其元素的均方根,然后乘以学习的每个特征增益。这消除了一项统计数据和多项操作,在标准层中将计算量减少了大约 10-50%,同时匹配了准确性。另外,“Pre-LN”放置(注意力/MLP 之前的范数,周围有干净的残差路径)在初始化时保持梯度幅度有界,因此像 GPT-3、LLaMA 和 PaLM 这样的模型在训练时无需进行原始 Post-LN 变压器所需的学习率预热黑客攻击。

技术洞察

对于维度 d 的向量 x,RMSNorm 计算 x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon),其中 g 是学习的增益向量。没有均值减法,也没有偏差。由于 Pre-LN 块中的残差流绕过了归一化,因此恒等路径保持不变,并且梯度直接从输出流向输入,这就是非常深的堆栈收敛的原因。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

RMSNorm 和预层标准化的未来

RMSNorm 现在是大多数开放权重 LLM(LLaMA、Mistral、Qwen、Gemma)的默认值,因此预计它会保持标准状态。研究正在完善配方:QK-norm 将 RMSNorm 应用于注意力查询和控制 logit 增长的关键,一些实验室将前范数和后范数(“三明治”或“peri-LN”)结合起来,以实现万亿参数规模的额外稳定性。硬件内核不断融合操作以提高速度。

现实世界的实施

LLaMA、Mistral 和 Qwen 均用 RMSNorm 替换 LayerNorm,以减少每个令牌的推理延迟

Pre-LN 允许 GPT 式模型进行训练,无需 2017 年 Post-LN 变压器所需的学习率预热

QK 标准化在注意力查询和键上使用 RMSNorm 来阻止大型模型中的 logits 爆炸

移动和边缘变压器采用 RMSNorm,因为降低均值和偏差会减少内存流量

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RMSNorm and Pre-Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is RMSNorm and Pre-Layer Normalization?

RMSNorm 是一个轻量级归一化层,它通过均方根重新调整激活值,并且预层归一化将该步骤放置在每个子层之前而不是之后。它们一起使深层变形金刚无需热身技巧即可稳定训练。

与标准 LayerNorm 相比,RMSNorm 省略了什么?

RMSNorm 跳过计算和减去均值,仅通过激活的均方根进行归一化。

RMSNorm 将每个激活向量除以什么数量?

RMSNorm 除以平方元素均值的 sqrt(即均方根),然后应用学习增益。

层前标准化相对于层后标准化的主要好处是什么?

将范数放置在具有干净残差路径的每个子层之前限制梯度幅度,从而消除了学习率预热的需要。

在 Pre-LN 块中,归一化层故意保持不变的路径是什么?

Pre-LN 将输入归一化到子层,但剩余捷径绕过它,保留了干净的梯度高速公路。

哪些现代开放权重模型系列默认使用 RMSNorm?

RMSNorm 成为 LLaMA、Mistral、Qwen、Gemma 和最近的法学硕士的标准标准化。