梯度下降
梯度下降是一种优化方法,实际上将模型的权重向下移动以降低误差,一次一小步。
概述
It is how learning happens once backpropagation has computed the gradients.
深入探讨
想象一下,站在有雾的山坡上,试图到达谷底,但只感觉到脚下的斜坡。梯度下降正是针对模型的误差景观做到了这一点。梯度点位于损失增加最陡的方向,因此算法沿相反方向步进以减少误差。每个步骤的大小由学习率控制,学习率是一个关键的超参数:太大,模型会超调和发散,太小,训练会缓慢进行。在实践中,模型很少在每个步骤中使用完整的数据集。随机梯度下降 (SGD) 和小批量变体根据小随机样本估计梯度,从而加快训练速度并帮助模型摆脱损失表面中的浅层陷阱。
技术洞察
每次更新都遵循一个简单的规则:新权重等于旧权重减去学习率乘以梯度。小批量梯度下降在一小部分数据而不是整个数据集上计算梯度,以精确的精度换取速度和有用的噪声。像 Adam 这样的现代优化器在此基础上通过调整每个参数的有效学习率并添加动量来积累过去的梯度以平滑振荡并加速通过损失景观的平坦或峡谷形状区域的进展。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
梯度下降的未来
如今,普通梯度下降很少单独使用;像 Adam 和 AdamW 这样的自适应优化器在大规模训练中占据主导地位。关于学习率计划、预热策略和使用曲率信息实现更快收敛的二阶方法的研究仍在继续。随着模型的增长,跨数千个 GPU 的分布式和分片梯度下降变得至关重要,而稳定这些大规模更新的技术是一个活跃的前沿领域。遵循负梯度的核心思想将持续存在,但围绕步长大小的机制不断发展。
现实世界的实施
使用小批量更新降低语言模型在数十亿个训练令牌中的预测误差
调整学习率,使图像模型快速收敛,而不会导致损失爆炸
利用动量加速陷入狭长损失谷的语音识别网络的训练
应用 Adam 在小数据集上微调模型,其中每个参数的学习率有助于稳定性
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录梯度下降在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Gradient Descent quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Gradient Descent?
梯度下降是一种优化方法,实际上将模型的权重向下移动以降低误差,一次一小步。一旦反向传播计算出梯度,学习就是这样发生的。
梯度下降使权重朝哪个方向移动?
梯度指向损失最急剧的增加,因此为了减少损失,算法朝相反(负)方向前进。
学习率控制什么?
学习率衡量每次更新时权重移动的距离;太大的超调,太小的训练会变得非常缓慢。
随机或小批量梯度下降与使用完整数据集有何不同?
小批量和随机梯度下降使用小样本来近似梯度,这可以加快训练速度并增加有用的噪声。
学习率太大会导致什么问题?
大的步骤可能会跳过最小值并反弹或爆炸,导致损失增加而不是稳定。
动量对梯度下降有何影响?
动量承载着过去梯度的运行平均值,帮助优化器更快地穿过峡谷并抑制振荡。