基础知识指南

神经网络的缩放定律

缩放定律是经验公式,表明随着模型大小、数据集大小和计算的增加,神经网络的损失可预测地下降。

阅读时间:2分钟最后更新

概述

They matter because they let researchers forecast performance before spending millions on training a giant model.

深入探讨

Kaplan 及其同事在 OpenAI 的 2020 年论文中推广的缩放定律发现,测试损失按照平滑幂律在三个量上减少:参数计数 (N)、训练令牌 (D) 和总计算量 (C)。在双对数轴上绘制时,损失与每个因素的关系形成一条跨越多个数量级的几乎直线。这些关系的形式为 Loss ≈ a + b·X^(-c),其中 X 是缩放因子。至关重要的是,最初的工作表明模型大小比数据更重要,从而引发了对更大模型(例如 GPT-3 的 1750 亿个参数)的竞赛。缩放定律将深度学习从猜测转变为可预测的工程学科,让团队可以通过小型、廉价的实验来预测大规模结果。

技术洞察

幂律形式意味着计算的每个固定乘法增加都会产生大致恒定的加法损失下降。损失以 nat 或每个交叉熵令牌的位数来衡量。由于指数 c 很小(通常在 0.05-0.1 左右),收益是真实的,但在递减:计算量加倍的帮助远远小于第一次加倍的帮助。重要的是,这些定律描述了不可约加可约损失,其中常数项捕获了任何模型都无法击败的数据的内在熵。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

神经网络扩展定律的未来

研究人员正在将缩放法则扩展到预训练损失之外,扩展到下游任务准确性、多模态模型和推理时间计算,其中推理模型在每个查询上花费更多的思考。随着高质量文本变得稀缺,人们的注意力正在转向数据质量、合成数据和重复数据缩放法则。一些人认为,原始扩展正在触及金钱、能源和可用文本的实际限制,推动该领域朝着算法效率和新架构发展,而不是简单地构建更大的架构。

现实世界的实施

在提交 GPU 预算之前,通过一系列小型 1 亿参数测试运行来预测计划的 700 亿参数模型的最终损失。

决定收集多少万亿个代币,以便固定的计算预算不会浪费在训练不足的模型上。

通过小规模拟合缩放曲线而不是全尺寸训练来比较两种架构。

通过将损失曲线推断到目标计算水平,为投资者或资助审核者设定现实的准确性预期。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录神经网络缩放定律在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

卷积神经网络

常见问题

What is Scaling Laws for Neural Networks?

缩放定律是经验公式,表明随着模型大小、数据集大小和计算的增加,神经网络的损失可预测地下降。它们很重要,因为它们让研究人员在花费数百万美元训练巨型模型之前预测性能。

在对数轴上,随着缩放定律下计算量的增加,测试损失通常如何表现?

损失与计算、模型大小或数据在双对数图上形成一条近乎直线,这是幂律关系的签名。

原始缩放定律与损失相关的三个量是什么?

卡普兰等人。研究了参数计数 (N)、训练标记 (D) 和总计算 (C) 中的幂律损失。

为什么缩放定律对人工智能实验室如此有价值?

通过在小范围内拟合曲线,团队可以在花费巨额资金之前预测巨型模型的性能。

缩放定律损失公式中的常数(不可约)项代表什么?

损失有一个可减少的部分,随着规模的扩大而缩小,加上由数据固有的随机性设定的不可减少的下限。

为什么规模收益被描述为“递减”?

由于幂律指数很小,相等的乘法计算增加会产生稳定更小的绝对损失减少。