基础知识指南

Chinchilla 计算优化训练

Chinchilla 是 DeepMind 2022 年的一项发现,大多数大型语言模型都严重缺乏训练:对于固定的计算预算,您应该大致相等地扩展参数和数据,而不仅仅是构建更大的模型。

阅读时间:2分钟最后更新

概述

It reshaped how the industry balances model size against training data.

深入探讨

DeepMind 的 Chinchilla 论文重新审视了缩放比例并训练了 400 多个模型以找到计算最佳平衡。总体经验法则:模型大小和训练标记应同步增长,每个参数大约 20 个训练标记。为了证明这一点,他们在 1.4 万亿个代币上训练了 Chinchilla,这是一个有 700 亿个参数的模型,使用的计算量与在少得多的代币上训练的有 2800 亿个参数的 Gopher 相同。尽管 Chinchilla 的体积小四倍,但几乎在所有基准测试中都优于 Gopher、GPT-3 和其他巨头。这一教训推翻了之前的 OpenAI 结论,该结论更看重大小而非数据,表明许多旗舰型号由于太大和太缺乏数据而导致性能下降。

技术洞察

Chinchilla 拟合损失为 L(N,D) = E + A·N^(-α) + B·D^(-β),其中 α 和 β 均接近 0.34,这意味着参数和数据的贡献几乎对称。在固定计算约束下对此进行优化(变压器的计算 ≈ 6·N·D)会产生等比例的结果。较小的、数据丰富的模型在推理时运行起来也更便宜,因此它的优势在部署方面更加复杂,而不仅仅是训练。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

Chinchilla 计算优化训练的未来

像 Llama 3 这样的现代模型故意远远超过 Chinchilla 每个参数 20 个令牌的比例,在数万亿个令牌上训练小型模型,以降低推理成本,并接受次优的训练计算。随着优质数据变得稀缺,人们对重复周期、合成数据和质量过滤的兴趣日益浓厚。 Chinchilla 仍然是参考点,但最佳值越来越取决于生命周期推理成本,而不仅仅是一次性训练预算。

现实世界的实施

选择在 2 万亿代币上训练 70 亿个参数的模型,而不是在相同预算下使用太少的数据训练 300 亿个模型。

估计 100 亿个参数的模型需要大约 2000 亿个代币才能达到计算最优的最佳点。

证明较小的部署模型可以削减每个查询的推理成本,同时与较大竞争对手的质量相匹配。

审核现有模型并得出其训练不足的结论,然后计划更长的训练运行而不是增加参数。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录 Chinchilla 计算优化训练在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

考试时培训

常见问题

What is Chinchilla Compute-Optimal Training?

Chinchilla 是 DeepMind 2022 年的一项发现,大多数大型语言模型都严重缺乏训练:对于固定的计算预算,您应该大致相等地扩展参数和数据,而不仅仅是构建更大的模型。它重塑了行业平衡模型大小和训练数据的方式。

Chinchilla 著名的计算优化训练经验法则是什么?

DeepMind 发现,对于给定的计算预算,参数和令牌应该以每个参数大约 20 个令牌的方式一起扩展。

70B参数的龙猫与280B参数的地鼠相比如何?

Chinchilla 在相同的计算下对更多的代币进行了训练,在大多数基准测试中都击败了更大的 Gopher。

Chinchilla 论文揭示了先前大型模型的哪些关键问题?

像 GPT-3 和 Gopher 这样的模型相对于它们的训练数据来说太大了,导致性能无法实现。

对于 100 亿参数的模型,Chinchilla 规则建议使用大约多少个令牌?

按每个参数 20 个令牌计算,100 亿个参数意味着大约 2000 亿个训练令牌。

除了训练效率之外,为什么更小、数据丰富的模型在部署时更有吸引力?

参数越少意味着每次查询的计算量就越低,因此每次使用模型时,节省的成本都会增加。