Chinchilla 計算優化訓練
Chinchilla 是 DeepMind 2022 年的一項發現,大多數大型語言模型都嚴重缺乏訓練:對於固定的計算預算,您應該大致相等地擴展參數和數據,而不僅僅是構建更大的模型。
概述
It reshaped how the industry balances model size against training data.
深入探討
DeepMind 的 Chinchilla 論文重新審視了縮放比例並訓練了 400 多個模型以找到計算最佳平衡。整體經驗法則:模型大小和訓練標記應同步成長,每個參數約 20 個訓練標記。為了證明這一點,他們在 1.4 兆個代幣上訓練了 Chinchilla,這是一個有 700 億個參數的模型,使用的計算量與在少得多的代幣上訓練的有 2800 億個參數的 Gopher 相同。儘管 Chinchilla 的體積小四倍,但幾乎在所有基準測試中都優於 Gopher、GPT-3 和其他巨頭。這一教訓推翻了先前的 OpenAI 結論,該結論更看重大小而非數據,表明許多旗艦型號由於太大和太缺乏數據而導致性能下降。
技術洞察
Chinchilla 擬合損失為 L(N,D) = E + A·N^(-α) + B·D^(-β),其中 α 和 β 均接近 0.34,這意味著參數和數據的貢獻幾乎對稱。在固定計算限制下對此進行最佳化(變壓器的計算 ≈ 6·N·D)會產生等比例的結果。較小的、資料豐富的模型在推理時運行起來也更便宜,因此它的優勢在部署方面更加複雜,而不僅僅是訓練。
戰略影響
更明確的決策
它可以幫助您將清晰的技術聲明與行銷語言分開。
成本與預算
在花費金錢或時間之前,您可以提出更好的實施問題。
團隊與工作流程
具有共同理解的團隊可以做出更好的產品、政策和學習決策。
Chinchilla 計算優化訓練的未來
像 Llama 3 這樣的現代模型故意遠遠超過 Chinchilla 每個參數 20 個令牌的比例,在數萬億個令牌上訓練小型模型,以降低推理成本,並接受次優的訓練計算。隨著優質數據變得稀缺,人們對重複週期、合成數據和品質過濾的興趣日益濃厚。 Chinchilla 仍然是參考點,但最佳值越來越取決於生命週期推理成本,而不僅僅是一次性訓練預算。
現實世界的實施
選擇在 2 兆代幣上訓練 70 億個參數的模型,而不是在相同預算下使用太少的資料訓練 300 億個模型。
估計 100 億個參數的模型需要大約 2000 億個代幣才能達到計算最優的最佳點。
證明較小的部署模型可以削減每個查詢的推理成本,同時與較大競爭對手的品質相符。
審核現有模型並得出其訓練不足的結論,然後規劃更長的訓練運行而不是增加參數。
風險與防護欄
不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。
基準測試可能看起來很強大,但實際效能卻參差不齊。
忽視數據品質和評估計劃通常會產生脆弱的結果。
實施路線圖
從您需要的結果的簡單語言定義開始。
在測試之前選擇一種成功指標和一種失敗條件。
使用代表性資料運行小型試點,而不是完善的演示集。
記錄 Chinchilla 計算優化訓練在哪些方面有幫助以及在哪些方面更簡單的方法更好。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Chinchilla Compute-Optimal Training?
Chinchilla 是 DeepMind 2022 年的一項發現,大多數大型語言模型都嚴重缺乏訓練:對於固定的計算預算,您應該大致相等地擴展參數和數據,而不僅僅是構建更大的模型。它重塑了產業平衡模型大小和訓練資料的方式。
Chinchilla 著名的計算優化訓練經驗法則是什麼?
DeepMind 發現,對於給定的計算預算,參數和令牌應該以每個參數大約 20 個令牌的方式一起擴展。
70B參數的龍貓與280B參數的地鼠相比如何?
Chinchilla 在相同的計算下對更多的代幣進行了訓練,在大多數基準測試中都擊敗了更大的 Gopher。
Chinchilla 論文揭示了先前大型模型的哪些關鍵問題?
像 GPT-3 和 Gopher 這樣的模型相對於它們的訓練資料來說太大了,導致效能無法實現。
對於 100 億參數的模型,Chinchilla 規則建議使用大約多少個代幣?
以每個參數 20 個令牌計算,100 億個參數意味著大約 2000 億個訓練令牌。
除了訓練效率之外,為什麼更小、資料豐富的模型在部署時更有吸引力?
參數越少意味著每次查詢的計算量就越低,因此每次使用模型時,節省的成本都會增加。