語言人工智慧指南

龍貓縮放法則

DeepMind 於 2022 年推出的 Chinchilla 縮放法則表明,大多數大型語言模型都嚴重缺乏訓練:對於固定的計算預算,您應該大致以相等的比例縮放模型大小和訓練資料。

閱讀時間約2分鐘最後更新

概述

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

深入探討

在 Chinchilla 之前,趨勢是建立更大的模型(如 175B 參數 GPT-3),同時使用相對少量的資料進行訓練。 DeepMind 訓練了 400 多個跨多種規模和資料預算的模型,然後擬合曲線,在固定計算 (FLOP) 預算下將損失預測為參數和令牌的函數。他們的發現:參數和訓練標記應該一起縮放,大約是 1 比 1 的比例,這意味著每個參數大約有 20 個訓練資料標記。為了證明這一點,他們在 1.4 兆個代幣上訓練了 Chinchilla,這是一個 70B 參數模型,儘管使用相同的計算,但它的性能優於更大的 280B 參數 Gopher,因為它接受了更多數據的訓練。

技術洞察

這些定律來自擬合參數損失函數 L(N, D),其中 N 是參數,D 是標記,包括不可約損失、模型大小和資料大小項。在計算約束下最小化損失(計算大致與 N 乘以 D 成正比)會產生這樣的結果:最優 N 和 D 都隨著具有相似指數的計算冪而增長,因此計算最優比率保持在每個參數 20 個令牌附近。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

龍貓縮放法則的未來

Chinchilla 將這個領域從追逐參數計數轉向為模型提供更高品質的數據,而現代模型的訓練通常遠遠超過「計算最佳」點,以使推理成本更低。隨著高品質的網路文本變得稀缺,人們的注意力開始轉向數據管理、合成數據、多紀元和多模式數據,以保持規模化。核心教訓是:數據和參數必須平衡,原始大小不再是目標。

現實世界的實施

DeepMind 的 70B 參數 Chinchilla 透過使用更多數據進行訓練,在使用同等計算的基準測試中擊敗了 280B Gopher

指導團隊在規劃從頭開始的模型時為每個參數預算約 20 個訓練令牌

證明 LLaMA 等較小、資料豐富的模型在推理時運行成本較低

估計計劃的模型是否“訓練不足”,並且從額外數據中獲得的收益比從額外參數中獲得的收益更多

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

神經網路的縮放定律

常見問題

What is Chinchilla Scaling Laws?

DeepMind 於 2022 年推出的 Chinchilla 縮放法則表明,大多數大型語言模型都嚴重缺乏訓練:對於固定的計算預算,您應該大致以相等的比例縮放模型大小和訓練資料。這很重要,因為它重新定義了「最佳」模型大小的含義,並重塑了實驗室花費計算的方式。

龍貓縮放定律的中心發現是什麼?

Chinchilla 表明,對於固定的計算預算,參數和訓練令牌應該一起增長,大約是 1 比 1。

Chinchilla 建議每個參數大約有多少個訓練標記是計算最佳的?

對於每個模型參數,計算最佳比率約為 20 個訓練標記。

儘管龍貓體型小得多,但哪種型號的性能優於哪款?

70B 參數的 Chinchilla 使用相同的計算擊敗了 DeepMind 自己的 280B 參數的 Gopher,因為它訓練的數據要多得多。

Chinchilla 當時對 GPT-3 這樣的模型意味著什麼?

那個時代的許多大型模型訓練不足,這意味著如果參數計數有更多數據,它們會表現得更好。

Chinchilla 分析中的計算大致是如何進行的?

訓練計算 (FLOP) 大約與參數數量乘以訓練令牌數量成正比。