基礎知識指南

神經網路的縮放定律

縮放定律是一個經驗公式,顯示隨著模型大小、資料集大小和計算的增加,神經網路的損失可預測地下降。

閱讀時間約2分鐘最後更新

概述

They matter because they let researchers forecast performance before spending millions on training a giant model.

深入探討

Kaplan 及其同事在 OpenAI 的 2020 年論文中推廣的縮放定律發現,測試損失按照平滑冪律在三個量上減少:參數計數 (N)、訓練令牌 (D) 和總計算量 (C)。在雙對數軸上繪製時,損失與每個因素的關係形成一條跨越多個數量級的幾乎直線。這些關係的形式為 Loss ≈ a + b·X^(-c),其中 X 為縮放因子。至關重要的是,最初的工作表明模型大小比數據更重要,從而引發了對更大模型(例如 GPT-3 的 1750 億個參數)的競賽。縮放定律將深度學習從猜測轉變為可預測的工程學科,讓團隊可以透過小型、廉價的實驗來預測大規模結果。

技術洞察

冪律形式意味著計算的每個固定乘法增加都會產生大致恆定的加法損失下降。損失以 nat 或每個交叉熵令牌的位數來衡量。由於指數 c 很小(通常在 0.05-0.1 左右),收益是真實的,但在遞減:計算量加倍的幫助遠小於第一次加倍的幫助。重要的是,這些定律描述了不可約加可約損失,其中常數項捕捉了任何模型都無法擊敗的資料的內在熵。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

神經網路擴展定律的未來

研究人員正在將縮放法則擴展到預訓練損失之外,擴展到下游任務準確性、多模態模型和推理時間計算,其中推理模型在每個查詢上花費更多的思考。隨著高品質文字變得稀缺,人們的注意力正在轉向數據品質、合成數據和重複數據縮放法則。有些人認為,原始擴充正在觸及金錢、能源和可用文字的實際限制,推動該領域朝著演算法效率和新架構發展,而不是簡單地建立更大的架構。

現實世界的實施

在提交 GPU 預算之前,透過一系列小型 1 億參數測試運行來預測計劃的 700 億參數模型的最終損失。

決定收集多少兆個代幣,以便固定的計算預算不會浪費在訓練不足的模型上。

透過小規模擬合縮放曲線而不是全尺寸訓練來比較兩種架構。

透過將損失曲線推斷到目標計算水平,為投資者或資助審核者設定現實的準確性預期。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄神經網路縮放定律在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

卷積神經網絡

常見問題

What is Scaling Laws for Neural Networks?

縮放定律是一個經驗公式,顯示隨著模型大小、資料集大小和計算的增加,神經網路的損失可預測地下降。它們很重要,因為它們讓研究人員在花費數百萬美元訓練巨型模型之前預測表現。

在對數軸上,隨著縮放定律下計算量的增加,測試損失通常會如何表現?

損失與計算、模型大小或資料在雙對數圖上形成一條近乎直線,這是冪律關係的簽名。

原始縮放定律與損失相關的三個量是什麼?

卡普蘭等。研究了參數計數 (N)、訓練標記 (D) 和總計計算 (C) 中的冪律損失。

為什麼縮放定律對人工智慧實驗室如此有價值?

透過在小範圍內擬合曲線,團隊可以在花費巨額資金之前預測巨型模型的性能。

縮放定律損失公式中的常數(不可約)項代表什麼?

損失有一個可減少的部分,隨著規模的擴大而縮小,加上由資料固有的隨機性設定的不可減少的下限。

為什麼規模收益被描述為「遞減」?

由於冪律指數很小,相等的乘法計算增加會產生穩定較小的絕對損失減少。