学習率のスケジューリング
学習率スケジュールは、トレーニング中にステップ サイズを固定するのではなく変更します。
概要
Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.
ディープダイブ
学習率は、オプティマイザーが更新ごとにどれだけ大きなステップを実行するかを制御します。高すぎるとトレーニングが発散します。低すぎると這ったり、引っかかったりします。スケジュールにより、時間の経過とともにこの値が調整されます。最近の一般的なレシピは、ウォームアップとその後の減衰です。ゼロ付近から開始し、最初の数百または数千のステップで増加し(非常に早い段階で、ノイズの多いグラデーションによって不安定なウェイトが爆発することはありません)、その後徐々に減少します。一般的な減衰形状には、ステップ減衰 (設定されたエポックで係数ずつ低下)、指数関数的減衰、およびゼロ近くまで滑らかに半コサイン曲線をたどるコサイン アニーリングが含まれます。線形ウォームアップを備えたコサイン スケジュールは現在、大規模な言語モデルのトレーニングの標準となっていますが、周期的および 1 サイクル ポリシーにより小規模なモデルのトレーニングを高速化できます。
技術的な洞察
Adam のような適応オプティマイザの最初のステップにおける 2 番目の瞬間の推定値は信頼性が低いため、ウォームアップが重要です。学習率を小さくすると、統計が安定する前に重みが不安定になることが回避されます。コサイン アニーリングでは lr = lr_min + 0.5 * (lr_max - lr_min) * (1 + cos(pi * t / T)) が設定され、早い段階で急速に進歩し、最後の近くで小さな微調整ステップが得られます。一部のスケジュールではウォーム リスタートが追加され、急激な最小値を回避するためにレートが跳ね上がります。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
学習率スケジューリングの未来
トレーニング実行のコストが高くなるにつれて、スケジュールはオプティマイザーやバッチ サイズと共同設計されており、研究者はトレーニング前に最適なピーク レートを予測するためのスケーリング則を研究しています。事前に減衰曲線を選択する必要をなくすスケジュール不要のオプティマイザーが注目を集めており、ライブ損失曲線に対応する適応型のフィードバック駆動型スケジュールにより、依然として大規模なトレーニングの大半を占めている試行錯誤が軽減される可能性があります。
現実世界の実装
トランスフォーマー言語モデルの事前トレーニング時に使用される線形ウォームアップとコサイン減衰。
ImageNet で画像分類器をトレーニングするときに、エポック 30、60、および 90 で学習率が 10 倍に低下するステップ減衰。
fast.ai の 1 サイクル ポリシーは、非常に少ないエポックでモデルを高い精度でトレーニングします。
定期的に急激な損失の最小値を回避し、一般化を改善するためのウォーム リスタートによるコサイン アニーリング。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Learning Rate Scheduling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
循環学習率
よくある質問
What is Learning Rate Scheduling?
学習率スケジュールは、トレーニング中にステップ サイズを固定するのではなく変更します。モデルが迅速に収束し、高い精度に達するかどうかを決める唯一の最大の要因となるのは、多くの場合、それを正しく行うことです。
学習率スケジュールにおける「ウォームアップ」フェーズの目的は何ですか?
ウォームアップはゼロ近くから始まり、オプティマイザの統計が安定する前に初期の不安定な更新によってモデルが不安定にならないようにレートを上げます。
最小レートに向かって滑らかに下降する半コサイン曲線をたどるスケジュールはどれですか?
コサイン アニーリングは、学習率を半コサイン形状に沿って減衰させ、早い段階で大きなステップを与え、終わり近くで小さなステップを与えます。
学習率の設定が高すぎるとどうなりますか?
レートが高すぎるとオーバーシュートが発生するため、損失が定着せずに跳ね返ったり、膨れ上がったりする可能性があります。
ステップ減衰は学習率にどう影響しますか?
ステップ減衰では、選択したマイルストーンでレートに係数 (0.1 など) を掛けて、階段パターンを作成します。
「ウォーム リスタート」がスケジュールに追加されることがあるのはなぜですか?
ウォーム リスタートにより、一定の間隔で学習率が上昇し、オプティマイザが狭い最小値から抜け出し、より良いソリューションを探索できるようになります。