チンチラのコンピューティング最適化トレーニング
Chinchilla は、大規模な言語モデルのほとんどがひどくトレーニングされていないという 2022 年の DeepMind の調査結果です。固定されたコンピューティング予算の場合は、より大きなモデルを構築するだけでなく、パラメーターとデータをほぼ均等にスケールする必要があります。
概要
It reshaped how the industry balances model size against training data.
ディープダイブ
DeepMind の Chinchilla 論文では、スケーリングを再検討し、400 を超えるモデルをトレーニングして、コンピューティングの最適なバランスを見つけました。見出しの経験則: モデルのサイズとトレーニング トークンは、パラメーターごとに約 20 個のトレーニング トークンとして段階的に増加する必要があります。それを証明するために、彼らは、はるかに少ないトークンでトレーニングされた 2,800 億のパラメーターの Gopher と同じ計算を使用して、1 兆 4,000 億のトークンで 700 億のパラメーターのモデルである Chinchilla をトレーニングしました。チンチラは、体格が 4 分の 1 であるにもかかわらず、ほぼすべてのベンチマークで Gopher、GPT-3、およびその他の巨人を上回りました。このレッスンは、データよりもサイズを優先するという以前の OpenAI の結論を覆し、多くの主力モデルが大きすぎてデータが不足しすぎているためにパフォーマンスが劣っていることを示しました。
技術的な洞察
チンチラの適合損失は L(N,D) = E + A・N^(-α) + B・D^(-β) で、α と β は両方とも 0.34 近くで、パラメーターとデータがほぼ対称的に寄与することを意味します。これを固定の計算制約 (トランスフォーマーの計算 ≈ 6・N・D) の下で最適化すると、等しいスケーリングの結果が得られます。小規模でデータが豊富なモデルは、推論時の実行コストも低いため、トレーニングだけでなくデプロイメントにおいてもその利点がさらに高まります。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
チンチラのコンピューティングの未来 - 最適なトレーニング
Llama 3 のような最新のモデルは、Chinchilla のパラメーターあたり 20 トークンの比率を意図的にはるかに超えており、推論を安価にするために数兆のトークンで小さなモデルをトレーニングし、次善のトレーニング コンピューティングを受け入れます。良質なデータが不足するにつれて、繰り返されるエポック、合成データ、高品質のフィルタリングへの関心が高まっています。チンチラは引き続き基準点ですが、最適値は 1 回限りのトレーニング予算だけでなく、生涯にわたる推論コストにますます依存します。
現実世界の実装
同じ予算内で、少なすぎるデータで 300 億のモデルをトレーニングするのではなく、2 兆のトークンで 70 億のパラメーターのモデルをトレーニングすることを選択します。
100 億パラメータのモデルでは、コンピューティングに最適なスイート スポットに到達するには約 2,000 億のトークンが必要であると推定されています。
規模の大きなライバルの品質に匹敵しながら、クエリごとの推論コストを削減するために、小規模なデプロイモデルを正当化します。
既存のモデルを監査し、トレーニングが不十分であると結論付け、パラメーターを増やす代わりに、より長いトレーニングの実行を計画します。
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
Chinchilla Compute-Optimal Training がどのような場合に役立つのか、また、よりシンプルな方法の方が優れているのかを文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
テスト時トレーニング
よくある質問
What is Chinchilla Compute-Optimal Training?
Chinchilla は、大規模な言語モデルのほとんどがひどくトレーニングされていないという 2022 年の DeepMind の調査結果です。固定されたコンピューティング予算の場合は、より大きなモデルを構築するだけでなく、パラメーターとデータをほぼ均等にスケールする必要があります。これにより、業界がトレーニング データに対してモデル サイズのバランスを取る方法が再構築されました。
コンピューティング最適化トレーニングに関するチンチラの有名な経験則とは何ですか?
DeepMind は、パラメーターとトークンは、特定のコンピューティング バジェットに対して、パラメーターあたり約 20 トークンで一緒にスケールする必要があることを発見しました。
パラメータ 70B のチンチラとパラメータ 280B のゴーファーはどうでしたか?
同じコンピューティングではるかに多くのトークンでトレーニングされたチンチラは、ほとんどのベンチマークではるかに大きな Gopher を上回りました。
チンチラの論文では、以前の大型モデルに関するどのような重要な問題が明らかになりましたか?
GPT-3 や Gopher などのモデルは、トレーニング データに比べて大きすぎるため、パフォーマンスが実現できませんでした。
チンチラ ルールは 100 億パラメータ モデルに対しておよそいくつのトークンを示唆していますか?
パラメーターごとに 20 トークンの場合、100 億のパラメーターは約 2,000 億のトレーニング トークンを意味します。
トレーニング効率に加えて、小規模でデータが豊富なモデルが導入に魅力的なのはなぜでしょうか?
パラメーターが少ないほど、クエリごとの計算量が少なくなるため、モデルを使用するたびに節約額が増大します。