転移学習
転移学習では、大規模なデータセットですでにトレーニングされたモデルを再利用し、それを新しい関連タスクに適応させます。
概要
Instead of starting from scratch, you stand on the shoulders of a model that already learned useful general features, saving enormous time, data, and compute.
ディープダイブ
強力なモデルをゼロからトレーニングするには、多くの場合、何百万ものラベル付きサンプルと本格的なハードウェアが必要になります。転移学習はそれを回避します。 ImageNet でトレーニングされた画像ネットワークや Web テキストでトレーニングされた言語モデルなど、巨大なデータセットで事前トレーニングされたモデルは、視覚のためのエッジと形状、テキストの文法と意味など、広く役立つパターンをすでに学習しています。その事前トレーニングされたモデルを使用して、その知識をより小さな特定の問題に適応させます。大きく分けて 2 つのスタイルがあります。特徴抽出では、ネットワークの大部分をフリーズし、その上に新しい出力層のみをトレーニングします。微調整では、いくつかのより深い層のフリーズを解除し、低い学習率でトレーニングを継続することで、モデルが知っていることを忘れることなくデータに穏やかに調整します。
技術的な洞察
事前学習されたネットワークは階層を学習します。初期の層は一般的な特徴 (エッジ、テクスチャ、基本的な単語の関係) をキャプチャし、後の層はタスク固有の概念をキャプチャします。転移学習はこれを利用します。タスクがオリジナルと似ている場合は、初期のレイヤーを固定特徴抽出器としてフリーズし、頭部のみを再トレーニングします。データの差異がさらに大きい場合は、更新が緩やかになるように、非常に小さい学習率を使用して深い層を微調整します。大きなリスクはドメイン シフトです。新しいデータが事前トレーニング データとあまりにも異なって見える場合、借用した特徴はうまく適合しません。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
転移学習の未来
転移学習は、AI を構築するデフォルトの方法となっています。現在、大規模なビジョンや言語モデルをゼロからトレーニングする人はほとんどいません。代わりに、チームは事前トレーニングされた基礎モデルを適応させます。フロンティアは LoRA やアダプターのようなパラメーター効率の高い方法で、重みのごく一部のみを調整して巨大なモデルを安価にカスタマイズします。この傾向はさらに深まることが予想されます。大規模なモデルから抽出され、微調整された小規模で特殊なモデルに加えて、ドメインのシフトを緩和し、モデルが繰り返し適応されるときの「壊滅的な忘却」を回避することへの注目が高まっています。
現実世界の実装
ImageNet で事前学習されたネットワークを微調整して、わずか数千枚の写真で工場の生産ラインの特定の欠陥を検出する
小規模の特殊なコーパスを微調整することにより、大規模な事前トレーニング済み言語モデルを適応させて、法律または医学の要約を草稿する
一般的な音声でトレーニングされたモデルを開始点として使用して、特定のアクセントまたは方言の認識エンジンを構築する
農業アプリの葉の画像から植物の病気を分類するためのビジョン モデルの最終層を再トレーニングする
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
転移学習が役立つ部分と、よりシンプルな方法の方が優れている部分を文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Transfer Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
半教師あり学習
よくある質問
What is Transfer Learning?
転移学習では、大規模なデータセットですでにトレーニングされたモデルを再利用し、それを新しい関連タスクに適応させます。最初から始めるのではなく、有用な一般的な機能をすでに学習したモデルの肩の上に立つことで、時間、データ、コンピューティングを大幅に節約できます。
転移学習の中心的な考え方は何ですか?
転移学習では、既に一般的な特徴を学習したモデルを取得して適応させ、データ、時間、コンピューティングを節約します。
より深い層を微調整するときに非常に低い学習率を使用するのはなぜですか?
小さなデータセットで大規模な更新を行うと、貴重な事前トレーニングされた特徴が上書きされ、すぐに過剰適合する可能性があるため、更新は小規模に保たれます。
単純な特徴抽出 (ベースの凍結) に最も適した状況はどれですか?
ターゲット タスクが元のタスクに近く、データが限られている場合、凍結されたフィーチャはすでに関連しているため、新しいヘッドのみが必要になります。
「ドメインシフト」は転移学習におけるどのような問題を表しますか?
ターゲット ドメインが、モデルが事前トレーニングされたものと大きく異なるように見える場合、再利用された特徴がうまく転送されず、精度が低下する可能性があります。
事前学習済みネットワークの初期の層が、後の層よりも容易に再利用されることが多いのはなぜですか?
初期の層は広く役立つ低レベルのパターンをキャプチャしますが、後の層は元のタスクにより特化します。