テクニカルガイド

対照学習

対照学習は、埋め込み空間内で似たものをまとめ、異なるものを遠ざけることをモデルに教えます。

2分の読書最終更新日

概要

It matters because it lets AI learn powerful representations from mostly unlabeled data, powering image search, recommendations, and multimodal models.

ディープダイブ

対照学習ではラベルを予測するのではなく、比較によって学習します。アンカー項目が与えられると、一致する「ポジティブ」がベクトル空間でその近くに配置され、一致しない「ネガティブ」が遠くに配置されるようにモデルがトレーニングされます。一般的な自己監視レシピ (SimCLR など) は、同じ画像の 2 つのランダムな拡張 (トリミング、カラー ジッター、ブラー) を取得することによってポジを作成します。バッチ内のその他すべてはマイナスです。モデルは入力をベクトルにマッピングし、損失があるとペアの高い類似性と、残りのペアの低い類似性が報われます。これにより、距離が意味を反映する埋め込みが生成されるため、下流のタスクに必要なラベルははるかに少なくなります。 CLIP は同じ考え方をモダリティ全体に適用し、画像とそのキャプションを一致させます。

技術的な洞察

主力損失は InfoNCE (類似性スコアに対するソフトマックス) であり、多くの場合、コサイン類似度を温度で割ったもので、どの程度急激に陽性が優先されるかを制御します。重要なのは、多くのマイナスがあるとパフォーマンスが向上するため、大規模なバッチまたはメモリ バンク/キュー (MoCo など) がそれらを提供することです。 BYOL や SimSiam などの一部のメソッドは、明示的なネガを削除し、代わりに運動量または停止勾配ターゲット ネットワークを使用して、すべてのエンベディングが同一になる崩壊を回避します。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

対照学習の未来

対照学習は、マスクされた生成的自己監視を使用して、全体的な類似性と詳細の両方を捕捉するハイブリッド目標に収束しています。その最大の影響はマルチモーダルです。対照的に配置された画像とテキスト (そして現在は音声とビデオ) の埋め込みが検索、検索拡張生成、ゼロショット分類を支えており、そのフットプリントは拡大するでしょう。巨大なバッチへの欲求を減らし、より良い拡張とネガティブマイニング戦略、ラベルが希少で高価な医療画像や時系列などの分野へのアプローチの拡張について、さらなる取り組みが期待されます。

現実世界の実装

CLIP は共有画像テキスト空間を学習するため、「スケートボードに乗った犬」などの入力されたフレーズで写真ライブラリを検索できます。

ラベルのない写真に対して SimCLR を使用して視覚バックボーンを事前トレーニングし、小さなラベル付きセットのみを使用して病気を検出できるように微調整します。

ユーザーが気に入ったアイテムの埋め込みが最近傍検索のために近くに配置される、製品や曲のレコメンデーションを構築します。

同じ人物の 2 枚の写真が近くにあり、別の人物が遠く離れているように埋め込みをトレーニングする顔認証システム。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Contrastive Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

フェデレーテッド ラーニング

よくある質問

What is Contrastive Learning?

対照学習は、埋め込み空間内で似たものをまとめ、異なるものを遠ざけることをモデルに教えます。これが重要なのは、AI がほとんどラベルのないデータから強力な表現を学習し、画像検索、推奨、マルチモーダル モデルを強化できるためです。

対照学習の中心的な目的は何ですか?

対照学習は、一致するペアが近くにあり、一致しないペアが遠く離れているように、埋め込み空間を形成します。

SimCLR のような自己教師あり画像手法では、通常、正のペアはどのように作成されますか?

SimCLR は、1 つの画像の 2 つの拡張ビューからポジを形成し、バッチ内の他の画像はネガとして機能します。

どの損失関数が対照学習に最も関連していますか?

InfoNCE (温度による類似性スコアのソフトマックス) は、標準的な対比目標です。

MoCo のようなメソッドがメモリ バンクまたはキューを使用するのはなぜですか?

対照的な学習には多くのマイナス面もありますが、利点があります。キューは、バッチ サイズを管理しやすい状態に保ちながら、それらを提供します。

BYOL と SimSiam は、明示的なネガを使用せずに具体的にどのような問題を防ぎますか?

ネガがなければ、モデルはすべてを同じベクトルに自明にマッピングできます。停止勾配と運動量のターゲットは、この崩壊を防ぎます。