CLIP および視覚言語モデル
CLIP は、画像とテキストを同じ数学的空間に配置することでそれらを接続する方法を学習する OpenAI のモデルです。
概要
It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.
ディープダイブ
2021 年にリリースされた CLIP (Contrastive Language-Image Pre-training) は、Web から収集した約 4 億の画像とキャプションのペアでトレーニングされました。これは 2 つのエンコーダを使用します。1 つは画像をベクトルに変換し、もう 1 つはテキストをベクトルに変換し、両方とも共有埋め込みスペースに配置されます。モデルは、犬の写真と「犬の写真」という単語が近くに配置され、不一致のペアが遠くに配置されるように学習します。これにより、ゼロショット分類のロックが解除されます。画像にラベルを付けるには、専用の分類子をトレーニングすることなく、画像を候補カテゴリのテキスト説明と比較し、最も近いものを選択します。 CLIP は基礎的なインフラストラクチャとなり、画像ジェネレーターをガイドし、セマンティック画像検索を強化し、データセットをフィルタリングし、Flamingo、LLaVA、GPT-4V などの今日のより大規模なビジョン言語モデルのシードとなりました。
技術的な洞察
CLIP は対照的な目的を持ってトレーニングされています。画像とテキストのペアのバッチで、すべての画像とすべてのキャプションの間の類似度 (コサイン類似度による) を計算し、正しいペアのスコアを最大化し、すべての間違った組み合わせのスコアを最小化するようにエンコーダーを調整します。画像エンコーダは通常、画像をパッチに分割する Vision Transformer です。テキスト エンコーダーはトークン上のトランスフォーマーです。どちらも同等のベクトルを生成するため、任意の画像を任意のテキストに即座に一致させることができます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
CLIP と視覚言語モデルの将来
CLIP スタイルの位置合わせは、大規模なマルチモーダル モデル内の構成要素となり、画像に関するチャット、推論、質問への回答も行うことができます。より大規模でクリーンなトレーニング セット、多くの言語のサポート、ビデオとオーディオの拡張が期待されます。研究者たちは、CLIP が Web データから吸収した社会的および人口統計的なバイアスを軽減し、対照的なモデルが依然として弱い場合の詳細な理解 (オブジェクトの数、テキストの読み取り、空間的関係) を改善するために取り組んでいます。 OpenCLIP のようなオープン バージョンが成熟するにつれ、この画像とテキストの接着剤は検索、ロボティクス、アクセシビリティ ツール全体に広がり続けるでしょう。
現実世界の実装
ファイル名タグの代わりに「山々に沈む夕日」などの自然なフレーズを使用して写真ライブラリを検索する
出力が要求されたプロンプトと一致するようにテキストから画像へのジェネレーターをガイドする
禁止されたコンテンツのテキスト説明と比較して、安全でない画像またはポリシーに違反した画像にフラグを立てる
研究や電子商取引のためのラベルのない大規模な画像データセットの自動整理またはキャプション付け
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CLIP and Vision-Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ロボット工学のための視覚-言語-行動モデル
よくある質問
What is CLIP and Vision-Language Models?
CLIP は、画像とテキストを同じ数学的空間に配置することでそれらを接続する方法を学習する OpenAI のモデルです。これは、画像検索、コンテンツ管理、および多くのテキストから画像へのジェネレーターの背後にある静かな主力製品です。
CLIPの背後にある中心的なアイデアは何ですか?
CLIP は画像とテキストの両方を 1 つの共有ベクトル空間にマッピングするため、それらの類似性を直接測定できます。
CLIPはどのようなトレーニングアプローチを使用していますか?
CLIP は対照的な目的を使用します。つまり、正しい画像とキャプションのペアが近くに引き寄せられ、不一致のペアが遠ざけられます。
CLIP の「ゼロショット分類」とは何を意味しますか?
CLIP は、カテゴリ候補のテキスト説明と比較することで、分類するために特別にトレーニングされていない画像にラベルを付けることができます。
CLIP は画像とキャプションが一致するかどうかをどのように測定しますか?
CLIP はそれぞれをベクトルにエンコードし、コサイン類似度を計算します。類似性が高いほど、意味上の一致がより密接であることを意味します。
CLIP はおよそどのくらいのデータでトレーニングされましたか?
CLIP は、インターネットから収集した約 4 億の画像とキャプションのペアから学習し、広範な視覚言語の知識を提供しました。