ビジュアルAIガイド

ビジョントランスフォーマー

ビジョン トランスフォーマー (ViT) は、ChatGPT を強化するトランスフォーマー アーキテクチャを画像に適用し、画像をピクセルのグリッドではなくパッチのシーケンスとして扱います。

2分の読書最終更新日

概要

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

ディープダイブ

畳み込みニューラル ネットワーク (CNN) は、画像全体にわたって小さなフィルターをスキャンすることで、長年にわたってコンピューター ビジョンを支配していました。 Google の 2020 年の論文「An Image Is Worth 16x16 Words」は、画像を固定パッチ (通常は 16x16 ピクセル) に分割し、それぞれをベクトルに平坦化し、結果のシーケンスを標準のトランスフォーマーに入力することで、この問題に挑戦しました。各パッチは、文中の単語と同じように「トークン」になります。次に、モデルはセルフ アテンションを使用して、すべてのパッチを他のすべてのパッチに直接関連付けることができ、小さな畳み込みフィルターでは 1 ステップでは認識できない長距離の関係をキャプチャします。問題点: ViT には CNN の組み込みの前提条件が欠けているため、データを大量に消費します。 JFT-300M のような巨大なデータセットでトレーニングされたこれらのデータは、最高の CNN に匹敵するかそれを上回り、現代の視覚研究を再構築しました。

技術的な洞察

ViT は、画像を重なり合わないパッチに分割し、それぞれを埋め込みに線形投影し、位置エンコーディングを追加して、モデルが元の画像の各パッチがどこにあるかを認識できるようにします。特別な学習可能な「クラス トークン」が先頭に追加されます。その最終的な表現が分類を推進します。自己注意レイヤーを積み重ねることで、各パッチが他のすべてのパッチからの情報を重み付けし、レイヤー 1 からのグローバルな受容野を与えます。アテンションはパッチの数に応じて二次関数的に増加するため、高解像度の画像は高価になります。そのため、パッチのサイズと効率的なアテンションのバリエーションが重要になります。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

ビジョントランスフォーマーの未来

ViT と CNN トランスハイブリッドは現在、最先端のビジョン システムに電力を供給しており、このアーキテクチャは、CLIP や最新のビジョン言語アシスタントなど、画像とテキストを融合するマルチモーダル モデルを支えています。高解像度とビデオに対する注意を安くするための継続的な取り組みと、膨大なラベル付きデータの需要を減らす自己教師あり事前トレーニング (マスクされた画像モデリングなど) の継続的な取り組みが期待されます。コンピューティングが増大するにつれて、「言語モデル」と「ビジョン モデル」の間の境界線は曖昧になり続けており、トランスフォーマーは個別の特殊な設計ではなく、モダリティ全体で共有されるバックボーンとして機能します。

現実世界の実装

ViT が CNN との競争力を証明した後、変圧器バックボーンを採用した Google の画像分類および検索ランキング システム

ViT を使用して画像をエンコードする CLIP およびその他の画像テキスト モデルにより、共有スペースで写真とキャプションを一致させることができます

ViT を使用して、局所的なテクスチャだけではなくスキャン全体のパターンを検出する医用画像研究

ViT スタイルの注意力を組み合わせて全視野にわたるシーンを理解する自動運転およびロボット認識スタック

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

CLIP および視覚言語モデル

よくある質問

What is Vision Transformers?

ビジョン トランスフォーマー (ViT) は、ChatGPT を強化するトランスフォーマー アーキテクチャを画像に適用し、画像をピクセルのグリッドではなくパッチのシーケンスとして扱います。彼らは、最先端の画像認識を実現するために畳み込みは必要ないことを証明しました。

Vision Transformer は最初に入力画像をどのように処理しますか?

ViT は画像を固定パッチ (多くの場合 16x16 ピクセル) に分割し、各パッチをトークンとして埋め込み、シーケンスをトランスフォーマーに供給します。

ViT が画像の離れた部分を相互に関連付けることを可能にする重要なメカニズムは何ですか?

セルフアテンションにより、すべてのパッチが他のすべてのパッチからの情報を直接比較できるようになり、最初のレイヤーから全体的なビューが得られます。

通常、単純な Vision Transformer が優れたパフォーマンスを発揮するには非常に大規模なトレーニング データセットが必要なのはなぜですか?

CNN とは異なり、ViT は局所性や変換の不変性を想定していないため、大量のデータからこれらのパターンを学習する必要があります。

Vision Transformer における位置エンコーディングの目的は何ですか?

セルフアテンションは順序に依存しないため、位置エンコーディングによって各パッチの空間位置が復元されます。

ViT がコンピューター ビジョンに与える影響を最もよく反映しているのは次のうちどれですか?

ViT は、十分なデータと規模を備えた純粋なトランスフォーマーが最高の畳み込みネットワークに匹敵するか、それを超えることができることを実証しました。