ビジュアルAIガイド

スイングトランス

Swin Transformer は、シフトされた階層ウィンドウで画像を処理するビジョン Transformer であり、高解像度の画像全体にわたって注意を効率的に拡張できるようにします。

2分の読書最終更新日

概要

It works as a general-purpose backbone for classification, detection, and segmentation.

ディープダイブ

Standard Vision Transformers はすべての画像パッチにわたってアテンションを計算しますが、そのコストは画像サイズに応じて二次関数的に増大し、検出などの高密度タスクの障害となります。 2021 年に Microsoft Research によって導入された Swin (Shifted WINdows) は、代わりに画像を重なり合わない小さなウィンドウに分割し、各ウィンドウ内でのみセルフ アテンションを計算するため、コストが画像サイズに比例して増加します。情報がウィンドウの境界を越えられるようにするために、交互のレイヤーがウィンドウのグリッドをシフトするため、分離されていたパッチがウィンドウを共有するようになります。 Swin は階層も構築します。小さなパッチから始まり、それらを徐々にマージし、CNN とよく似たマルチスケールの特徴マップを生成します。これは、既存の検出およびセグメンテーションのフレームワークにきちんと組み込まれます。

技術的な洞察

Swin の効率は、ウィンドウ ベースのマルチヘッド セルフ アテンション (W-MSA) によってもたらされます。注意は固定ウィンドウ (たとえば 7x7 パッチ) に限定されるため、複雑さはパッチの数に応じて二次関数ではなく直線的に増加します。次のブロックはシフト ウィンドウ アテンション (SW-MSA) を使用し、ウィンドウ パーティションをウィンドウの半分だけ移動して、クロスウィンドウ接続を形成します。パッチマージレイヤーはステージ間で隣接するパッチを連結し、空間解像度を半分にし、チャネルを 2 倍にして特徴ピラミッドを構築します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

Swin Transformer の未来

Swin は、階層的で局所性を認識した Transformers がユニバーサル ビジョン バックボーンとして CNN に匹敵するか、またはそれに勝つことができることを実証し、Swin V2 はこれを 10 億パラメータのモデルと非常に高い解像度に押し上げました。畳み込み誘導バイアスと注意、より効率的な注意バリアント、およびマルチモーダルおよびビデオ モデルを供給する Swin スタイルのバックボーンの継続的なブレンドが期待されます。ビジョンの基礎モデルが成熟しても、マルチスケールの特徴を生成する階層設計は、依然として高密度の予測タスクにとって特に価値があります。

現実世界の実装

事前トレーニングされたバックボーンとしての高精度の ImageNet 分類

Mask R-CNN や Cascade R-CNN などのフレームワークにおけるオブジェクト検出とインスタンス セグメンテーションのバックボーン

ストリートシーンと衛星画像のセマンティックセグメンテーション

高解像度とマルチスケールの詳細が重要な医療画像分析

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Swin Transformer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Swin Transformer?

Swin Transformer は、シフトされた階層ウィンドウで画像を処理するビジョン Transformer であり、高解像度の画像全体にわたって注意を効率的に拡張できるようにします。これは、分類、検出、セグメンテーションのための汎用バックボーンとして機能します。

Swin Transformer の「Swin」は何を表していますか?

Swin は Shifted Windows の略で、ローカル アテンション ウィンドウがレイヤー間で情報を交換できるようにするメカニズムです。

ローカル ウィンドウ内でセルフ アテンションをコンピューティングすることが有益なのはなぜですか?

アテンションを固定サイズのウィンドウに限定すると、グローバル アテンションの二次関数的な増加とは異なり、計算コストが画像サイズに応じて直線的に増加します。

Swin はどのようにして別々のウィンドウ間で情報を移動できるのでしょうか?

交互のレイヤーはウィンドウ グリッドをウィンドウの半分だけシフトするため、以前に別のウィンドウにあったパッチが互いに対応できるようになります。

Swin ステージ間でパッチをマージするレイヤーは何をしますか?

パッチをマージすると、隣接するパッチが連結され、空間解像度が半分になり、チャネル深度が 2 倍になり、マルチスケール階層が構築されます。

Swin の階層的なマルチスケール出力が特に役立つのはなぜですか?

マルチスケール特徴マップは CNN バックボーンを模倣しているため、Swin は Mask R-CNN のような高密度予測フレームワークと簡単に統合できます。