MaskGIT 並列トークン デコード
MaskGIT は、一度に多くのトークンを予測し、最も信頼性の高いトークンを最初に入力することでイメージを生成し、遅い左から右への生成を少数の高速な並列ステップで置き換えます。
ディープダイブ
2022 年の Google からの MaskGIT (Masked Generative Image Transformer) は、トークンベースの画像モデルのデコード方法を再考します。 VQGAN などの以前のトランスフォーマは、ラスター順に一度に 1 つずつ自己回帰的にトークンを生成していましたが、これは 2D 画像にとって遅くて不自然です。代わりに、MaskGIT は BERT のようなマスクされたモデリング目標を使用してトレーニングします。画像トークンのランダムなサブセットが隠され、モデルは双方向の注意を使用してそれらすべてを同時に予測することを学習します。生成時には、完全にマスクされたグリッドから開始され、固定回数の反復 (通常は 8 ~ 12) でデコードされます。各ステップでマスクされたすべてのトークンを予測し、最も信頼性の高い予測を保持し、残りを次のラウンドで再マスクします。これにより、自己回帰デコードよりもおよそ 1 桁少ないステップで高品質の画像が生成されます。
技術的な洞察
重要なコンポーネントは、信頼性に基づくマスキング スケジュールです。コサイン スケジュールは、各反復で公開するトークンの数を決定し、ゆっくりと開始して加速します。注意は双方向であるため、すべてのトークンは部分画像全体を見るため、最も信頼性の高い予測を最初にコミットすることで、曖昧な部分の前にパズルの簡単な部分を解くのと同じように、後のステップで確実なコンテキストを条件にすることができます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
MaskGIT 並列トークン デコードの将来
MaskGIT の並列反復デコードは、テキストから画像への MUSE やビデオのマスクされたアプローチなど、非自己回帰ジェネレーターの波を引き起こしました。このパターンは、トークンを並行して予測し、数ステップにわたって調整するもので、ワンショット GAN と多ステップの拡散の間に位置し、調整可能な品質と速度のトレードオフを提供します。マスクされたトークンのデコードは、インペイントと条件付き塗りつぶしが自然に適合する高速マルチモーダル ジェネレーターと編集システムに引き続き表示されることが予想されます。
現実世界の実装
何百もの自己回帰トークン予測の代わりに、約 8 ~ 12 の並列ステップで完全なイメージを生成します。
周囲のコンテキストを含む隠れたトークンのみを再予測することにより、写真のマスクされた領域を修復する
ImageNet 上のクラス条件付き画像合成は、はるかに遅いモデルに匹敵する品質で実現します
Google の MUSE など、高速生成が必要なテキストから画像へのシステムのデコード バックボーンとして機能します。
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MaskGIT Parallel Token Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
思考の骨格の並列デコード
よくある質問
MaskGITパラレルトークンデコードとは何ですか?
MaskGIT は、一度に多くのトークンを予測し、最も信頼性の高いトークンを最初に入力することでイメージを生成し、遅い左から右への生成を少数の高速な並列ステップで置き換えます。
MaskGIT は VQGAN のトランスフォーマーとどのように異なる方法で画像トークンをデコードしますか?
MaskGIT は、VQGAN の遅い左から右への自己回帰デコードとは異なり、双方向のアテンションですべてのマスクされたトークンを同時に予測します。
MaskGIT は言語モデルからどのようなトレーニング目的を借用していますか?
MaskGIT はトークンのランダムなサブセットを隠し、それらを予測することを学習します。これは BERT と同様のマスクされたモデリング目標です。
生成中、MaskGIT は各反復でどのトークンをコミットしますか?
各ステップでは最も信頼性の高い予測を保持し、残りを再マスクするため、後のステップでは信頼できるコンテキストが条件となります。
MaskGIT が画像を生成するには、通常、およそ何回の反復が必要ですか?
MaskGIT は、自己回帰や拡散アプローチよりもはるかに少ない、少数の固定ステップ (多くの場合 8 ~ 12) でデコードします。
MaskGIT が各ステップで公開するトークンの数を制御するスケジュールは何ですか?
コサイン スケジュールでは、初期には少数のトークンが明らかになり、後にはより多くのトークンが明らかになり、反復全体で品質と速度のバランスが保たれます。