ビジュアルAIガイド

VQGAN とコードブック画像合成

VQGAN は、学習されたコードブックから描画された離散トークンのグリッドに画像を圧縮し、言語モデルがテキストを生成するのと同じ方法でトランスフォーマーが画像を生成できるようにします。

2分の読書最終更新日

ディープダイブ

2021 年の論文「高解像度画像合成のためのトランスフォーマーの飼いならし」で紹介された VQGAN は、ベクトル量子化オートエンコーダー (VQVAE) と敵対的および知覚的トレーニングを組み合わせたものです。エンコーダは画像を特徴ベクトルの小さなグリッドにマッピングします。各ベクトルは、たとえば 1024 個の離散コードからなる学習済みコードブック内の最も近いエントリにスナップされ、画像が一連の整数トークンに変換されます。デコーダは、GAN 弁別器と知覚損失でトレーニングされたこれらのトークンから画像を再構築するため、再構築はぼやけず鮮明に見えます。画像は離散トークン シーケンスになっているため、自己回帰トランスフォーマーは言語のように画像をモデル化し、トークンを 1 つずつ予測できます。 VQGAN は、CLIP ガイダンスと組み合わせて、初期のテキストから画像へのアート ツールを強化したことで有名です。

技術的な洞察

中核となる操作はベクトル量子化です。連続エンコーダ出力は、「ストレートスルー」勾配推定器を使用して最も近いコードブック ベクトルに置き換えられるため、微分不可能な検索にもかかわらずエンコーダは引き続き学習できます。オートエンコーダーの上にパッチベースの GAN ディスクリミネーターを追加することで、VQGAN はテクスチャを鮮明に保ちながら、VQVAE よりもはるかに小さなトークン グリッド (例: 16x16) を使用できるようになり、トランスフォーマーのモデリングが扱いやすくなります。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

VQGAN とコードブック画像合成の未来

VQGAN の離散トークン レシピは、MaskGIT から 1 つのトランスフォーマーで画像トークンとテキスト トークンを混合するマルチモーダル システムに至るまで、トークン ベースの画像およびビデオ モデルの基盤となりました。研究は現在、コードブックの崩壊を回避する、より大規模で有限スカラーまたはルックアップフリーのコードブックを目指し、また、同じ語彙が画像、音声、言語にまたがる統一モデルを目指して、任意の世代から任意の世代への対応を可能にしています。

現実世界の実装

写真をコードブック トークンの 16x16 グリッドにエンコードして、トランスフォーマーがモデル化して再生成できるようにする

VQGAN と CLIP ガイダンスを組み合わせて、2021 年に流行したシュールな「VQGAN+CLIP」AI アートを作成

画像をコンパクトな離散コードに圧縮して、効率的な保存や下流の生成トレーニングを実現

MaskGIT やマルチモーダル トランスフォーマーなどのより大きなトークンベースのジェネレーター内で画像トークナイザーとして機能します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

SPADE セマンティックイメージ合成

よくある質問

What is VQGAN and Codebook Image Synthesis?

VQGAN は、学習されたコードブックから描画された離散トークンのグリッドに画像を圧縮し、言語モデルがテキストを生成するのと同じ方法でトランスフォーマーが画像を生成できるようにします。

VQGAN は画像を個別のトークンとして表現するために何を使用しますか?

VQGAN は、エンコーダの特徴を学習されたコードブック内の最も近いエントリに量子化し、画像を離散コード インデックスのシーケンスに変換します。

VQGAN が VQVAE の上に GAN 識別子を追加するのはなぜですか?

敵対的損失と知覚的損失により、VQGAN はコンパクトなトークン グリッドから鮮明な画像を再構築できますが、VQVAE だけではぼやける傾向があります。

画像が一連のトークンになったら、どのモデルが新しい画像を生成するのでしょうか?

画像は離散トークン シーケンスになるため、トランスフォーマーはテキストを生成するのと同じように自己回帰的に画像をモデル化できます。

微分不可能な量子化ステップで勾配を流すにはどのような手法がありますか?

ベクトル量子化は微分不可能であるため、VQGAN はストレートスルー勾配推定器を使用してエンコーダーをトレーニングします。

VQGAN が 2021 年の創造に貢献した有名な AI アート トレンドは何ですか?

VQGAN と CLIP ガイダンスを組み合わせることで、広く共有される「VQGAN+CLIP」アートが生み出され、テキスト駆動の画像生成が普及しました。