自己回帰画像生成
自己回帰画像生成では、一度に 1 枚ずつ画像を構築し、その前に生成されたすべてのトークンから各トークンを予測します。
概要
It matters because the same next-token machinery powering language models can produce coherent, controllable images.
ディープダイブ
自己回帰画像生成では、画像をシーケンスとして扱い、それを要素ごとに予測します。各新しい要素は、以前のすべての要素に基づいて条件付けされます。 PixelRNN や PixelCNN などの初期の作品では、画像を一度に 1 つの生ピクセルで予測し、行ごとにスキャンしていました。これは遅いですが理論的にはクリーンでした。代わりに、最新のシステムでは、まず VQ-VAE スタイルのエンコーダーを使用して画像を離散トークンのグリッドに圧縮し、次に Transformer がそれらのトークンを左から右に予測します。 OpenAI の DALL-E 1 と Google の Parti はこのレシピに従い、ピクセルにデコードする前にテキスト プロンプトを条件とした画像トークンを生成しました。大きな利点は、正確な尤度モデリングと、言語と共有される統一されたアーキテクチャです。コストは逐次的で遅いサンプリングです。
技術的な洞察
モデルは、すべてのトークンの結合確率を条件分岐の積に因数分解します。p(x) = p(x_i が与えられた場合、x_1...x_{i-1}) の積になります。因果的 (マスクされた) アテンションを持つトランスフォーマーは、各ポジションが以前のトークンのみを参照することを強制します。トレーニング中は教師強制を使用してすべてのトークンを並行して予測しますが、推論時には一度に 1 つのトークンをサンプリングし、それぞれをフィードバックする必要があります。学習されたコードブックはトークンを画像パッチにマッピングし、デコーダーはそれを最終ピクセルにアップサンプリングします。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
自己回帰画像生成の将来
スピードが主な戦場です。並列トークン デコードやマスクされたトークン デコード (MaskGIT、Muse) などの技術は、一度に多くのトークンを生成し、言語モデルから借用した投機的デコードが画像に適用されています。研究者らはまた、マルチモーダル システムで見られるように、テキストと画像のトークンを単一の自己回帰バックボーンに統合し、1 つのモデルで読み取りと描画ができるようにしています。自己回帰と拡散のアイデアが融合し続け、トークンの制御性と拡散の質を捉えるハイブリッド モデルが期待されます。
現実世界の実装
DALL-E 1 は、テキスト キャプションから離散画像トークンのグリッドを自己回帰的に予測することで画像を生成しました。
Google の Parti は、詳細でプロンプトに忠実なシーンを実現するために、自己回帰テキストから画像へのトランスフォーマーを 200 億のパラメーターに拡張しました。
PixelCNN と PixelRNN は、生のピクセルごとの生成を実証し、現在でも尤度ベースのモデルの学習ベースラインとして使用されています。
MaskGIT と Muse は、並列マスク トークン デコードを使用して、自己回帰スタイルのトレーニングを維持しながら、トークンベースの画像合成を高速化します。
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Autoregressive Image Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
AI画像生成
よくある質問
What is Autoregressive Image Generation?
自己回帰画像生成では、一度に 1 枚ずつ画像を構築し、その前に生成されたすべてのトークンから各トークンを予測します。言語モデルを強化する同じネクストトークン機構が一貫性のある制御可能なイメージを生成できるため、これは重要です。
画像生成の文脈における「自己回帰」とは何を意味しますか?
自己回帰モデルは画像をシーケンスとして因数分解し、その前に生成されたすべての要素に基づいて各トークンまたはピクセルを予測します。
DALL-E 1 のような最新の自己回帰画像モデルは、通常、画像を予測する前にどのように表現するのでしょうか?
最新のシステムは、画像を個別のトークンに圧縮し (多くの場合、VQ-VAE スタイルのエンコーダーを介して)、そのトークン シーケンスを Transformer で予測します。
一度に 1 raw ピクセルずつ画像を生成した初期のモデルはどれですか?
PixelRNN と PixelCNN は、画像をピクセルごとにスキャンして予測する先駆的な自己回帰モデルです。
自己回帰生成中に Transformer が以前のトークンのみに対応することを保証するメカニズムは何ですか?
因果マスキングは、各位置が将来のトークンに注目するのをブロックし、左から右への因数分解を強制します。
自己回帰画像サンプリングの実際的な主な欠点は何ですか?
各トークンは前のトークンに依存するため、推論はトークンごとに実行する必要があり、生成が比較的遅くなります。