プロンプトツープロンプトのクロスアテンション編集
プロンプトからプロンプトでは、モデルの内部アテンション マップを再利用しながら、テキスト プロンプトを微調整することで生成された画像を編集します。そのため、単語を 1 つ変更すると、シーンの残りの部分はそのままにしながら、その要素が交換されます。
概要
It is editing through words, not pixels.
ディープダイブ
Prompt-to-Prompt (Hertz et al., 2022) は、拡散モデルにおけるテキスト駆動編集のためのトレーニング不要の手法です。重要な洞察は、各単語がどの画像領域に影響を与えるべきかをモデルに指示するクロスアテンション マップが、シーンの空間レイアウトをエンコードしているということです。プロンプトをわずかに変更してイメージを再生成すると、このメソッドは元のプロンプトのアテンション マップを新しい実行に挿入します。 「自転車」などの単語を「オートバイ」に置き換えると、構図と背景を維持したままそのオブジェクトが置き換えられます。単語を追加すると、変更されていないトークンのみが注目されるため、すべてを再シャッフルすることなく新しい属性が表示されます。トークンのアテンションの重みを変更して、その効果を強化または弱めることもできます。微調整やマスクが必要ないため、InstructPix2Pix のデータ生成など、その後の多くの編集方法の基礎的な構成要素となりました。
技術的な洞察
ノイズ除去中に、クロスアテンションはトークンごとに、画像内でトークンが注目する場所の空間マップを計算します。プロンプトツープロンプトは、これらのマップを元の世代から共有トークン用に編集されたマップにコピーします。単語の交換の場合、対応するトークン間で注意をマッピングします。追加された単語については古いマップを保存し、新しいトークンのみが新たな注目を集めるようにします。重み付けの変更は、単にトークンの注意値をスケールし、その視覚的な影響を強めたり弱めたりするだけです。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
プロンプトツープロンプトのクロスアテンション編集の未来
現在、クロスアテンション操作は、制御可能な生成ツールのファミリー全体を支えており、そのアイデアは、新しいアーキテクチャでのアテンション制御や、時間的に一貫した編集のためのビデオ拡散にまで拡張されています。反転による実画像編集とのより緊密な統合、大規模な構造変更のより堅牢な処理、および命令モデルとの組み合わせにより、シンプルな自然言語インターフェイスの下でアテンション トリックが目に見えない形で実行されることが期待されます。
現実世界の実装
デザイナーは「路上の赤い車」を「路上の青い車」に変更し、まったく同じシーンのレイアウトを維持します。
イラストレーターは「雪」という単語の重みを変更して、さまざまなバリエーションで風景を徐々に冬らしくしていきます。
ストーリーテラーは、キャラクター シートの同じポーズと背景を維持するために、プロンプトで「ライオン」を「トラ」に交換します。
研究者はこれを使用して、指示に従うエディターのトレーニング データとして、前後のペアの画像を生成します。
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prompt-to-Prompt Cross-Attention Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
クロスアテンション
よくある質問
What is Prompt-to-Prompt Cross-Attention Editing?
プロンプトからプロンプトでは、モデルの内部アテンション マップを再利用しながら、テキスト プロンプトを微調整することで生成された画像を編集します。そのため、単語を 1 つ変更すると、シーンの残りの部分はそのままにしながら、その要素が交換されます。ピクセルではなく言葉で編集しています。
プロンプトツープロンプトはシーンを保存するためにどのような内部情報を再利用しますか?
クロスアテンション マップは、各単語が画像に影響を与える場所をエンコードするため、それらを再利用すると、編集中にレイアウトの一貫性が保たれます。
プロンプトツープロンプトではモデルを微調整する必要がありますか?
推論時に注意を操作するため、追加のトレーニングは必要ありません。
トークンのアテンションの重み付けを変更すると何が得られるでしょうか?
トークンの注意値をスケーリングすると、その概念がどの程度強く現れるかが強化されたり、弱められたりします。
プロンプトツープロンプトが基本的なテクニックとみなされるのはなぜですか?
そのトレーニング不要の注意操作は、その後の編集研究全体で再利用される構成要素となりました。