ビジュアルAIガイド

InstructPix2Pix 命令編集

InstructPix2Pix を使用すると、「冬にする」や「猫を犬に変える」などの単純なコマンドを入力するだけで写真を編集できます。マスクや選択ツールは必要ありません。

2分の読書最終更新日

概要

It taught a diffusion model to follow editing instructions directly.

ディープダイブ

InstructPix2Pix (Brooks et al.、2023) は、入力画像とテキスト命令を取得し、編集された画像を 1 回の順方向パスで出力するように微調整された拡散モデルです。その巧妙なトリックはトレーニング データです。著者らは GPT-3 を使用して前後のキャプション ペアを生成し、次に安定拡散を備えたプロンプトツープロンプトを使用して、一致する前後の画像ペアを合成しました。これにより、手動でラベルを付けることなく、(元の画像、命令、編集された画像) トリプルからなる大規模なデータセットをトレーニングに使用できるようになりました。指示はシーン全体ではなく変更を説明するため、モデルは画像の言及されていない部分を保持します。 2 つのガイダンス スケールを使用します。1 つは指示にどれだけ忠実に従うか、もう 1 つは元の画像にどれだけ忠実に従うかを示し、ユーザーは編集の強度と忠実性をトレードオフできます。

技術的な洞察

モデルはソース画像と命令の両方に基づいて条件付けを行い、2 つの軸に沿って分類子を使用しないガイダンスを適用します。 1 つのスケールはテキスト命令を重み付けし、もう 1 つのスケールは入力画像を重み付けします。画像スケールを上げると、オリジナルの状態がより多く保たれますが、テキスト スケールを上げると、編集がより積極的になります。この二重のガイダンスにより、単一の一般的な命令で、写真の残りの部分を認識可能なままにしつつ、ある側面を確実に変更できるようになります。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

InstructPix2Pix 命令編集の未来

命令ベースの編集は画像ツールのデフォルトのインターフェイスになりつつあり、現在では主流のアプリや、MagicBrush や新興のマルチターン エディターなどの後継アプリに組み込まれています。細部の保存性の向上、「ランプを左に移動」などの空間命令の信頼性の高い処理、および 1 つのコマンドでクリップ全体を編集するビデオへのシームレスな拡張が期待されます。これらのモデルを言語エージェントと組み合わせることで、完全な編集セッションを会話形式で記述できるようになります。

現実世界の実装

ブロガーは、季節の投稿用に夏の風景写真のスキンを変更するために「秋の紅葉を追加」と入力します。

電子商取引の販売者は、「シャツの色をネイビーに変更してください」と指示して、製品のカラーバリエーションを一発で作成します。

教師は歴史的な写真を「これをカラー化」して編集し、白黒のアーカイブ画像をレッスン用に鮮やかにします。

ミーム作成者は、犬の顔を手動でマスクせずに「犬にサングラスをかける」ように命令します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InstructPix2Pix Instruction Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

DragGAN インタラクティブ編集

よくある質問

What is InstructPix2Pix Instruction Editing?

InstructPix2Pix を使用すると、「冬にする」や「猫を犬に変える」などの単純なコマンドを入力するだけで写真を編集できます。マスクや選択ツールは必要ありません。これは拡散モデルに編集指示に直接従うよう教えました。

InstructPix2Pix に何を変更するかをどのように指示しますか?

「冬にしてください」のような命令を入力するだけです。マスクや領域の選択は必要ありません。

InstructPix2Pix のトレーニング データはどのように作成されましたか?

著者らは、GPT-3 で生成されたキャプション ペアとプロンプトツープロンプト画像合成を組み合わせて、トリプルを自動的に構築しました。

InstructPix2Pix の 2 つのガイダンス スケールは何を制御しますか?

1 つのスケールは、編集が指示にどれだけ強く従うかを決定します。もう 1 つは、ソース画像をどの程度保持するかを制御します。

なぜモデルは画像の言及されていない部分を放置する傾向があるのでしょうか?

命令は特定の変更をターゲットとするため、モデルは命令で言及されていない領域を保存します。

InstructPix2Pix は編集を生成するために何回前方パスを必要としますか?

これは、画像と命令を組み合わせて編集を出力する単一の条件付き拡散モデルです。