視覺人工智慧指南

InstructPix2Pix 指令編輯

InstructPix2Pix 讓您可以透過輸入簡單的命令(例如「讓它成為冬天」或「把貓變成狗」)來編輯照片,無需遮罩或選擇工具。

閱讀時間約2分鐘最後更新

概述

它教導一個擴散模型,直接遵循剪輯指示。

深入探討

InstructPix2Pix(Brooks 等人,2023)是一種擴散模型,經過微調,可以獲取輸入圖像和文字指令,並在單次前向傳遞中輸出編輯後的圖像。它的巧妙技巧在於訓練數據:作者使用 GPT-3 生成前後字幕對,然後使用具有穩定擴散的 Prompt-to-Prompt 來合成匹配的前後圖像對。這為他們提供了一個大型資料集(原始圖像、指令、編輯圖像)三元組來進行訓練,所有這些都無需手動標記。由於指令描述的是變化而不是完整的場景,因此模型保留了圖像中未提及的部分。它使用兩種指導尺度,一種衡量它遵循指令的程度,另一種衡量它對原始圖像的忠實程度,讓使用者在編輯強度和保真度之間進行權衡。

技術洞察

模型以來源影像和指令為條件,沿兩個軸應用無分類器引導。一個尺度對文字指令進行加權,另一個對輸入影像進行加權。提高圖像比例可以保持原始內容的完整性,而提高文字比例可以使編輯更加激進。這種雙重指導使得單一通用指令能夠可靠地改變一個方面,同時使照片的其餘部分保持可識別性。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

InstructPix2Pix 指令編輯的未來

基於指令的編輯正在成為圖像工具的預設介面,現在已融入主流應用程式和 MagicBrush 等後續應用程式以及新興的多輪編輯器中。期望更好地保留精細細節,可靠地處理“向左移動燈”等空間指令,以及無縫擴展到視頻,其中一個命令即可編輯整個剪輯。將這些模型與語言代理耦合可以讓您以對話方式描述完整的編輯會話。

現實世界的實施

一位部落客輸入“添加秋葉”,為季節性帖子重新設計夏季風景照片。

一位電子商務賣家指示“將襯衫顏色更改為海軍藍”,以便一次生成產品顏色變體。

一位老師使用「為這張照片上色」來編輯一張歷史照片,使黑白檔案影像在課堂上變得生動。

迷因創建者命令“給狗戴上太陽眼鏡”,而無需手動遮蓋狗的臉。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InstructPix2Pix Instruction Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

DragGAN 互動式編輯

常見問題

什麼是 InstructPix2Pix 教學編輯?

InstructPix2Pix 讓您可以透過輸入簡單的命令(例如「讓它成為冬天」或「把貓變成狗」)來編輯照片,無需遮罩或選擇工具。它教導擴散模型直接遵循編輯指令。

您如何告訴 InstructPix2Pix 要更改哪些內容?

您只需輸入“讓它過冬”之類的指令即可;不需要掩模或區域選擇。

InstructPix2Pix 的訓練資料是如何建立的?

作者將 GPT-3 產生的字幕對與 Prompt-to-Prompt 影像合成結合,自動建立三元組。

InstructPix2Pix 的兩個引導標尺控制什麼?

一個等級決定了編輯遵循指令的程度;另一個控制保留多少來源影像。

為什麼模型傾向於忽略圖像中未提及的部分?

指令針對特定更改,因此模型保留指令未提及的區域。

InstructPix2Pix 需要多少次前向傳播才能產生編輯?

它是一個單一的條件擴散模型,將圖像和指令結合在一起並輸出編輯。