視覺人工智慧指南

提示到提示交叉注意編輯

Prompt-to-Prompt 透過調整文字提示來編輯產生的圖像,同時重複使用模型的內部注意力圖,因此更改一個單字會交換該元素,同時保持場景的其餘部分完好無損。

閱讀時間約2分鐘最後更新

概述

It is editing through words, not pixels.

深入探討

Prompt-to-Prompt(Hertz et al., 2022)是一種用於擴散模型中文字驅動編輯的免訓練技術。關鍵的見解是交叉注意力圖,它告訴模型每個單字應該影響哪些圖像區域,並對場景的空間佈局進行編碼。當您使用稍微修改過的提示重新產生影像時,此方法會將原始提示的注意力圖注入到新的運行中。將“自行車”替換為“摩托車”,可以交換該對象,同時保留構圖和背景。添加單字只會為未更改的標記注入註意力,因此會出現一個新屬性,而無需重新調整所有內容。您也可以重新調整令牌的注意力以增強或削弱其效果。因為它不需要微調或掩模,所以它成為許多後來的編輯方法的基礎構建塊,包括 InstructPix2Pix 的數據生成。

技術洞察

在去雜訊過程中,交叉注意力為每個標記計算它在影像中出現的位置的空間圖。 Prompt-to-Prompt 將這些地圖從原始生成複製到編輯後的共享令牌中。對於單字交換,它在相應的標記之間映射注意力;對於添加的單詞,它保留舊的地圖,只讓新的標記形成新的關注;重新加權只是縮放令牌的注意力值,增強或減弱其視覺影響力。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

提示到提示交叉注意力編輯的未來

交叉注意力操縱現在支撐了整個可控生成工具系列,並且這些想法擴展到新架構中的注意力控制和視訊擴散以實現時間一致的編輯。期望透過反轉與真實影像編輯更緊密地集成,對大型結構變化進行更穩健的處理,並與指令模型相結合,以便注意力技巧在簡單的自然語言介面下隱形運行。

現實世界的實施

設計師將“街道上的紅色汽車”更改為“街道上的藍色汽車”,並保持完全相同的場景佈局。

一位插畫家重新調整了「雪」這個詞的重量,使不同變化的風景逐漸變得更加寒冷。

講故事的人在提示中將“獅子”換成“老虎”,以保持角色表的相同姿勢和背景。

研究人員使用它來產生配對的前後圖像作為遵循指令的編輯器的訓練資料。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt-to-Prompt Cross-Attention Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

交叉注意力

常見問題

What is Prompt-to-Prompt Cross-Attention Editing?

Prompt-to-Prompt 透過調整文字提示來編輯產生的圖像,同時重複使用模型的內部注意力圖,因此更改一個單字會交換該元素,同時保持場景的其餘部分完好無損。它是透過文字而不是像素進行編輯。

Prompt-to-Prompt 重複使用哪些內部資訊來保留場景?

交叉注意力圖對每個單字影響圖像的位置進行編碼,因此重複使用它們可以在編輯過程中保持佈局一致。

Prompt-to-Prompt 是否需要對模型進行微調?

它在推理時操縱注意力,不需要額外的訓練。

重新調整代幣注意力的權重可以達到什麼目的?

縮放代幣的注意力值會增強或減弱該概念出現的強度。

為什麼提示到提示被視為基礎技術?

其無需訓練的注意力操縱成為隨後的編輯研究中重複使用的基石。