提示到提示交叉注意编辑
Prompt-to-Prompt 通过调整文本提示来编辑生成的图像,同时重用模型的内部注意力图,因此更改一个单词会交换该元素,同时保持场景的其余部分完好无损。
概述
It is editing through words, not pixels.
深入探讨
Prompt-to-Prompt(Hertz et al., 2022)是一种用于扩散模型中文本驱动编辑的免训练技术。关键的见解是交叉注意力图,它告诉模型每个单词应该影响哪些图像区域,对场景的空间布局进行编码。当您使用稍微修改过的提示重新生成图像时,该方法会将原始提示的注意力图注入到新的运行中。将“自行车”替换为“摩托车”,可以交换该对象,同时保留构图和背景。添加单词只会为未更改的标记注入注意力,因此会出现一个新属性,而无需重新调整所有内容。您还可以重新调整令牌的注意力以增强或削弱其效果。因为它不需要微调或掩模,所以它成为许多后来的编辑方法的基础构建块,包括 InstructPix2Pix 的数据生成。
技术洞察
在去噪过程中,交叉注意力为每个标记计算它在图像中出现的位置的空间图。 Prompt-to-Prompt 将这些地图从原始生成复制到编辑后的共享令牌中。对于单词交换,它在相应的标记之间映射注意力;对于添加的单词,它保留旧的地图,只让新的标记形成新的关注;重新加权只是缩放令牌的注意力值,增强或减弱其视觉影响力。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
提示到提示交叉注意力编辑的未来
交叉注意力操纵现在支撑了整个可控生成工具系列,并且这些想法扩展到新架构中的注意力控制和视频扩散以实现时间一致的编辑。期望通过反转与真实图像编辑更紧密地集成,对大型结构变化进行更稳健的处理,并与指令模型相结合,以便注意力技巧在简单的自然语言界面下隐形运行。
现实世界的实施
设计师将“街道上的红色汽车”更改为“街道上的蓝色汽车”,并保持完全相同的场景布局。
一位插画家重新调整了“雪”这个词的重量,使不同变化的风景逐渐变得更加寒冷。
讲故事的人在提示中将“狮子”换成“老虎”,以保持角色表的相同姿势和背景。
研究人员使用它生成配对的前后图像作为遵循指令的编辑器的训练数据。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prompt-to-Prompt Cross-Attention Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Prompt-to-Prompt Cross-Attention Editing?
Prompt-to-Prompt 通过调整文本提示来编辑生成的图像,同时重用模型的内部注意力图,因此更改一个单词会交换该元素,同时保持场景的其余部分完好无损。它是通过文字而不是像素进行编辑。
Prompt-to-Prompt 重用哪些内部信息来保留场景?
交叉注意力图对每个单词影响图像的位置进行编码,因此重用它们可以在编辑过程中保持布局一致。
Prompt-to-Prompt 是否需要对模型进行微调?
它在推理时操纵注意力,不需要额外的训练。
重新调整代币注意力的权重可以实现什么目的?
缩放代币的注意力值会增强或减弱该概念出现的强度。
为什么提示到提示被视为基础技术?
其无需训练的注意力操纵成为随后的编辑研究中重复使用的基石。