视觉人工智能指南

文本倒装

文本反转通过学习一个新单词来教会图像生成器一个全新的概念,例如特定的猫、艺术风格或产品,而无需更改模型本身。

阅读时间:2分钟最后更新

概述

It lets you put your own subject into AI art using just 3-5 example photos.

深入探讨

研究人员于 2022 年推出的文本反转解决了一个个性化问题:当“狗”单独无法捕获它时,如何告诉稳定扩散这样的模型来绘制“你的”狗?它没有重新训练巨大的神经网络,而是冻结整个模型并学习一件事:一个新的“伪词”嵌入——文本编码器词汇表中的单个向量,通常写为 S*。你向它提供 3-5 个概念图像,优化就会推动该向量,直到模型在你输入新单词时可靠地再现主题。因为只学习了一个向量(几千字节),所以结果很小并且可以共享。然后,您可以编写诸如“S* 骑滑板、油画”之类的提示,该概念就会出现在新的上下文中。

技术洞察

诀窍在于,文本到图像模型在生成之前将每个单词转换为嵌入向量。文本反转向该嵌入表添加一个新向量并仅对其进行优化,在示例图像上使用相同的扩散去噪损失。梯度流回嵌入,同时所有模型权重保持冻结。结果是一个紧凑的向量(几 KB),存在于模型现有的词汇空间中 - 权重没有变化,因此基础模型保留了其所有先验知识。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

文本倒置的未来

文本反转因其微小的文件大小和可共享性而仍然很受欢迎,开源社区交易了数千个这样的嵌入。未来的方向是将其与其他方法相结合——堆叠多个学习的单词以获得更丰富的场景,与 LoRA 或 DreamBooth 相结合以获得更清晰的保真度,并将这一想法扩展到视频和 3D 生成器。期待“概念库”,用户可以在其中混合和匹配学习的标记,再加上更快、近乎即时的反转,因此个性化在几秒钟而不是几分钟内发生。

现实世界的实施

艺术家学习其标志性插画风格的标记,然后将其提示到数十个新场景中,以获得一致的作品集。

宠物主人上传五张他们的狗的照片,将其生成宇航员、文艺复兴时期的绘画或卡通画。

一个小型电子商务品牌学习了一个关于其产品的单词,这样它就可以在许多营销背景中呈现它,而无需拍摄照片。

游戏工作室捕获重复出现的角色的外观作为可重复使用的标记,以保持整个团队的概念艺术一致。

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Textual Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

空文本反转

常见问题

What is Textual Inversion?

文本反转通过学习一个新单词来教会图像生成器一个全新的概念,例如特定的猫、艺术风格或产品,而无需更改模型本身。它让您只需使用 3-5 张示例照片即可将自己的主题融入 AI 艺术中。

文本反转在训练过程中到底学到了什么?

它仅优化一个新的伪词嵌入向量,同时保持整个模型冻结。

文本反转通常需要大约多少个示例图像?

一小部分(通常是 3-5 个概念图像)就足以学习可用的标记。

为什么文本反转文件如此小(通常只有几千字节)?

仅保存单个嵌入向量,因此文件很小且易于共享。

在文本倒置训练期间什么保持不变?

基础模型被冻结;仅更新新的嵌入,因此保留了先验知识。

文本倒置后如何使用学到的概念?

您只需在普通文本提示中包含新标记(如 S*)即可召唤该概念。