GLIGEN 接地一代
GLIGEN(接地语言到图像生成)可让您通过在文本提示旁边输入模型边界框和标签来精确控制对象在生成的图像中出现的位置。
概述
它将模糊的文本到图像转变为精确的、布局可控的合成。
深入探讨
标准的文本到图像模型在空间控制方面遇到了困难:要求“一只猫在狗的左边”,你经常会得到错误的位置。 GLIGEN 于 2023 年推出,通过添加基础输入(例如与文本或图像实体、关键点或参考图像配对的边界框)来解决此问题。至关重要的是,它冻结了原始预训练扩散模型的权重,并注入新的可训练门控自注意力层来吸收基础令牌。这意味着它建立在稳定扩散这样的模型上,而不会破坏其学到的知识,并且门控从接近零开始,因此基础模型的行为在训练早期得以保留。结果是开放世界的接地生成:您可以将任意描述的对象放置在指定位置,并且它概括为接地训练期间未见过的概念和布局。
技术洞察
GLIGEN 将每个基础实体表示为将其文本或图像嵌入与其空间信息相结合的标记,例如通过傅立叶特征编码的边界框的四个坐标。这些接地令牌通过位于现有自注意力和交叉注意力块之间的新插入的门控自注意力层进入冻结扩散 U-Net。初始化为零的可学习门控制接地对生成的影响程度,因此添加控制可以优雅地降级并且训练保持稳定。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
GLIGEN 接地一代的未来
接地且布局可控的发电正在成为生产工具的标准配置。预计 GLIGEN 风格的空间调节将与 ControlNet 和区域提示等其他控制方法相结合,并扩展到视频和 3D 领域,其中对象随时间和空间的放置更加重要。由于模型采用遵循指令的界面,拖放布局控制和语言指定的场景图将使精确的合成变得容易,而无需提示工程技巧。
现实世界的实施
使用边界框将徽标或产品放置在生成的广告的精确区域中
通过指定渲染前每个角色或对象的位置来构建复杂的场景
使用已知的地面实况框位置生成用于对象检测的训练数据
将所描述的对象修复到现有照片的用户绘制区域中
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GLIGEN Grounded Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是 GLIGEN 接地一代?
GLIGEN(接地语言到图像生成)可让您通过在文本提示旁边输入模型边界框和标签来精确控制对象在生成的图像中出现的位置。它将模糊的文本到图像转变为精确的、布局可控的合成。
GLIGEN主要解决什么问题?
GLIGEN 添加了诸如边界框之类的接地输入,因此您可以准确控制对象的放置位置,而纯文本提示对此处理不佳。
GLIGEN 如何保存预训练扩散模型的知识?
GLIGEN 冻结基础模型并注入新的门控自注意力层,因此原始学习的知识保持不变。
GLIGEN 接受的典型接地输入是什么?
GLIGEN 支持通过带有文本/图像实体、关键点和参考图像的边界框进行接地。
为什么 GLIGEN 新注意力层中的门初始化为零?
零初始化门意味着接地最初没有影响,保留原始模型并在控制加强时保持训练稳定。
GLIGEN 中“开放世界”接地一代意味着什么?
GLIGEN 的推广超越了其基础训练集,将新颖的描述对象放置在指定位置。