Muse 蒙面生成成像
Muse 是来自 Google 的文本到图像模型,它通过一次性填充蒙版图像标记来生成图片,使其比逐步扩散快得多。
概述
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
深入探讨
Muse 在图像的离散标记空间中工作。预训练的 VQGAN 将图片转换为整数标记网格,就像视觉构建块的词汇表一样。在训练过程中,这些标记的很大一部分被屏蔽掉,而 Transformer 会根据冻结的大型语言模型 (T5-XXL) 的文本嵌入来学习预测它们。在生成时,Muse 从全屏蔽网格开始并并行解码,每一步预测许多标记并重新屏蔽最不可信的标记。两阶段设计首先产生低分辨率标记网格,然后超分辨率模型填充更高分辨率的网格。由于数十个令牌同时解析,因此 900M 和 3B 参数模型只需几次前向传递即可生成 256 或 512 像素图像。
技术洞察
核心技巧是使用基于置信度的重新屏蔽进行并行解码,通常称为 MaskGIT 式采样。 Muse 不是一次预测一个标记(自回归)或数百次去噪(扩散),而是预测所有屏蔽标记,保留最有信心的标记,并在下一轮重新屏蔽其余标记。使用冻结的 T5-XXL 文本编码器可以免费提供强大的语言理解,并且对离散标记进行操作可以让模型对图像的推理更像单词。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
Muse Masked 生成成像的未来
屏蔽并行解码指向高质量和真正快速的生成器,这对于交互式编辑和设备上使用至关重要。预计标记预测的想法将与扩散和自回归视频方法相结合,并支持即时修复、覆盖和无掩模编辑。随着离散分词器的改进,掩模成像可以干净地扩展到视频和 3D,其中并行解码可以极大地降低生成许多帧或视图的成本。
现实世界的实施
快速概念艺术和情绪板,艺术家需要在几秒钟而不是几分钟内进行许多图像变化。
零镜头修复,例如移除对象并让模型填充与周围环境一致的遮罩区域。
外涂,将照片延伸到其原始边界之外,以显示横幅或不同的纵横比。
无遮罩编辑,例如通过编辑文本提示并重新解码受影响的标记来将狗的颜色或天空更改为日落。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Muse Masked Generative Imaging?
Muse 是来自 Google 的文本到图像模型,它通过一次性填充蒙版图像标记来生成图片,使其比逐步扩散快得多。这很重要,因为它表明您可以获得高质量、对齐良好的图像,而无需大多数生成器所依赖的缓慢迭代去噪。
Muse 在生成过程中预测什么而不是对像素进行去噪?
Muse 在离散令牌空间中运行,预测由 VQGAN 令牌生成器生成的屏蔽图像令牌,而不是直接处理像素。
为什么 Muse 通常比标准扩散模型更快?
Muse 同时填充许多屏蔽标记,并且只需要少量的解码轮次,这与扩散的许多顺序去噪步骤不同。
Muse 从哪里获得对文本提示的理解?
Muse 条件是根据冻结的预训练 T5-XXL 语言模型生成文本嵌入,从而赋予其强大的语言理解能力。
基于置信度的重新屏蔽在 Muse 中的作用是什么?
每次并行预测后,Muse 都会保留最有信心的标记,并重新屏蔽最不自信的标记,以便在连续的轮次中进行改进。
Muse 如何处理生成更高分辨率的图像?
Muse 首先生成一个低分辨率的令牌网格,然后第二个超分辨率模型生成一个更高分辨率的令牌网格。