潜在一致性模型
潜在一致性模型 (LCM) 是一种让扩散图像生成器只需一到四个步骤(而不是通常的几十个步骤)即可生成高质量图片的技术。
概述
它们使得即使在较小的硬件上,几乎实时的交互式图像生成变得实用。
深入探讨
标准潜在扩散模型(例如稳定扩散)从噪声和去噪迭代开始,通常需要 20 到 50 次网络评估才能生成一张图像,速度很慢。 Luo 及其同事于 2023 年推出的 LCM 在预训练扩散模型的潜在空间中应用了一致性蒸馏。关键思想:训练学生网络从去噪轨迹上的任何点直接跳转到干净的结果,这样通过一个大步骤就可以达到之前需要许多小步骤的相同答案。大约 1 到 4 步即可获得清晰的图像。配套技术 LCM-LoRA 将这种加速打包为一个小型插件适配器,可以将其放入现有的微调稳定扩散模型中,而无需重新训练整个网络。
技术洞察
一致性模型强制执行“自一致性”属性:同一去噪路径(概率流 ODE 轨迹)上的任何两点必须映射到相同的最终干净图像。学生从教师扩散模型中提炼出来以满足这一点,学习直接预测轨迹的终点。在压缩的潜在空间而不是像素中工作使得蒸馏成本较低。由于一次评估可以跨越轨迹,因此繁重的迭代采样会分解为几个步骤。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
潜在一致性模型的未来
少步生成现已成为主流,SDXL-Turbo、LCM 改进和对抗性蒸馏方法等后继者将质量提高到一到两步。预计这将为手机上的实时、即刷式图像编辑、实时视频帧生成和设备上生成提供支持。该前沿技术正在通过完整的多步骤扩散来缩小微小的质量差距,并将一致性蒸馏扩展到视频和 3D,其中通过减少步骤数所节省的成本甚至更加惊人。
现实世界的实施
实时画布工具可在您键入或绘制草图时更新生成的图像,延迟几乎为零
在不到一秒的时间内在笔记本电脑或手机 GPU 上运行稳定的扩散图像生成
将 LCM-LoRA 适配器放到现有的微调模型上,无需重新训练即可立即加速
通过将步骤从约 30 个减少到约 4 个,以低成本生成大批量图像以进行设计探索
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Consistency Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是潜在一致性模型?
潜在一致性模型 (LCM) 是一种让扩散图像生成器只需一到四个步骤(而不是通常的几十个步骤)即可生成高质量图片的技术。即使在普通的硬件上,它们也可以实现近乎实时的交互式图像生成。
与标准潜在扩散相比,潜在一致性模型的主要优点是什么?
LCM 将标准扩散的许多降噪步骤压缩为大约一到四个,从而实现近实时生成。
一致性模型强制执行什么“自我一致性”属性?
一致性意味着沿相同概率流 ODE 轨迹的点都映射到相同的最终干净输出。
LCM 在什么空间进行蒸馏?
正如稳定扩散所做的那样,在潜在空间中操作可以提高一致性蒸馏的效率。
LCM-LoRA 能让您做什么?
LCM-LoRA 将加速打包为一个轻量级适配器,可放置到现有的微调稳定扩散模型上。
一致性模型如何实现少步生成?
学生网络经过精炼,可以一次性预测去噪轨迹的终点,而不是多次小步。