视觉人工智能指南

基于分数的生成模型

基于分数的生成模型通过学习数据分布的梯度来创建数据——该方向使任何噪声样本看起来更像真实数据。

阅读时间:2分钟最后更新

概述

This score-function view unifies diffusion models with stochastic differential equations and underpins many modern image generators.

深入探讨

基于分数的模型不是直接对概率进行建模,而是学习分数:对数概率密度相对于输入的梯度。知道以何种方式推动样本以增加其可能性就足以生成新数据。 Yang Song 和 Stefano Ermon 在 2019 年的工作中训练了一个网络,使用去噪得分匹配来估计多个噪声级别的得分,然后使用 Langevin 动力学生成样本——沿着得分重复步进并添加一点噪声。他们的 2021 年得分 SDE 论文表明,扩散模型和基于得分的模型是由随机微分方程描述的同一连续过程的两个方面。至关重要的是,每个 SDE 都有一个相应的确定性“概率流”ODE,它共享相同的边际,从而实现精确的似然和快速采样。

技术洞察

在数据稀疏的情况下,直接估计干净数据的分数是很困难的,因此该模型是在多个尺度上受高斯噪声扰动的数据上进行训练的。去噪得分匹配给出了一个易于处理的目标:加噪分布的得分等于噪声方向除以噪声方差,因此预测噪声和预测得分本质上是同一件事。采样从纯高斯噪声开始求解逆时 SDE(或等效概率流 ODE)。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

基于分数的生成模型的未来

分数 SDE 框架是生成式 AI 大部分进步背后的理论引擎。更快的数值求解器、更好的噪声调度和概率流 ODE 正在实现近实时生成和精确的可能性评估。同样的分数匹配理念正在从图像扩展到音频、分子和蛋白质结构设计、点云和科学模拟,而一致性和流程匹配模型直接建立在这些连续时间的基础上,将生成缩减到几个步骤。

现实世界的实施

噪声条件评分网络 (NCSN) 通过 Langevin 动力学遵循学习的评分梯度来生成逼真的面孔。

医学图像重建,例如加速 MRI,其中学习的分数充当填充欠采样扫描数据的先验。

药物发现中的分子和蛋白质结构生成,通过基于评分的扩散建模 3D 原子构型。

音频波形合成,其中乐谱模型对干净的语音或音乐进行降噪,就像在基于扩散的声码器中一样。

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Score-Based Generative Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

基于能量的模型

常见问题

What is Score-Based Generative Models?

基于分数的生成模型通过学习数据分布的梯度来创建数据——该方向使任何噪声样本看起来更像真实数据。这种得分函数视图将扩散模型与随机微分方程统一起来,并为许多现代图像生成器提供了基础。

这些模型学习的“分数”到底是多少?

分数是日志数据密度相对于输入的梯度——它指向增加样本可能性的方向。

为什么基于评分的模型要在多个尺度上用被噪声破坏的数据进行训练?

在低密度地区,真实分数的定义不明确;具有多个噪声级别的扰动数据使得分数匹配在任何地方都易于处理。

早期基于评分的模型使用哪种采样程序来生成数据?

Langevin Dynamics 反复朝乐谱方向移动样本并注入小噪声,逐渐将随机噪声转化为真实数据。

2021年的分数-SDE论文建立了哪些主要联系?

宋等人。随机微分方程框架下的统一扩散和基于评分的模型,具有匹配的确定性概率流 ODE。

预测噪声与预测去噪分数匹配中的分数有何关系?

去噪得分匹配显示得分等于负噪声除以噪声方差,使得​​噪声预测和得分预测实际上具有相同的目标。