視覺人工智慧指南

基於分數的生成模型

基於分數的生成模型透過學習資料分佈的梯度來創建資料——該方向使任何雜訊樣本看起來更像真實資料。

閱讀時間約2分鐘最後更新

概述

This score-function view unifies diffusion models with stochastic differential equations and underpins many modern image generators.

深入探討

基於分數的模型不是直接對機率進行建模,而是學習分數:對數機率密度相對於輸入的梯度。知道以何種方式推動樣本以增加其可能性就足以產生新數據。 Yang Song 和 Stefano Ermon 在 2019 年的工作中訓練了一個網絡,使用去噪得分匹配來估計多個噪聲級別的得分,然後使用 Langevin 動力學生成樣本——沿著得分重複步進並添加一點噪聲。他們的 2021 年得分 SDE 論文表明,擴散模型和基於得分的模型是由隨機微分方程描述的同一連續過程的兩個方面。至關重要的是,每個 SDE 都有一個相應的確定性「機率流」ODE,它共享相同的邊際,從而實現精確的似然和快速採樣。

技術洞察

在資料稀疏的情況下,直接估計乾淨資料的分數是很困難的,因此該模型是在多個尺度上受高斯雜訊擾動的資料上進行訓練的。去雜訊得分匹配給出了一個易於處理的目標:加噪分佈的得分等於雜訊方向除以雜訊方差,因此預測雜訊和預測分數本質上是同一件事。取樣從純高斯雜訊開始求解逆時 SDE(或等效機率流 ODE)。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

基於分數的生成模型的未來

分數 SDE 框架是生成式 AI 大部分進步背後的理論引擎。更快的數值求解器、更好的雜訊調度和機率流 ODE 正在實現近實時生成和精確的可能性評估。同樣的分數匹配概念正在從影像擴展到音訊、分子和蛋白質結構設計、點雲和科學模擬,而一致性和流程匹配模型直接建立在這些連續時間的基礎上,將生成縮減到幾個步驟。

現實世界的實施

噪音條件評分網 (NCSN) 透過 Langevin 動力學遵循學習的評分梯度來產生逼真的臉。

醫學影像重建,例如加速 MRI,其中學習的分數充當填充欠採樣掃描資料的先驗。

藥物發現中的分子和蛋白質結構生成,透過基於評分的擴散建模 3D 原子構型。

音頻波形合成,其中樂譜模型對乾淨的語音或音樂進行降噪,就像在基於擴散的聲碼器中一樣。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Score-Based Generative Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

基於能量的模型

常見問題

What is Score-Based Generative Models?

基於分數的生成模型透過學習資料分佈的梯度來創建資料——該方向使任何雜訊樣本看起來更像真實資料。這種得分函數視圖將擴散模型與隨機微分方程統一起來,並為許多現代圖像生成器提供了基礎。

這些模型學習的「分數」到底是多少?

分數是日誌資料密度相對於輸入的梯度——它指向增加樣本可能性的方向。

為什麼基於評分的模型要在多個尺度上用被雜訊破壞的資料來訓練?

在低密度地區,真實分數的定義不明確;具有多個雜訊等級的擾動資料使得分數匹配在任何地方都易於處理。

早期基於評分的模型使用哪一種取樣程序來產生資料?

Langevin Dynamics 反覆朝樂譜方向移動樣本並注入小噪聲,逐漸將隨機噪聲轉化為真實數據。

2021年的分數-SDE論文建立了哪些主要連結?

宋等人。隨機微分方程框架下的統一擴散和基於評分的模型,具有匹配的確定性機率流 ODE。

預測雜訊與預測去雜訊分數匹配中的分數有何關係?

去噪得分匹配顯示得分等於負雜訊除以雜訊方差,使得​​雜訊預測和得分預測實際上具有相同的目標。