視覺人工智慧指南

無分類器指導

無分類器指導是一種使擴散模型真正遵循您的提示的技術,用一些多樣性換取更強的依從性。

閱讀時間約2分鐘最後更新

概述

It is the single dial behind the 'guidance scale' slider in nearly every image generator.

深入探討

早期的引導擴散需要一個單獨的分類器將樣本推向所需的類別,這是脆弱的並且需要額外的訓練。 Jonathan Ho 和 Tim Salimans 在 2022 年提出的無分類器指導消除了這種依賴性。在訓練過程中,模型會在一定比例的時間內隨機丟棄條件(文字提示),因此它學會使用單一網路生成條件和無條件預測。在採樣時,您每步運行模型兩次,一次有提示,一次沒有提示,然後從無條件預測推斷到條件預測。外推的量是指導尺度:較高的值會強制更嚴格的即時依從性和更強的飽和度,而較低的值會提供更多的多樣性但更寬鬆的匹配。

技術洞察

從數學上講,引導雜訊預測是無條件預測加上引導尺度乘以條件預測和無條件預測之間的差異。 1 級表示沒有指導;典型值為 5 到 9。將比例推得很高會放大提示特徵,但會導致顏色過度飽和、對比度刺眼和偽影,因為模型的推論遠遠超出了其學習的分佈。每個去雜訊步驟大約需要兩次前向傳遞。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

無分類器指導的未來

研究人員正在完善指導,透過動態閾值、跨步驟改變強度的指導計劃以及重新調整技巧,以保持及時堅持而不會出現過度飽和。現在,精煉模型將指導烘焙到單次傳遞中,以將計算量減半,而更新的公式探索了根本不需要無條件分支的擾動注意力和自動指導,旨在以更低的成本獲得清晰、忠實的圖像。

現實世界的實施

調整「穩定擴散」或 Midjourney 中的「CFG 比例」滑桿,以平衡提示準確性和創造力

提高指導以強制生成器包含提示中描述的特定的、難以渲染的對象

在探索許多設計選項時,降低指導以獲得更多樣化、更少過飽和的輸出

調整生產流程中的指導計劃,以減少高細節渲染上的顏色燒傷偽影

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Classifier-Free Guidance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

樸素貝葉斯分類器

常見問題

What is Classifier-Free Guidance?

無分類器指導是一種使擴散模型真正遵循您的提示的技術,用一些多樣性換取更強的依從性。它是幾乎每個圖像生成器中“指導刻度”滑塊後面的單一轉盤。

無分類器指導的主要目的是什麼?

無分類器指導透過從無條件預測到有條件預測來提高及時的依從性。

模型如何學習對無分類器指導進行無條件預測?

在訓練過程中,提示有時會被隨機刪除,因此一個網路可以學習有條件和無條件的行為。

增加指導尺度一般有什麼作用?

更高的引導力迫使更緊密的黏附和更強大的功能,但過度引導會導致影像過飽和、粗糙、容易出現偽影。

標準無分類器指導大約需要每個去雜訊步驟多少次前向傳遞?

該模型在有提示的情況下運行一次,然後在沒有提示的情況下運行一次,然後組合預測,每個步驟大約需要兩次通過。

無分類器指導比分類器指導有什麼優勢?

透過使用單一網路進行兩個預測,它避免了舊的引導擴散所需的脆弱的額外分類器。