Stable Diffusion
Stable Diffusion 是 Stability AI 於 2022 年發布的開源文字到影像模型,透過從隨機起點逐漸去除雜訊來產生圖片。
概述
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
深入探討
擴散模型學習逆轉噪音過程。訓練時,真實影像逐步添加隨機噪聲,直到變為靜態;該模型學會預測並減去該噪聲。為了生成,它從純噪聲開始,並在文字提示的引導下反覆去噪,直到出現連貫的圖像。穩定擴散的關鍵效率技巧是「潛在」部分:它不是處理全解析度像素,而是使用變分自動編碼器將影像壓縮到更小的潛在空間,在那裡運行緩慢的去噪,然後解碼回像素。這就是為什麼它可以在典型的遊戲 GPU 而不是資料中心上運行。文字編碼器(早期版本中的 CLIP)將提示轉換為指導,U-Net 進行去噪。其開放權重支援 ControlNet、LoRA 微調和無數創意工具。
技術洞察
穩定擴散是一種潛在擴散模型。自動編碼器將 512x512 影像縮小為緊湊的潛在網格,從而大大減少計算量。 U-Net 被訓練來預測每個時間步驟添加的噪聲,並透過交叉注意以文字嵌入為條件。無分類器指導可讓您透過混合條件和無條件預測來調節影像遵循提示的程度。在推理時,採樣器(例如 DDIM 或 Euler)採用選定數量的去噪步驟;更多的步驟通常意味著更乾淨的結果,但代價是速度。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
穩定擴散的未來
開放生態系統不斷加速:更新的架構(包括基於變壓器的擴散和更快的幾步或蒸餾採樣器)將生成從幾十步減少到一到兩步,從而實現近實時創建。期待更強大的文字渲染、更好的提示依從性、無縫圖像編輯以及視訊和 3D 擴充。開放權重將繼續推動專門的微調,但它們也加劇了關於訓練資料同意、深度偽造和水印的爭論,因此檢測和來源工具將與模型一起發展。
現實世界的實施
藝術家和愛好者透過自訂 LoRA 微調在自己的 GPU 上本地生成概念藝術和插圖
使用 ControlNet 來約束具有姿勢骨架、深度圖或邊緣草圖的生成,以實現精確合成
修復和修復以編輯照片、刪除物件或將場景擴展到其原始邊界之外
獨立遊戲工作室和設計師快速、廉價地製作紋理、情緒板和資產變體
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Stable Diffusion?
Stable Diffusion 是 Stability AI 於 2022 年發布的開源文字到影像模型,透過從隨機起點逐漸去除雜訊來產生圖片。它開放並可在消費級 GPU 上運行,引發了一個龐大的工具、微調和應用程式社群。
從較高的層面來看,擴散模型如何產生影像?
擴散模型學習逆轉雜訊過程:從雜訊開始,迭代地去噪,直到出現連貫的影像。
是什麼讓穩定擴散夠高效,可以在消費級 GPU 上運作?
穩定擴散是一種潛在擴散模型:自動編碼器壓縮影像,以便在較小的潛在空間中進行大量去噪。
您的文字提示如何影響生成的圖像?
文字編碼器將提示轉換為嵌入,透過交叉注意力調節 U-Net,從而引導結果。
無分類器指導可以讓您控制什麼?
無分類器指導混合了條件和無條件預測,讓您可以提高或降低即時依從性。
為什麼 Stable Diffusion 會引發 ControlNet 和 LoRA 等如此龐大的工俱生態系統?
開放權重讓社群可以微調和擴展模型,產生 ControlNet 和輕量級 LoRA 適配器等附加元件。