視覺人工智慧指南

擴散變壓器

Diffusion Transformers (DiTs) 將影像和視訊產生器核心的捲積 U-Net 替換為 Transformer 主幹。

閱讀時間約2分鐘最後更新

概述

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

深入探討

擴散模型透過從純雜訊開始並迭代地將其去雜訊成連貫的圖片來產生影像。多年來,進行去噪的網路一直是 U-Net,一種卷積架構。 Peebles 和 Xie 在 2022 年推出的 Diffusion Transformer 用 Transformer 取代了 U-Net。圖像首先被壓縮到潛在空間中,分成小塊,每個塊變成一個標記,就像語言模型中的單字一樣。然後,Transformer 在每個去雜訊步驟中透過自註意力處理這些標記。一個重要的發現是,當您遵循乾淨的縮放法則增加模型大小並減少補丁大小時,DiT 效能可預測地提高。這種可擴展性就是文字到視訊和高端文字到圖像系統大部分遷移到 Transformer 主幹的原因。

技術洞察

核心創新是 DiT 如何注入時間步長和文字提示等條件。他們使用自適應層歸一化 (adaLN),而不是簡單的串聯,其中網路根據調節訊號預測歸一化層的尺度和移位參數。 adaLN-zero 變體初始化這些,因此每個區塊都作為恆等函數啟動,從而穩定訓練。補丁被展平為令牌,由具有自註意力的標準 Transformer 區塊進行處理,然後重新組裝並解碼回像素。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

擴散變壓器的未來

擴散變壓器正在成為生成媒體的預設支柱。它們基於代幣的設計使它們能夠自然地在一個可擴展架構下統一圖像、視訊甚至多模式生成。研究正在推動更長的影片、更高解析度和更有效的注意力,以控制許多代幣的二次成本。預計語言和視覺模型之間會融合,類似的 Transformer 擴展方法和基礎設施可以同時服務這兩種模型,從而加速世界模型和互動式視訊的進步。

現實世界的實施

OpenAI 的 Sora 使用時空補丁上的 Transformer 主幹,根據文字提示產生一分鐘長的高保真影片。

Stable Diffusion 3 採用多模態 Diffusion Transformer (MMDiT) 來更好地將生成的圖像與詳細的文字描述對齊。

研究人員將 DiT 擴展到數十億個參數,並觀察到影像品質可預測地改善,從而指導計算預算決策。

工作室使用基於 DiT 的模型來擴展短片,將額外的視訊幀視為附加的補丁標記來降噪。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

空間變換網絡

常見問題

What is Diffusion Transformers?

Diffusion Transformers (DiTs) 將影像和視訊產生器核心的捲積 U-Net 替換為 Transformer 主幹。該架構為 Stable Diffusion 3 和 OpenAI 的 Sora 等領先系統提供支持,隨著計算量的增加,它的擴展性非常好。

與傳統擴散模型相比,擴散變壓器取代了哪些組件?

DiT 以 Transformer 主幹取代了 U-Net(執行去噪功能的捲積網路)。

DiT 如何將影像轉換為 Transformer 可以處理的內容?

潛在圖像被分成小塊,每個塊成為一個令牌,類似語言模型中的單字。

最初的 DiT 論文對於縮放有什麼發現?

當您增加模型計算量並使用較小的補丁並遵循縮放法則時,DiT 品質會以乾淨、可預測的方式提高。

DiT 通常如何注入時間步長和文字提示等條件?

DiT 使用自適應層歸一化來根據調節訊號預測歸一化層的尺度和移位參數。

“adaLN-zero”初始化完成什麼作用?

adaLN-zero 初始化調製,因此每個區塊最初都充當身份,從而穩定並改善訓練。