Görsel Yapay Zeka KILAVUZU

Gizli Difüzyon Modelleri

Gizli yayılma modelleri, yayılma sürecini ham pikseller yerine sıkıştırılmış bir gizli alanda çalıştırarak görüntüler oluşturur ve işlem maliyetlerini azaltır.

2 min readSon güncelleme

Genel Bakış

They are the engine behind Stable Diffusion and most modern open-source image generators.

Derin Dalış

Standart bir yayılma modeli, gürültü oluşturma sürecini tersine çevirmeyi öğrenir: saf gürültüden başlar ve yavaş yavaş bir görüntüye dönüşür. Bunu doğrudan pikseller üzerinde yapmak pahalıdır çünkü 512x512 boyutunda bir görüntü yüzbinlerce değere sahiptir. Rombach ve meslektaşları tarafından 2022'de tanıtılan gizli difüzyon, ilk olarak bir görüntüyü küçük bir gizli ızgaraya (genellikle 64x64x4, kabaca 48 kat daha küçük) sıkıştırmak için önceden eğitilmiş bir değişken otomatik kodlayıcı (VAE) kullanır. Difüzyon U-Net daha sonra çapraz dikkat yoluyla metinlerin rehberliğinde bu kompakt gizli alanın içindeki gürültüyü gidermeyi öğrenir. Son olarak VAE kod çözücü tam çözünürlüklü pikselleri yeniden oluşturur. Bu algısal sıkıştırma, algılanamayan ayrıntıları atarken semantik olarak anlamlı bilgileri korur ve tüketici GPU'larında yüksek kaliteli oluşturmayı mümkün kılar.

Teknik Bilgi

Anahtar nokta, algısal sıkıştırmayı üretken modellemeden ayırmaktır. VAE, yüksek frekanslı piksel ayrıntısını bir kez ele alır ve U-Net yalnızca düşük boyutlu gizli dağılımı modeller. Metin koşullandırma, U-Net'in uzamsal özelliklerinin CLIP gibi bir metin kodlayıcıdan gelen belirteç yerleştirmeleriyle ilgilendiği çapraz dikkat katmanları aracılığıyla enjekte edilir. Gizli öğeler piksellerden kabaca 48 kat daha küçük olduğundan, gürültü giderme adımlarının her biri hem bellek hem de FLOP açısından önemli ölçüde daha ucuzdur.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Gizli Yayılım Modellerinin Geleceği

Gizli yayılma, görüntülerin ötesine geçerek videoya (Kararlı Video Yayılımı), 3D varlıklara ve ses spektrogramlarına doğru genişliyor ve bunların tümü aynı sıkıştır-sonra-gürültü giderme tarifini kullanıyor. Araştırma, damıtma ve tutarlılık modelleri, ince metinleri ve yüzleri koruyan daha iyi VAE'ler ve daha hızlı, daha keskin sonuçlar için üretim yörüngesini düzleştiren Stable Diffusion 3'teki gibi düzeltilmiş akış formülasyonları yoluyla daha az örnekleme adımına doğru ilerliyor.

Gerçek Dünya Uygulaması

Tek bir tüketici GPU'sunda metin istemlerinden çizim ve konsept tasarımları oluşturan Kararlı Yayılım

Adobe ve Canva, gizli yayılma omurgaları üzerine kurulu metinden görüntüye ve üretken doldurma özelliklerini güçlendiriyor

Ön prodüksiyonu hızlandırmak için doku haritaları, hareketli görüntüler ve ortam konsept çizimleri üreten oyun stüdyoları

Fotoğraf çekimi olmadan markaya özel ürün maketleri ve reklam görselleri oluşturan stok görsel ve pazarlama ekipleri

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Video Yayılım Modelleri

Sık sorulan sorular

What is Latent Diffusion Models?

Gizli yayılma modelleri, yayılma sürecini ham pikseller yerine sıkıştırılmış bir gizli alanda çalıştırarak görüntüler oluşturur ve işlem maliyetlerini azaltır. Bunlar, Stabil Difüzyonun ve çoğu modern açık kaynaklı görüntü oluşturucunun arkasındaki motordur.

Gizli yayılma modellerinin piksel alanı yayılımına kıyasla ana yeniliği nedir?

Gizli difüzyon, bir VAE kullanarak görüntüleri daha küçük bir gizli alana sıkıştırır, böylece pahalı gürültü giderme, tam piksellerden çok daha az değerde gerçekleşir.

Hangi bileşen görüntüyü gizli alana sıkıştırır ve daha sonra yeniden yapılandırır?

Önceden eğitilmiş bir VAE, görüntüyü kompakt bir gizli ızgaraya kodlar ve kod çözücüsü, sonunda tam çözünürlüklü pikselleri yeniden oluşturur.

Gizli yayılmada metin tipik olarak gürültü giderici U-Net'e nasıl enjekte edilir?

Bir metin kodlayıcıdan gelen simge yerleştirmeleri, çapraz dikkat katmanlarına beslenerek, uzamsal özelliklerin istemle ilgilenmesine olanak tanır.

Gizli alanda çalışmak neden hesaplama maliyetini azaltır?

Bekle — doğru neden, gizli ızgaranın piksel görüntüsünden çok daha küçük olmasıdır (genellikle ~48x), dolayısıyla her gürültü giderme adımı çok daha az FLOP'a ve belleğe ihtiyaç duyar.

Yaygın olarak kullanılan hangi açık kaynak modeli gizli yayılmayı popüler hale getirdi?

2022'de piyasaya sürülen Stable Diffusion, tüketici donanımına gizli bir yayılma ve kitlesel benimseme getirdi.