Temel Bilgiler KILAVUZU

Difüzyon Modelleri

Difüzyon modelleri, gürültü oluşturma sürecini tersine çevirmeyi öğrenerek, rastgele statiği adım adım ayrıntılı resimlere dönüştürerek görüntüler üretir.

2 min readSon güncelleme

Genel Bakış

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Derin Dalış

Bir difüzyon modeli iki yönde eğitilir. İleri süreçte, temiz bir görüntü, saf statik hale gelene kadar küçük miktarlarda rastgele gürültü eklenerek yavaş yavaş bozulur. Model daha sonra bunun tersini öğrenir: Gürültüden başlayarak, her adımda küçük bir gürültüyü tahmin eder ve ortadan kaldırır, keskin bir görüntü ortaya çıkana kadar onlarca veya yüzlerce kez tekrar eder. Bunu kontrol edilebilir kılmak için, bir metin uyarısı her gürültü giderme adımını yönlendirir, böylece "ata binen bir astronot" statiği o resme doğru yönlendirir. Stable Diffusion gibi modern sistemler, bu işlemi ham pikseller yerine sıkıştırılmış gizli bir alanda çalıştırarak çok daha hızlı hale getirir. GAN'larla karşılaştırıldığında difüzyon modelleri daha istikrarlı bir şekilde eğitilir ve daha fazla çeşitlilik üretir; bu nedenle 2022 yılı civarında yüksek kaliteli görüntü oluşturmaya yönelik baskın yaklaşım olarak GAN'ları geride bıraktılar.

Teknik Bilgi

İşin püf noktası, ağın hiçbir zaman tek çekimde görüntü oluşturmak zorunda olmamasıdır; yalnızca belirli bir adımda eklenen gürültüyü tahmin etmeyi öğrenir. Eğitim sırasında, gerçek bir görüntüye bilinen miktarda gürültü eklenir ve modelden bu gürültüyü tahmin etmesi istenir; fark eğitim hatasıdır. Üretim zamanında model, tahmin edilen gürültüyü tekrar tekrar çıkararak yapıyı kademeli olarak ortaya çıkarır. Metin koşullandırma çapraz dikkat yoluyla enjekte edilir ve sınıflandırıcısız rehberlik, istemin çıktıyı ne kadar güçlü bir şekilde yönlendirdiğini güçlendirir.

Stratejik Etki

Daha net kararlar

Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.

Maliyet ve bütçe

Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.

Ekip ve iş akışı

Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.

Difüzyon Modellerinin Geleceği

Difüzyon, Sora gibi araçlarla görüntüyü harekete genişleten, görüntü ve giderek daha fazla video ve ses üretimi için en son teknolojidir. En büyük itici güç hızdır: Damıtma ve tutarlılık modelleri gibi teknikler, yüzlerce gürültü giderme adımını bir avuç dolusu, hatta bir taneye indirmeyi amaçlayarak gerçek zamanlı üretime olanak tanır. Yayılmanın 3 boyutlu varlıklara, moleküller ve proteinler gibi bilimsel tasarımlara ve sıkı bir şekilde kontrol edilebilir düzenlemeye doğru genişlemesini ve telefonlarda çalıştırılacak kadar ucuz hale gelmesini bekleyin.

Gerçek Dünya Uygulaması

Stable Diffusion, DALL-E ve Midjourney'de metin istemlerinden orijinal sanat eserleri ve görüntüler oluşturma

Fotoğrafın bazı kısımlarını kusursuz bir şekilde iç ve dış boyama, doldurma veya uzatma

OpenAI'nin Sora gibi araçlardaki metinlerden video oluşturma

İlaç keşif araştırmaları için yeni moleküller ve protein yapılarının tasarlanması

Riskler ve Korkuluklar

Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.

Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.

Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.

Uygulama Yol Haritası

1

İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.

2

Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.

3

Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.

4

Difüzyon Modellerinin nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

GLIDE Difüzyon Modeli

Sık sorulan sorular

What is Diffusion Models?

Difüzyon modelleri, gürültü oluşturma sürecini tersine çevirmeyi öğrenerek, rastgele statiği adım adım ayrıntılı resimlere dönüştürerek görüntüler üretir. Stable Diffusion, DALL-E ve Midjourney gibi günümüzün önde gelen metinden görüntüye araçlarına güç veriyorlar.

Bir yayılma modelinin bir görüntüyü nasıl ürettiğinin ardındaki temel fikir nedir?

Bir yayılma modeli, saf gürültüden başlayarak ve net bir görüntü ortaya çıkana kadar adım adım gürültüyü gidererek gürültü sürecini tersine çevirmeyi öğrenir.

Eğitim sırasında model aslında her adımda neyi tahmin etmeyi öğreniyor?

Modele gürültülü bir görüntü verilir ve eklenen gürültüyü tahmin etmeyi öğrenir, böylece daha sonra üretim sırasında gürültüyü çıkarabilir.

Bir metin istemi oluşturulan görüntüyü nasıl etkiler?

Metin koşullandırma (çapraz dikkat ve rehberlik yoluyla), ortaya çıkan görüntünün istemle eşleşmesi için her gürültü giderme adımını dürtükler.

Kararlı Difüzyon neden süreci 'gizli bir alanda' çalıştırıyor?

Tam çözünürlüklü pikseller yerine sıkıştırılmış bir gizli alanda çalışmak, kaliteyi korurken hesaplamayı önemli ölçüde azaltır.

Difüzyon modellerinin GAN'lara göre önemli avantajlarından biri nedir?

Difüzyon modelleri, GAN'ların istikrarsız rakip oyununu ve mod çöküşünü önleyerek daha güvenilir eğitim ve daha fazla çıktı çeşitliliği sağlar.