Difüzyon Modelleri
Difüzyon modelleri, gürültü oluşturma sürecini tersine çevirmeyi öğrenerek, rastgele statiği adım adım ayrıntılı resimlere dönüştürerek görüntüler üretir.
Genel Bakış
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Derin Dalış
Bir difüzyon modeli iki yönde eğitilir. İleri süreçte, temiz bir görüntü, saf statik hale gelene kadar küçük miktarlarda rastgele gürültü eklenerek yavaş yavaş bozulur. Model daha sonra bunun tersini öğrenir: Gürültüden başlayarak, her adımda küçük bir gürültüyü tahmin eder ve ortadan kaldırır, keskin bir görüntü ortaya çıkana kadar onlarca veya yüzlerce kez tekrar eder. Bunu kontrol edilebilir kılmak için, bir metin uyarısı her gürültü giderme adımını yönlendirir, böylece "ata binen bir astronot" statiği o resme doğru yönlendirir. Stable Diffusion gibi modern sistemler, bu işlemi ham pikseller yerine sıkıştırılmış gizli bir alanda çalıştırarak çok daha hızlı hale getirir. GAN'larla karşılaştırıldığında difüzyon modelleri daha istikrarlı bir şekilde eğitilir ve daha fazla çeşitlilik üretir; bu nedenle 2022 yılı civarında yüksek kaliteli görüntü oluşturmaya yönelik baskın yaklaşım olarak GAN'ları geride bıraktılar.
Teknik Bilgi
İşin püf noktası, ağın hiçbir zaman tek çekimde görüntü oluşturmak zorunda olmamasıdır; yalnızca belirli bir adımda eklenen gürültüyü tahmin etmeyi öğrenir. Eğitim sırasında, gerçek bir görüntüye bilinen miktarda gürültü eklenir ve modelden bu gürültüyü tahmin etmesi istenir; fark eğitim hatasıdır. Üretim zamanında model, tahmin edilen gürültüyü tekrar tekrar çıkararak yapıyı kademeli olarak ortaya çıkarır. Metin koşullandırma çapraz dikkat yoluyla enjekte edilir ve sınıflandırıcısız rehberlik, istemin çıktıyı ne kadar güçlü bir şekilde yönlendirdiğini güçlendirir.
Stratejik Etki
Daha net kararlar
Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.
Maliyet ve bütçe
Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.
Ekip ve iş akışı
Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.
Difüzyon Modellerinin Geleceği
Difüzyon, Sora gibi araçlarla görüntüyü harekete genişleten, görüntü ve giderek daha fazla video ve ses üretimi için en son teknolojidir. En büyük itici güç hızdır: Damıtma ve tutarlılık modelleri gibi teknikler, yüzlerce gürültü giderme adımını bir avuç dolusu, hatta bir taneye indirmeyi amaçlayarak gerçek zamanlı üretime olanak tanır. Yayılmanın 3 boyutlu varlıklara, moleküller ve proteinler gibi bilimsel tasarımlara ve sıkı bir şekilde kontrol edilebilir düzenlemeye doğru genişlemesini ve telefonlarda çalıştırılacak kadar ucuz hale gelmesini bekleyin.
Gerçek Dünya Uygulaması
Stable Diffusion, DALL-E ve Midjourney'de metin istemlerinden orijinal sanat eserleri ve görüntüler oluşturma
Fotoğrafın bazı kısımlarını kusursuz bir şekilde iç ve dış boyama, doldurma veya uzatma
OpenAI'nin Sora gibi araçlardaki metinlerden video oluşturma
İlaç keşif araştırmaları için yeni moleküller ve protein yapılarının tasarlanması
Riskler ve Korkuluklar
Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.
Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.
Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.
Uygulama Yol Haritası
İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.
Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.
Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.
Difüzyon Modellerinin nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
GLIDE Difüzyon Modeli
Sık sorulan sorular
What is Diffusion Models?
Difüzyon modelleri, gürültü oluşturma sürecini tersine çevirmeyi öğrenerek, rastgele statiği adım adım ayrıntılı resimlere dönüştürerek görüntüler üretir. Stable Diffusion, DALL-E ve Midjourney gibi günümüzün önde gelen metinden görüntüye araçlarına güç veriyorlar.
Bir yayılma modelinin bir görüntüyü nasıl ürettiğinin ardındaki temel fikir nedir?
Bir yayılma modeli, saf gürültüden başlayarak ve net bir görüntü ortaya çıkana kadar adım adım gürültüyü gidererek gürültü sürecini tersine çevirmeyi öğrenir.
Eğitim sırasında model aslında her adımda neyi tahmin etmeyi öğreniyor?
Modele gürültülü bir görüntü verilir ve eklenen gürültüyü tahmin etmeyi öğrenir, böylece daha sonra üretim sırasında gürültüyü çıkarabilir.
Bir metin istemi oluşturulan görüntüyü nasıl etkiler?
Metin koşullandırma (çapraz dikkat ve rehberlik yoluyla), ortaya çıkan görüntünün istemle eşleşmesi için her gürültü giderme adımını dürtükler.
Kararlı Difüzyon neden süreci 'gizli bir alanda' çalıştırıyor?
Tam çözünürlüklü pikseller yerine sıkıştırılmış bir gizli alanda çalışmak, kaliteyi korurken hesaplamayı önemli ölçüde azaltır.
Difüzyon modellerinin GAN'lara göre önemli avantajlarından biri nedir?
Difüzyon modelleri, GAN'ların istikrarsız rakip oyununu ve mod çöküşünü önleyerek daha güvenilir eğitim ve daha fazla çıktı çeşitliliği sağlar.