DALL-E
DALL-E, OpenAI'un yazılı bir açıklamayı orijinal bir resme dönüştüren metinden resme modeller ailesidir.
Genel Bakış
It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.
Derin Dalış
DALL-E, pikseller için bir dil modeli gibi, görüntü belirteçlerini teker teker tahmin ederek metinden görüntüler üreten Ocak 2021'de piyasaya sürüldü. DALL-E 2 (2022), CLIP yerleştirmelerinin yönlendirdiği bir yayılma yaklaşımına geçerek daha keskin, daha fotogerçekçi sonuçlar üretti. DALL-E 3 (Ekim 2023) bilgi istemi takibini sıkılaştırdı ve ChatGPT'ye entegre edildi; böylece sohbet robotu, kaba isteğinizi oluşturmadan önce zengin ayrıntılara sahip bir istem halinde yeniden yazabilir. Göze çarpan bir gelişme, önceki modellerin bozuk olduğu, işaretler ve etiketler gibi görsellerin içindeki okunabilir metinlerin oluşturulmasıdır. DALL-E aynı zamanda iç boyamayı (görüntünün bir bölümünü düzenleme) ve dış boyamayı (orijinal sınırlarının ötesine genişletmeyi) de destekler. Tek bir istemden birden fazla varyasyon üreterek kullanıcıların yaratıcı seçenekleri hızlı bir şekilde keşfetmesine yardımcı olur.
Teknik Bilgi
DALL-E 3 bir yayılma modelidir: rastgele gürültüden başlar ve onu adım adım ortadan kaldırır, tutarlı bir görüntü ortaya çıkana kadar her adımda metin isteminizin kodlanmasıyla yönlendirilir. Kelimelerin görsel özelliklerle, mekansal düzenlemelerle ve stillerle nasıl eşleştiğini öğrenerek çok sayıda resim yazısı çifti üzerinde eğitim alır. Önemli bir püf noktası, eğitim sırasında geliştirilmiş altyazıların yanı sıra kısa isteminizi ayrıntılı bir istem haline getiren bir dil modelidir; bu nedenle DALL-E 3, talimatları öncüllerine göre çok daha sadık bir şekilde takip eder.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
DALL-E'nin Geleceği
DALL-E'nin geçmişi, tek bir modelin ayrı bir araç yerine metni, görselleri ve düzenlemeleri birlikte ele aldığı daha geniş, çok modlu sistemlere doğru katlanıyor. Daha sıkı konuşma düzenlemesi ("gökyüzünü turuncu yapın, diğer her şeyi koruyun"), daha iyi metin oluşturma ve daha yüksek çözünürlük bekleyin. C2PA meta verileri ve filigranlama gibi kaynak sinyalleri, yapay zeka tarafından oluşturulan görüntüleri işaretlemek için standart hale gelecektir. Midjourney, Stabil Difüzyon ve Google modellerinden gelen rekabet, hızlı kalite kazanımlarına yol açarken, eğitim verileri, sanatçı izni ve telif hakkı konusundaki tartışmalar da bu sistemlerin nelerden öğrenmesine izin verildiğini şekillendirmeye devam edecek.
Gerçek Dünya Uygulaması
Bir blog yazarı, stok fotoğraf kitaplıklarında arama yapmak yerine bir makale için özel bir başlık illüstrasyonu oluşturuyor
Bir öğretmen bir bilim kavramını genç öğrencilere açıklamak için basit, resimli diyagramlar oluşturur
Küçük bir işletme, bir tasarımcıyı iyileştirmesi için işe almadan önce çeşitli logo ve ambalaj konseptleri üzerinde çalışıyor
Bir oyun tasarımcısı, bir fikri ortaya koymak amacıyla karakterler ve ortamlar için hızla konsept çizimleri üretir
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DALL-E quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Nöral Parlaklık Alanları
Sık sorulan sorular
What is DALL-E?
DALL-E, OpenAI'un yazılı bir açıklamayı orijinal bir resme dönüştüren metinden resme modeller ailesidir. "Bir cümle yazın, bir resim alın" fikrini ana akım fikir haline getirdi ve araştırma demolarından resim oluşturmayı günlük araçlara itti.
DALL-E 3 öncelikli olarak ne yapar?
DALL-E bir metin-görüntü sistemidir: bir sahneyi kelimelerle anlatırsınız ve o da bu tanıma uyan yeni bir resim üretir.
DALL-E 3 bir görüntü oluşturmak için hangi temel tekniği kullanıyor?
DALL-E 3, rastgele gürültüden başlayıp, sizin isteğiniz doğrultusunda onu adım adım iyileştirerek tutarlı bir görüntüye dönüştüren bir yayılma modelidir.
DALL-E 3 neden ChatGPT içinde kullanıldığında istemleri daha iyi takip ediyor?
ChatGPT'de dil modeli, kısa bir isteği daha zengin, daha spesifik bir istem halinde yeniden yazar ve görüntünün istediğinizle ne kadar aslına uygun şekilde eşleştiğini geliştirir.
DALL-E 3'ün önceki sürümlere göre yaptığı dikkate değer gelişme nedir?
Önceki modeller görüntüdeki metni bozuyordu ancak DALL-E 3 tabelalar, etiketler ve posterler üzerindeki okunaklı kelimeleri çok daha güvenilir bir şekilde oluşturabiliyor.
'İç boyama' bir DALL-E görüntüsüyle ne yapmanızı sağlar?
İç boyama, çevredeki alanı olduğu gibi bırakarak görüntünün seçilen bir bölümünü düzenler (örneğin, bir nesnenin yerini değiştirmek).