Görsel Yapay Zeka KILAVUZU

DALL-E

DALL-E, OpenAI'un yazılı bir açıklamayı orijinal bir resme dönüştüren metinden resme modeller ailesidir.

2 min readSon güncelleme

Genel Bakış

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

Derin Dalış

DALL-E, pikseller için bir dil modeli gibi, görüntü belirteçlerini teker teker tahmin ederek metinden görüntüler üreten Ocak 2021'de piyasaya sürüldü. DALL-E 2 (2022), CLIP yerleştirmelerinin yönlendirdiği bir yayılma yaklaşımına geçerek daha keskin, daha fotogerçekçi sonuçlar üretti. DALL-E 3 (Ekim 2023) bilgi istemi takibini sıkılaştırdı ve ChatGPT'ye entegre edildi; böylece sohbet robotu, kaba isteğinizi oluşturmadan önce zengin ayrıntılara sahip bir istem halinde yeniden yazabilir. Göze çarpan bir gelişme, önceki modellerin bozuk olduğu, işaretler ve etiketler gibi görsellerin içindeki okunabilir metinlerin oluşturulmasıdır. DALL-E aynı zamanda iç boyamayı (görüntünün bir bölümünü düzenleme) ve dış boyamayı (orijinal sınırlarının ötesine genişletmeyi) de destekler. Tek bir istemden birden fazla varyasyon üreterek kullanıcıların yaratıcı seçenekleri hızlı bir şekilde keşfetmesine yardımcı olur.

Teknik Bilgi

DALL-E 3 bir yayılma modelidir: rastgele gürültüden başlar ve onu adım adım ortadan kaldırır, tutarlı bir görüntü ortaya çıkana kadar her adımda metin isteminizin kodlanmasıyla yönlendirilir. Kelimelerin görsel özelliklerle, mekansal düzenlemelerle ve stillerle nasıl eşleştiğini öğrenerek çok sayıda resim yazısı çifti üzerinde eğitim alır. Önemli bir püf noktası, eğitim sırasında geliştirilmiş altyazıların yanı sıra kısa isteminizi ayrıntılı bir istem haline getiren bir dil modelidir; bu nedenle DALL-E 3, talimatları öncüllerine göre çok daha sadık bir şekilde takip eder.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

DALL-E'nin Geleceği

DALL-E'nin geçmişi, tek bir modelin ayrı bir araç yerine metni, görselleri ve düzenlemeleri birlikte ele aldığı daha geniş, çok modlu sistemlere doğru katlanıyor. Daha sıkı konuşma düzenlemesi ("gökyüzünü turuncu yapın, diğer her şeyi koruyun"), daha iyi metin oluşturma ve daha yüksek çözünürlük bekleyin. C2PA meta verileri ve filigranlama gibi kaynak sinyalleri, yapay zeka tarafından oluşturulan görüntüleri işaretlemek için standart hale gelecektir. Midjourney, Stabil Difüzyon ve Google modellerinden gelen rekabet, hızlı kalite kazanımlarına yol açarken, eğitim verileri, sanatçı izni ve telif hakkı konusundaki tartışmalar da bu sistemlerin nelerden öğrenmesine izin verildiğini şekillendirmeye devam edecek.

Gerçek Dünya Uygulaması

Bir blog yazarı, stok fotoğraf kitaplıklarında arama yapmak yerine bir makale için özel bir başlık illüstrasyonu oluşturuyor

Bir öğretmen bir bilim kavramını genç öğrencilere açıklamak için basit, resimli diyagramlar oluşturur

Küçük bir işletme, bir tasarımcıyı iyileştirmesi için işe almadan önce çeşitli logo ve ambalaj konseptleri üzerinde çalışıyor

Bir oyun tasarımcısı, bir fikri ortaya koymak amacıyla karakterler ve ortamlar için hızla konsept çizimleri üretir

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Nöral Parlaklık Alanları

Sık sorulan sorular

What is DALL-E?

DALL-E, OpenAI'un yazılı bir açıklamayı orijinal bir resme dönüştüren metinden resme modeller ailesidir. "Bir cümle yazın, bir resim alın" fikrini ana akım fikir haline getirdi ve araştırma demolarından resim oluşturmayı günlük araçlara itti.

DALL-E 3 öncelikli olarak ne yapar?

DALL-E bir metin-görüntü sistemidir: bir sahneyi kelimelerle anlatırsınız ve o da bu tanıma uyan yeni bir resim üretir.

DALL-E 3 bir görüntü oluşturmak için hangi temel tekniği kullanıyor?

DALL-E 3, rastgele gürültüden başlayıp, sizin isteğiniz doğrultusunda onu adım adım iyileştirerek tutarlı bir görüntüye dönüştüren bir yayılma modelidir.

DALL-E 3 neden ChatGPT içinde kullanıldığında istemleri daha iyi takip ediyor?

ChatGPT'de dil modeli, kısa bir isteği daha zengin, daha spesifik bir istem halinde yeniden yazar ve görüntünün istediğinizle ne kadar aslına uygun şekilde eşleştiğini geliştirir.

DALL-E 3'ün önceki sürümlere göre yaptığı dikkate değer gelişme nedir?

Önceki modeller görüntüdeki metni bozuyordu ancak DALL-E 3 tabelalar, etiketler ve posterler üzerindeki okunaklı kelimeleri çok daha güvenilir bir şekilde oluşturabiliyor.

'İç boyama' bir DALL-E görüntüsüyle ne yapmanızı sağlar?

İç boyama, çevredeki alanı olduğu gibi bırakarak görüntünün seçilen bir bölümünü düzenler (örneğin, bir nesnenin yerini değiştirmek).