Görsel Yapay Zeka KILAVUZU

Yapay Zeka Görüntü Oluşturucuları Neden Yanlış Anlıyor?

Yapay zeka görüntü oluşturucuları elleri yanlış anlıyor çünkü eller küçük, son derece esnek, çoğu zaman kısmen gizli ve altyazılarda nadiren açıklanıyor.

  • 4 dakikalık okuma
  • Son güncelleme
Bu sayfada4 dakikalık okuma
  1. Genel Bakış
  2. Derin Dalış
  3. Stratejik Etki
  4. Yapay Zeka Görüntü Oluşturucularının Neden Yanlış Anladığı Konusunun Geleceği
  5. Gerçek Dünya Uygulaması
  6. Riskler ve Korkuluklar
  7. Uygulama Yol Haritası
  8. Keşfetmeye Devam Edin
  9. Sık sorulan sorular

Genel Bakış

Modeller, el başına beş parmak gibi yapılarını güvenilir bir şekilde öğrenmeden ellerin yüzeyde nasıl göründüğünü öğrenir. El hataları, sentetik görüntülerin iyi bilinen bir işareti haline geldi ve bunların neden oluştuğunu anlamak, hem yeni modellerin nasıl geliştiğini hem de parmak saymanın neden sahte görüntüleri tespit etmenin artık güvenilir bir yolu olmadığını açıklıyor.

Derin Dalış

Yayılma modelleri, eklenen gürültüyü tersine çevirmeyi öğrenerek milyarlarca görüntü-altyazı çiftinden bilgi alır. Yerel görsel kalıplarda çok iyi hale gelirler: cilt dokusu, ışıklandırma, elin genel görünümü. Asla almadıkları şey, bir elin beş parmağının avuç içine belirli bir sırayla birleştiğine dair açık bir kuraldır. Çeşitli faktörler elleri zorlaştırır. Eller çoğu fotoğrafın küçük bir kısmını kaplar, dolayısıyla birkaç piksel elde ederler. Stable Diffusion gibi gizli difüzyon modelleri, görüntüleri oluşturmadan önce her boyutta sekiz kat küçültüyor ve bu da geriye yalnızca bir avuç gizli hücre bırakabiliyor. Eller çok çeşitli pozlar alır, nesneleri tutar, üst üste gelir ve çoğu zaman kısmen gizlenir, dolayısıyla eğitim verileri eksik görünümlerle doludur. Parmaklar birbirine benzediğinden 'parmak, parmak, parmak' üreten bir modelin ne zaman durması gerektiğini söyleyen güçlü bir sinyali yoktur. Altyazılarda bırakın pozlarını, ellerden neredeyse hiç bahsedilmiyor, bu nedenle bilgi istemi çok az rehberlik sağlıyor. Sonuç, bir dizi tanıdık hatadır: Fazla veya eksik parmaklar, kaynaşmış parmaklar, başparmakların yanlış tarafta olması ve ellerin nesnelere veya diğer insanlara karışması. Dişler, kulaklar ve takılar da benzer nedenlerle bozulur. Daha yeni sistemler bu arızaları azaltmıştır. Daha büyük modeller, daha yüksek eğitim çözünürlükleri, daha iyi filtrelenmiş ve altyazılı veriler, transformatör tabanlı mimariler ve insan tercihi derecelendirmelerinde ince ayar yapılmasının hepsi yardımcı oldu. Midjourney'nin 2023'teki 5. sürümü, daha iyi eller nedeniyle geniş çapta dikkat çekti ve birkaç laboratuvarın sonraki modelleri daha da geliştirildi. Ancak özellikle karmaşık pozlarda, kalabalıklarda ve bir şeyleri tutan ellerde hatalar ortadan kalkmadı. Yaygın bir yanılgı, modelin "sayılamaz" olduğudur. Görünümü istatistiksel olarak öğrendiğini söylemek daha doğru olur ve doğru yapı ancak veri ve model kapasitesi yeterli olduğunda ortaya çıkar.

Stratejik Etki

Hız ve ölçek

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Yapı seçimleri

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Yapay Zeka Görüntü Oluşturucularının Neden Yanlış Anladığı Konusunun Geleceği

Modeller büyüdükçe ve eğitim verileri geliştikçe el hataları muhtemelen azalmaya devam edecek, ancak sıra dışı pozlar, birbirine kenetlenmiş eller ve nesneleri manipüle eden eller, basit bir açık avuçtan daha zor olmaya devam edecek. Video oluşturma problemin yeni bir versiyonunu ekliyor çünkü parmakların kareden kareye tutarlı kalması gerekiyor. Orijinalliği değerlendiren herkes için elle yapılan kontroller zayıf bir sinyaldir. Bozuk bir el yine de bir görüntünün oluşturulduğunu gösterir, ancak doğru bir el hiçbir şeyi kanıtlamaz. Kaynak kayıtları ve filigranlar anatomiyi kontrol etmekten daha güvenilirdir.

Gerçek Dünya Uygulaması

Eski bir Stable Diffusion portresi, etrafına altı parmağı sarılı bir kahve fincanı tutan birini gösteriyor; bu, bir modelin birçok üst üste binen kavrama pozunu harmanladığı durumlarda tipik bir başarısızlık.

Eski bir modelden bir grup sahnesi, iki kişinin ellerini dokundukları yerde birleştiriyor çünkü modelin, bir bedenin nerede bitip diğerinin nerede başladığına dair kesin bir fikri yok.

Bir sanatçı, doğru pozu zorlamak için ControlNet OpenPose'u veya kendi elindeki bir fotoğraftan yapılmış derinlik haritasını besliyor, ardından kalan hataları yeniden boyar.

Bir teyitçi, sahte olduğundan şüphelenilen kişinin tamamen normal ellere sahip olduğunu belirtiyor; bu da yeni jeneratörlerin genellikle elleri doğru çizdiğini ve başka ipuçlarına ihtiyaç duyulduğunu hatırlatıyor.

Riskler ve Korkuluklar

  • Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

  • Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

  • Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

  1. Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

  2. Gerçek üretim koşullarıyla eşleşen verilerle test edin.

  3. Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

  4. Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Why AI Image Generators Get Hands Wrong quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Sık sorulan sorular

Yapay Zeka Görüntü Oluşturucularının Elleri Neden Yanlış Anlıyor?

Yapay zeka görüntü oluşturucuları elleri yanlış anlıyor çünkü eller küçük, son derece esnek, çoğu zaman kısmen gizli ve altyazılarda nadiren açıklanıyor. Modeller, el başına beş parmak gibi yapılarını güvenilir bir şekilde öğrenmeden ellerin yüzeyde nasıl göründüğünü öğrenir. El hataları, sentetik görüntülerin iyi bilinen bir işareti haline geldi ve bunların neden oluştuğunu anlamak, hem yeni modellerin nasıl geliştiğini hem de parmak saymanın neden sahte görüntüleri tespit etmenin artık güvenilir bir yolu olmadığını açıklıyor.

Kılavuza göre, bir yayılma modeli esas olarak resim-altyazı çiftlerinden ne öğreniyor?

Modeller nesnelerin istatistiksel olarak nasıl göründüğünü öğrenir. Eğitimdeki hiçbir şey onlara bir elin beş parmağı olduğuna dair açık bir kural vermez.

Stable Diffusion'deki gizli sıkıştırma ellerin çizilmesini nasıl zorlaştırır?

Her boyutta sekiz kat küçülen küçük bir el, beş farklı parmağı temsil edecek kadar az alana sahip olur.

Altyazılar neden modellere el konusunda pek yardımcı olmuyor?

El pozlarını açıklayan metin olmadan model, istem sözcüklerini el yapısına bağlayamaz.

Kılavuzda hangi Midjourney sürümünün 2023'te daha iyi ellere sahip olduğu belirtiliyor?

Midjourney'nin 2023'te piyasaya sürülen 5. sürümü, daha geniş bir ölçeklendirme eğiliminin ve daha iyi verilerin bir parçası olarak gelişmiş ellerle geniş çapta dikkat çekti.

ADetailer tarzı algılama ve yeniden boyama iş akışı ne işe yarar?

Mahsulün büyütülmesi, yenilenme sırasında elin yapısını geliştiren çok daha fazla gizli hücre sağlar.