SıradakiSonraki rehber
Sanat Dersinde Yapay Zeka Görüntü Oluşturucuları
Görsel Yapay Zeka
Görsel Yapay Zeka KILAVUZU
Yapay zeka görüntü oluşturucuları elleri yanlış anlıyor çünkü eller küçük, son derece esnek, çoğu zaman kısmen gizli ve altyazılarda nadiren açıklanıyor.
Modeller, el başına beş parmak gibi yapılarını güvenilir bir şekilde öğrenmeden ellerin yüzeyde nasıl göründüğünü öğrenir. El hataları, sentetik görüntülerin iyi bilinen bir işareti haline geldi ve bunların neden oluştuğunu anlamak, hem yeni modellerin nasıl geliştiğini hem de parmak saymanın neden sahte görüntüleri tespit etmenin artık güvenilir bir yolu olmadığını açıklıyor.
Yayılma modelleri, eklenen gürültüyü tersine çevirmeyi öğrenerek milyarlarca görüntü-altyazı çiftinden bilgi alır. Yerel görsel kalıplarda çok iyi hale gelirler: cilt dokusu, ışıklandırma, elin genel görünümü. Asla almadıkları şey, bir elin beş parmağının avuç içine belirli bir sırayla birleştiğine dair açık bir kuraldır. Çeşitli faktörler elleri zorlaştırır. Eller çoğu fotoğrafın küçük bir kısmını kaplar, dolayısıyla birkaç piksel elde ederler. Stable Diffusion gibi gizli difüzyon modelleri, görüntüleri oluşturmadan önce her boyutta sekiz kat küçültüyor ve bu da geriye yalnızca bir avuç gizli hücre bırakabiliyor. Eller çok çeşitli pozlar alır, nesneleri tutar, üst üste gelir ve çoğu zaman kısmen gizlenir, dolayısıyla eğitim verileri eksik görünümlerle doludur. Parmaklar birbirine benzediğinden 'parmak, parmak, parmak' üreten bir modelin ne zaman durması gerektiğini söyleyen güçlü bir sinyali yoktur. Altyazılarda bırakın pozlarını, ellerden neredeyse hiç bahsedilmiyor, bu nedenle bilgi istemi çok az rehberlik sağlıyor. Sonuç, bir dizi tanıdık hatadır: Fazla veya eksik parmaklar, kaynaşmış parmaklar, başparmakların yanlış tarafta olması ve ellerin nesnelere veya diğer insanlara karışması. Dişler, kulaklar ve takılar da benzer nedenlerle bozulur. Daha yeni sistemler bu arızaları azaltmıştır. Daha büyük modeller, daha yüksek eğitim çözünürlükleri, daha iyi filtrelenmiş ve altyazılı veriler, transformatör tabanlı mimariler ve insan tercihi derecelendirmelerinde ince ayar yapılmasının hepsi yardımcı oldu. Midjourney'nin 2023'teki 5. sürümü, daha iyi eller nedeniyle geniş çapta dikkat çekti ve birkaç laboratuvarın sonraki modelleri daha da geliştirildi. Ancak özellikle karmaşık pozlarda, kalabalıklarda ve bir şeyleri tutan ellerde hatalar ortadan kalkmadı. Yaygın bir yanılgı, modelin "sayılamaz" olduğudur. Görünümü istatistiksel olarak öğrendiğini söylemek daha doğru olur ve doğru yapı ancak veri ve model kapasitesi yeterli olduğunda ortaya çıkar.
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Modeller büyüdükçe ve eğitim verileri geliştikçe el hataları muhtemelen azalmaya devam edecek, ancak sıra dışı pozlar, birbirine kenetlenmiş eller ve nesneleri manipüle eden eller, basit bir açık avuçtan daha zor olmaya devam edecek. Video oluşturma problemin yeni bir versiyonunu ekliyor çünkü parmakların kareden kareye tutarlı kalması gerekiyor. Orijinalliği değerlendiren herkes için elle yapılan kontroller zayıf bir sinyaldir. Bozuk bir el yine de bir görüntünün oluşturulduğunu gösterir, ancak doğru bir el hiçbir şeyi kanıtlamaz. Kaynak kayıtları ve filigranlar anatomiyi kontrol etmekten daha güvenilirdir.
Eski bir Stable Diffusion portresi, etrafına altı parmağı sarılı bir kahve fincanı tutan birini gösteriyor; bu, bir modelin birçok üst üste binen kavrama pozunu harmanladığı durumlarda tipik bir başarısızlık.
Eski bir modelden bir grup sahnesi, iki kişinin ellerini dokundukları yerde birleştiriyor çünkü modelin, bir bedenin nerede bitip diğerinin nerede başladığına dair kesin bir fikri yok.
Bir sanatçı, doğru pozu zorlamak için ControlNet OpenPose'u veya kendi elindeki bir fotoğraftan yapılmış derinlik haritasını besliyor, ardından kalan hataları yeniden boyar.
Bir teyitçi, sahte olduğundan şüphelenilen kişinin tamamen normal ellere sahip olduğunu belirtiyor; bu da yeni jeneratörlerin genellikle elleri doğru çizdiğini ve başka ipuçlarına ihtiyaç duyulduğunu hatırlatıyor.
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Yapay zeka görüntü oluşturucuları elleri yanlış anlıyor çünkü eller küçük, son derece esnek, çoğu zaman kısmen gizli ve altyazılarda nadiren açıklanıyor. Modeller, el başına beş parmak gibi yapılarını güvenilir bir şekilde öğrenmeden ellerin yüzeyde nasıl göründüğünü öğrenir. El hataları, sentetik görüntülerin iyi bilinen bir işareti haline geldi ve bunların neden oluştuğunu anlamak, hem yeni modellerin nasıl geliştiğini hem de parmak saymanın neden sahte görüntüleri tespit etmenin artık güvenilir bir yolu olmadığını açıklıyor.
Modeller nesnelerin istatistiksel olarak nasıl göründüğünü öğrenir. Eğitimdeki hiçbir şey onlara bir elin beş parmağı olduğuna dair açık bir kural vermez.
Her boyutta sekiz kat küçülen küçük bir el, beş farklı parmağı temsil edecek kadar az alana sahip olur.
El pozlarını açıklayan metin olmadan model, istem sözcüklerini el yapısına bağlayamaz.
Midjourney'nin 2023'te piyasaya sürülen 5. sürümü, daha geniş bir ölçeklendirme eğiliminin ve daha iyi verilerin bir parçası olarak gelişmiş ellerle geniş çapta dikkat çekti.
Mahsulün büyütülmesi, yenilenme sırasında elin yapısını geliştiren çok daha fazla gizli hücre sağlar.
Öğrenmeye devam et
Bu konu için daha fazla rehber seçildi
SıradakiSonraki rehber
Sanat Dersinde Yapay Zeka Görüntü Oluşturucuları
Görsel Yapay Zeka