Imagen 2 ve Ödüle Göre Ayarlanmış Yayılma
Imagen 2, Google'in fotogerçekçi difüzyon tabanlı metinden resme modelidir ve çıktılarının insanların gerçekte istedikleriyle daha iyi eşleşmesi için ödül ayarlamasıyla iyileştirilmiştir.
Genel Bakış
It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.
Derin Dalış
Imagen 2, orijinal Imagen tarifini temel alır: büyük bir donmuş dil modeli, istemi kodlar ve bir dizi yayılma modeli, o metne sadık kalarak rastgele gürültüyü ayrıntılı bir görüntüye dönüştürür. Başlık eklemesi, öğrenilmiş bir ödül modelinin anında hizalama, estetik ve gerçekçilik gibi nitelikler için oluşturulan görselleri puanladığı ve yayılma modelinin daha yüksek puanlı sonuçlar üretmek için ince ayarlandığı ödül ayarlamasıdır. Bu, dil modellerinde kullanılan insan geri bildirimlerinden pekiştirmeli öğrenmeyi yansıtır. Imagen 2, gelişmiş fotogerçekçilik, görüntü içi metnin daha güvenilir yazılışı, çok dilli komut desteği ve eller ve yüzler gibi zor konuların daha güçlü şekilde ele alınması. Ayrıca iç boyama ve dış boyama da ekledi ve Google, yapay zeka tarafından oluşturulan görüntüleri görünmez bir şekilde işaretlemek için bunu SynthID filigran aracıyla eşleştirdi. Google ürünleri ve ImageFX deneyimindeki özellikleri güçlendirdi.
Teknik Bilgi
Difüzyon, gürültülü bir süreci tersine çevirmeyi öğrenir ve metin yerleştirmelerin yönlendirdiği bir görüntüye yavaş yavaş rastgele bir alan yerleştirir. Ödül ayarlaması en üstte yer alıyor: İnsan tercihlerine göre eğitilmiş bir ödül modeli, metin için RLHF'ye benzer şekilde, insanların daha yüksek oranlara sahip çıktılara doğru yayılma modelini yönlendiren bir sinyal sağlıyor. Çeşitliliğe karşı sadakati dengeleyen sınıflandırıcısız rehberlikle birleştiğinde bu, Imagen 2'nin yalnızca eğitim dağılımını eşleştirmek yerine doğrudan algılanan kalite ve hizalamayı optimize etmesine olanak tanır.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Imagen 2'nin Geleceği ve Ödül Odaklı Yayılım
Ödüle göre ayarlanmış dağıtım, kontrol edilebilir, yüksek kaliteli üretime giden varsayılan yol haline geliyor ve ödül sinyalleri, estetiğin yanı sıra güvenliği, gerçekçiliği ve adaleti de kapsayacak şekilde genişleyecek. Daha sıkı düzenleme kontrolleri, damıtma yoluyla daha hızlı örnekleme ve SynthID gibi filigranlama yoluyla standart kaynak elde etmeyi bekleyebilirsiniz. Tercih modelleri daha incelikli ve kullanıcı başına büyüdükçe, görüntü oluşturucular yapay zeka yapımı olarak izlenebilir kalırken stil ve içeriği bireysel zevklere göre giderek daha fazla özelleştirecek.
Gerçek Dünya Uygulaması
Kısa sloganlar veya etiketler gibi doğru görsel içi metinlerle pazarlama ve ürün görselleri oluşturma.
Mevcut bir fotoğraftaki nesneleri sorunsuz bir şekilde kaldırmak veya değiştirmek için iç boyama.
Bir sahneyi farklı düzenler, afişler veya en boy oranlarına göre genişletmek için dış boyama.
İstemlerin ve oluşturulan metnin çeşitli dillerde göründüğü, kaynak açısından SynthID ile filigranlanmış, çok dilli yaratıcı varlıklar oluşturma.
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imagen 2 and Reward-Tuned Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Kararlı Video Dağıtımı
Sık sorulan sorular
What is Imagen 2 and Reward-Tuned Diffusion?
Imagen 2, Google'in fotogerçekçi difüzyon tabanlı metinden resme modelidir ve çıktılarının insanların gerçekte istedikleriyle daha iyi eşleşmesi için ödül ayarlamasıyla iyileştirilmiştir. Bu önemlidir çünkü güçlü görüntü kalitesini ve doğru metin oluşturmayı, sohbet robotlarının eğitilme şeklinden ödünç alınan hizalama teknikleriyle eşleştirir.
Imagen 2 hangi temel üretken tekniği kullanıyor?
Imagen 2 bir yayılma modelidir: rastgele gürültüyü metinle yönlendirilen ayrıntılı bir görüntüye dönüştürerek gürültü sürecini tersine çevirmeyi öğrenir.
Ödül ayarı Imagen 2'ye ne katıyor?
Ödül ayarı, insan tercihlerine göre eğitilmiş bir ödül modeli kullanarak modele ince ayar yaparak onu daha yüksek puanlı, daha iyi hizalanmış görüntülere doğru yönlendirir.
Imagen 2'nin ödül ayarlaması, dil modeli eğitimindeki hangi tekniğe benziyor?
Ödül ayarlaması kavramsal olarak RLHF'ye benzer: Tercihe göre eğitilmiş bir ödül modeli, insanların tercih ettiği çıktılara yönelik ince ayar yapılmasına rehberlik eder.
Imagen 2 metin istemini nasıl anlıyor?
Imagen 2, istemi zengin metin yerleştirmeleri halinde kodlamak için büyük bir donmuş dil modeli kullanma şeklindeki Imagen tarifini takip eder.
Imagen 2 görüntüleri ile SynthID ne için kullanılır?
SynthID, yapay zeka tarafından oluşturulan görüntülerin bazı düzenlemelerden sonra bile kaynağının tespit edilebilmesi için görünmez bir filigran ekler.