Görsel Yapay Zeka KILAVUZU

Imagen 2 ve Ödüle Göre Ayarlanmış Yayılma

Imagen 2, Google'in fotogerçekçi difüzyon tabanlı metinden resme modelidir ve çıktılarının insanların gerçekte istedikleriyle daha iyi eşleşmesi için ödül ayarlamasıyla iyileştirilmiştir.

2 min readSon güncelleme

Genel Bakış

It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.

Derin Dalış

Imagen 2, orijinal Imagen tarifini temel alır: büyük bir donmuş dil modeli, istemi kodlar ve bir dizi yayılma modeli, o metne sadık kalarak rastgele gürültüyü ayrıntılı bir görüntüye dönüştürür. Başlık eklemesi, öğrenilmiş bir ödül modelinin anında hizalama, estetik ve gerçekçilik gibi nitelikler için oluşturulan görselleri puanladığı ve yayılma modelinin daha yüksek puanlı sonuçlar üretmek için ince ayarlandığı ödül ayarlamasıdır. Bu, dil modellerinde kullanılan insan geri bildirimlerinden pekiştirmeli öğrenmeyi yansıtır. Imagen 2, gelişmiş fotogerçekçilik, görüntü içi metnin daha güvenilir yazılışı, çok dilli komut desteği ve eller ve yüzler gibi zor konuların daha güçlü şekilde ele alınması. Ayrıca iç boyama ve dış boyama da ekledi ve Google, yapay zeka tarafından oluşturulan görüntüleri görünmez bir şekilde işaretlemek için bunu SynthID filigran aracıyla eşleştirdi. Google ürünleri ve ImageFX deneyimindeki özellikleri güçlendirdi.

Teknik Bilgi

Difüzyon, gürültülü bir süreci tersine çevirmeyi öğrenir ve metin yerleştirmelerin yönlendirdiği bir görüntüye yavaş yavaş rastgele bir alan yerleştirir. Ödül ayarlaması en üstte yer alıyor: İnsan tercihlerine göre eğitilmiş bir ödül modeli, metin için RLHF'ye benzer şekilde, insanların daha yüksek oranlara sahip çıktılara doğru yayılma modelini yönlendiren bir sinyal sağlıyor. Çeşitliliğe karşı sadakati dengeleyen sınıflandırıcısız rehberlikle birleştiğinde bu, Imagen 2'nin yalnızca eğitim dağılımını eşleştirmek yerine doğrudan algılanan kalite ve hizalamayı optimize etmesine olanak tanır.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Imagen 2'nin Geleceği ve Ödül Odaklı Yayılım

Ödüle göre ayarlanmış dağıtım, kontrol edilebilir, yüksek kaliteli üretime giden varsayılan yol haline geliyor ve ödül sinyalleri, estetiğin yanı sıra güvenliği, gerçekçiliği ve adaleti de kapsayacak şekilde genişleyecek. Daha sıkı düzenleme kontrolleri, damıtma yoluyla daha hızlı örnekleme ve SynthID gibi filigranlama yoluyla standart kaynak elde etmeyi bekleyebilirsiniz. Tercih modelleri daha incelikli ve kullanıcı başına büyüdükçe, görüntü oluşturucular yapay zeka yapımı olarak izlenebilir kalırken stil ve içeriği bireysel zevklere göre giderek daha fazla özelleştirecek.

Gerçek Dünya Uygulaması

Kısa sloganlar veya etiketler gibi doğru görsel içi metinlerle pazarlama ve ürün görselleri oluşturma.

Mevcut bir fotoğraftaki nesneleri sorunsuz bir şekilde kaldırmak veya değiştirmek için iç boyama.

Bir sahneyi farklı düzenler, afişler veya en boy oranlarına göre genişletmek için dış boyama.

İstemlerin ve oluşturulan metnin çeşitli dillerde göründüğü, kaynak açısından SynthID ile filigranlanmış, çok dilli yaratıcı varlıklar oluşturma.

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen 2 and Reward-Tuned Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Kararlı Video Dağıtımı

Sık sorulan sorular

What is Imagen 2 and Reward-Tuned Diffusion?

Imagen 2, Google'in fotogerçekçi difüzyon tabanlı metinden resme modelidir ve çıktılarının insanların gerçekte istedikleriyle daha iyi eşleşmesi için ödül ayarlamasıyla iyileştirilmiştir. Bu önemlidir çünkü güçlü görüntü kalitesini ve doğru metin oluşturmayı, sohbet robotlarının eğitilme şeklinden ödünç alınan hizalama teknikleriyle eşleştirir.

Imagen 2 hangi temel üretken tekniği kullanıyor?

Imagen 2 bir yayılma modelidir: rastgele gürültüyü metinle yönlendirilen ayrıntılı bir görüntüye dönüştürerek gürültü sürecini tersine çevirmeyi öğrenir.

Ödül ayarı Imagen 2'ye ne katıyor?

Ödül ayarı, insan tercihlerine göre eğitilmiş bir ödül modeli kullanarak modele ince ayar yaparak onu daha yüksek puanlı, daha iyi hizalanmış görüntülere doğru yönlendirir.

Imagen 2'nin ödül ayarlaması, dil modeli eğitimindeki hangi tekniğe benziyor?

Ödül ayarlaması kavramsal olarak RLHF'ye benzer: Tercihe göre eğitilmiş bir ödül modeli, insanların tercih ettiği çıktılara yönelik ince ayar yapılmasına rehberlik eder.

Imagen 2 metin istemini nasıl anlıyor?

Imagen 2, istemi zengin metin yerleştirmeleri halinde kodlamak için büyük bir donmuş dil modeli kullanma şeklindeki Imagen tarifini takip eder.

Imagen 2 görüntüleri ile SynthID ne için kullanılır?

SynthID, yapay zeka tarafından oluşturulan görüntülerin bazı düzenlemelerden sonra bile kaynağının tespit edilebilmesi için görünmez bir filigran ekler.