Görsel Yapay Zeka KILAVUZU

Otoregresif Görüntü Üretimi

Otoregresif görüntü oluşturma, resimleri her defasında tek parça halinde oluşturur ve her bir belirteci, kendisinden önce oluşturulan her şeyden tahmin eder.

2 min readSon güncelleme

Genel Bakış

It matters because the same next-token machinery powering language models can produce coherent, controllable images.

Derin Dalış

Otoregresif görüntü oluşturma, bir resmi bir dizi olarak ele alır ve her yeni öğenin öncekilerin tümüne koşullandırıldığı öğe öğeyi tahmin eder. PixelRNN ve PixelCNN gibi ilk çalışmalar, görüntüleri her seferinde bir ham piksel olarak tahmin ederek satır satır tarıyordu; bu yavaş ama teorik olarak temizdi. Modern sistemler bunun yerine önce bir görüntüyü VQ-VAE tarzı bir kodlayıcı kullanarak ayrı jetonlardan oluşan bir ızgaraya sıkıştırır, ardından bir Transformer bu jetonları soldan sağa tahmin eder. OpenAI'nin DALL-E 1'i ve Google'nin Parti'si bu tarifi takip ederek, kodlarını piksellere dönüştürmeden önce bir metin istemine göre koşullandırılan görüntü jetonları oluşturdu. En büyük avantaj, tam olasılık modellemesi ve dille paylaşılan birleşik bir mimaridir. Maliyet sıralı, yavaş örneklemedir.

Teknik Bilgi

Model, tüm belirteçlerin ortak olasılığını koşullu ifadelerin bir çarpımı halinde faktörize eder: p(x) = x_1...x_{i-1} verildiğinde p(x_i'nin çarpımı). Nedensel (maskeli) dikkati olan bir Transformer, her konumun yalnızca önceki jetonları görmesini zorunlu kılar. Eğitim sırasında öğretmen zorlamasını kullanarak her jetonu paralel olarak tahmin eder, ancak çıkarım yaparken her seferinde bir jetonu örneklemesi ve her birini geri beslemesi gerekir. Öğrenilmiş bir kod kitabı, jetonları görüntü yamalarına geri eşler ve bir kod çözücü bunları son piksellere üst örneklendirir.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Otoregresif Görüntü Üretiminin Geleceği

Hız, merkezi savaş alanıdır. Paralel ve maskeli jeton kod çözme (MaskGIT, Muse) gibi teknikler aynı anda birçok jeton üretiyor ve dil modellerinden alınan spekülatif kod çözme, görüntülere uyarlanıyor. Araştırmacılar ayrıca metin ve görüntü belirteçlerini tek bir otoregresif omurgada birleştiriyor, böylece çok modlu sistemlerde görüldüğü gibi bir model okuyabilir ve çizebilir. Belirteçlerin kontrol edilebilirliğini ve yayılma kalitesini yakalayan hibrit modellerle, otoregresif ve yayılma fikirlerinin harmanlanmaya devam etmesini bekleyin.

Gerçek Dünya Uygulaması

DALL-E 1, bir metin başlığından ayrık görüntü belirteçlerinden oluşan bir ızgarayı otomatik regresif olarak tahmin ederek görüntüler oluşturdu.

Google'in Parti'si, ayrıntılı, hızlı ve aslına uygun sahneler için otoregresif bir metin-görüntü Transformatörünü 20 milyar parametreye ölçeklendirdi.

PixelCNN ve PixelRNN ham piksel piksel oluşturmayı gösterdi ve hala olabilirliğe dayalı modeller için öğretim temelleri olarak kullanılıyor.

MaskGIT ve Muse, otoregresif tarzda eğitimi korurken jeton tabanlı görüntü sentezini hızlandırmak için paralel maskeli jeton kod çözme kullanır.

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Autoregressive Image Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Yapay Zeka Görüntü Oluşturma

Sık sorulan sorular

What is Autoregressive Image Generation?

Otoregresif görüntü oluşturma, resimleri her defasında tek parça halinde oluşturur ve her bir belirteci, kendisinden önce oluşturulan her şeyden tahmin eder. Bu önemlidir çünkü dil modellerine güç veren aynı sonraki jetonlu makineler tutarlı, kontrol edilebilir görüntüler üretebilir.

İmaj üretimi bağlamında 'otoregresif' ne anlama geliyor?

Otoregresif modeller, görüntüyü bir dizi olarak faktörlere ayırır ve her simgeyi veya pikseli, kendisinden önce oluşturulan tüm öğelere dayalı olarak tahmin eder.

DALL-E 1 gibi modern otoregresif görüntü modelleri, genellikle bir görüntüyü tahmin etmeden önce nasıl temsil eder?

Modern sistemler, görüntüyü ayrı belirteçler halinde sıkıştırır (genellikle VQ-VAE tarzı bir kodlayıcı aracılığıyla), ardından bir Transformer ile bu belirteç sırasını tahmin eder.

Hangi eski modeller her seferinde bir ham piksellik görüntüler üretiyordu?

PixelRNN ve PixelCNN, görüntüleri piksel piksel tarayan ve tahmin eden otoregresif modellere öncülük ediyordu.

Hangi mekanizma bir Transformer'ın otoregresif oluşturma sırasında yalnızca daha önceki belirteçlerle ilgilenmesini sağlar?

Nedensel maskeleme, her pozisyonun gelecekteki belirteçlere katılmasını engelleyerek soldan sağa çarpanlara ayırmayı zorunlu kılar.

Otoregresif görüntü örneklemenin temel pratik dezavantajı nedir?

Her jeton bir öncekine bağlı olduğundan, çıkarımın jeton bazında yürütülmesi gerekir, bu da üretimi nispeten yavaşlatır.