Görsel Yapay Zeka KILAVUZU

VQ-VAE ve Ayrık Latentler

VQ-VAE, görüntüleri, sesleri veya videoları sürekli sayılar yerine öğrenilmiş bir kod kitabından alınan ayrı kodlardan oluşan küçük bir ızgaraya sıkıştırır.

2 min readSon güncelleme

Genel Bakış

This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.

Derin Dalış

Van den Oord ve DeepMind'deki meslektaşları tarafından 2017 yılında tanıtılan VQ-VAE (Vektör Nicelemeli Değişken Otomatik Kodlayıcı), gizli alanı ayrık olan bir otomatik kodlayıcıdır. Kodlayıcı, görüntüyü sürekli vektörlerden oluşan bir ızgaraya dönüştürür; Daha sonra her vektör, öğrenilmiş bir yerleştirme kod kitabındaki (vektör nicemleme) en yakın girişine tutturulur. Kod çözücü, görüntüyü bu nicelenmiş kodlardan yeniden oluşturur. Gizli öğeler artık sınırlı bir endeks sözlüğü olduğundan, ayrı bir model bunların dağıtımını öğrenebilir ve yeni içerik oluşturabilir. Bu iki aşamalı tarif, DALL-E 1'e, müzik için Jukebox'a ve daha keskin yeniden yapılandırmalar için algısal ve düşmanca kayıp ekleyen VQGAN'a güç veriyor. VQ-VAE-2, yüksek kaliteli görüntüler üretmek için birden fazla çözünürlüğü bir araya getirdi.

Teknik Bilgi

Niceleme adımı (argmin en yakın komşu araması) türevlendirilemez, bu nedenle VQ-VAE düz bir tahmin aracı kullanır: degradeler, sanki niceleme kimlikmiş gibi doğrudan kod çözücü girişinden kodlayıcı çıkışına geri kopyalanır. Eğitim, bir yeniden yapılandırma kaybını, yerleştirmeleri kodlayıcı çıktılarına çeken bir kod kitabı kaybını ve kodlayıcının seçilen kodlara bağlı kalmasını sağlayan bir taahhüt kaybını birleştirir. Yaygın bir başarısızlık, yalnızca birkaç kodun kullanıldığı kod kitabının çökmesidir.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

VQ-VAE'nin Geleceği ve Ayrık Latentler

Ayrık latentler, görüntüleri, sesi ve videoyu metinle aynı kelime dağarcığına dönüştüren birleşik çok modlu modellere doğru ilerlemenin merkezinde yer alıyor. Artık ve sonlu skaler nicemleme, daha büyük kod kitapları ve daha iyi kullanım dengeleme gibi iyileştirmeler çökmeyi azaltıyor ve aslına uygunluğu artırıyor. Modeller, yöntemleri hem anlamayı hem de üretmeyi hedeflediğinden, VQ-VAE fikirleri üzerine inşa edilen sağlam tokenlaştırıcılar, sürekli gizli yayılma yaklaşımlarıyla giderek daha fazla rekabet eden ve birleşen temel bir bileşen olarak kalacaktır.

Gerçek Dünya Uygulaması

DALL-E 1 ayrı bir VQ-VAE tokenizer kullandı, böylece Transformer kod kitabı indekslerinin dizileri halinde görüntüler üretebildi.

VQGAN, sanat üretimi için net, yüksek çözünürlüklü görüntü belirteçleri üretmek amacıyla VQ-VAE'yi rakip ve algısal kayıplarla birleştirdi.

OpenAI'nin Jukebox'ı ham sese VQ-VAE uygulayarak müziği üretken modelleme için ayrı kodlara sıkıştırdı.

VQ-VAE-2, çağının GAN'larına rakip olacak çeşitli, yüksek kaliteli görüntüleri sentezlemek için hiyerarşik ayrık latentleri istifledi.

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQ-VAE and Discrete Latents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Gizli Harmanlama ve Görüntü Enterpolasyonu

Sık sorulan sorular

What is VQ-VAE and Discrete Latents?

VQ-VAE, görüntüleri, sesleri veya videoları sürekli sayılar yerine öğrenilmiş bir kod kitabından alınan ayrı kodlardan oluşan küçük bir ızgaraya sıkıştırır. Bu ayrık darboğaz, Transformers gibi güçlü dizi modellerinin medyayı tıpkı kelimeler gibi 'belirteç' olarak ele almasına olanak tanır.

VQ-VAE'nin gizli alanını standart VAE'lerden farklı kılan nedir?

VQ-VAE, sürekli gizli kodları, vektör nicemleme yoluyla öğrenilmiş bir kod kitabından alınan ayrı kodlarla değiştirir.

VQ-VAE, gradyanları diferansiyellenemeyen kuantizasyon adımından nasıl geçirir?

Düz tahmin edici, kod çözücü-giriş gradyanını doğrudan kodlayıcı çıkışına kopyalar ve nicelemeyi geri geçiş için kimlik olarak ele alır.

'Kod kitabı çöküşü' nedir?

Kod kitabının çökmesi, model yalnızca birkaç koda dayandığında kod kitabının çoğunu boşa harcayarak çeşitliliğe zarar verdiğinde meydana gelir.

Transformers'la üretken modelleme için ayrık latentler neden faydalıdır?

Ayrık endeksler sınırlı bir kelime dağarcığı oluşturur; böylece Transformers gibi dizi modelleri, tıpkı kelimeler gibi dağıtımlarını öğrenebilir ve örnekleyebilir.

VQGAN, temel VQ-VAE tarifinin üstüne ne ekledi?

VQGAN, VQ-VAE'yi bir ayırıcı ve algısal kayıpla güçlendirerek daha canlı, daha ayrıntılı yeniden oluşturulmuş tokenlar sağlar.