Görsel Yapay Zeka KILAVUZU

Sıfır-1'den 3'e Roman Görünümü Dağıtımı

Sıfır-1'den 3'e, istediğiniz kamera dönüşüne bağlı bir yayılma modeli kullanarak, bir nesnenin tek bir fotoğrafını aynı nesnenin herhangi bir yeni açıdan görülen görüntülerine dönüştürür.

2 min readSon güncelleme

Genel Bakış

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Derin Dalış

Sıfır-1'den 3'e (Columbia, 2023'ten), Kararlı Difüzyona ince ayar yaparak tek bir giriş görüntüsünden sıfır atışlı yeni görünüm sentezi gerçekleştirebilir. Ona tek bir resim artı göreceli bir kamera dönüşümü (döndürme ve küçük bir çeviri) beslersiniz ve model, nesnenin bu yeni bakış açısından nasıl görüneceğini üretir. Ana fikir, büyük web görüntü koleksiyonları üzerinde eğitilen büyük 2 boyutlu yayılma modellerinin, nesnelerin 3 boyutlu olarak nasıl göründüğüne ilişkin geometrik ve fiziksel öncelikleri örtülü olarak absorbe etmesidir. Model, birçok kontrollü kamera açısından (Objaverse kullanılarak) oluşturulan sentetik bir nesne veri kümesi üzerinde ince ayar yaparak, bu öncelikleri açık kamera kontrolüne eşlemeyi öğrenir. Oluşturulan görünümler daha sonra aşağı akışlı 3D yeniden yapılandırmayı besleyebilir.

Teknik Bilgi

Kaynak görüntüdeki model koşulları iki şekildedir: Çapraz dikkati yönlendirmek için bir CLIP yerleştirmesi ilgili kamera pozuyla (azimut, yükseklik, yarıçap) birleştirilirken ham görüntü, ince ayrıntıların ve kimliğin korunması için gürültülü gizli görüntüye kanalla birleştirilir. Eğitim, CAD nesnelerinden oluşturulan görüntü-poz-görüntü üçlülerini kullanır, böylece ağ, bir bakış açısı değişikliği ile bunun sonucunda ortaya çıkan piksel değişikliği arasındaki kontrol edilebilir eşlemeyi öğrenir.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Sıfır 1'den 3'e Roman Görünümü Yayılımının Geleceği

Sıfır 1'den 3'e, görüntüden 3D'ye ardışık düzen dalgasının tohumunu attı. Zero123-XL, SyncDreamer ve One-2-3-45 gibi halefler, çoklu görüntü tutarlılığına ve daha hızlı, daha güvenilir 3D ağ çıktısına doğru ilerlerken, Gaussian Splatting ve büyük yeniden yapılandırma modelleriyle entegrasyon, üretim süresini dakikalardan saniyelere indiriyor. Bakış açısıyla kontrol edilebilen bu yayılma modelleri, içerik oluşturma için standart araçlara dönüştükçe daha sıkı görüntü tutarlılığı, daha yüksek çözünürlük ve gerçek dünyaya (yalnızca sentetik nesne değil) genelleme bekleyebilirsiniz.

Gerçek Dünya Uygulaması

Tek bir ürün fotoğrafının döner tabla görünümlerini oluşturarak bir e-ticaret listesinin ürünü her yönden gösterebilmesini sağlamak

AR önizlemeleri için sıradan bir telefon anlık görüntüsünden bir nesnenin dokulu 3B ağını önyükleme

Oyun ve film konsept sanatçıları için bir karakterin veya sahne donanımının tutarlı, çok açılı referans sanatının oluşturulması

Görünmeyen geometriyi doldurmak için sentezlenmiş yeni görünümleri NeRF veya Gaussian Splatting yeniden yapılandırmasına besleme

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Roman Görünümü Sentezi

Sık sorulan sorular

What is Zero-1-to-3 Novel View Diffusion?

Sıfır-1'den 3'e, istediğiniz kamera dönüşüne bağlı bir yayılma modeli kullanarak, bir nesnenin tek bir fotoğrafını aynı nesnenin herhangi bir yeni açıdan görülen görüntülerine dönüştürür. Bu önemlidir çünkü nesneyi birden çok taraftan taramanıza gerek kalmadan 3 boyutlu tutarlı görünümleri yeniden oluşturmanıza olanak tanır.

Yeni bir görünüm oluşturmak için Sıfır 1'den 3'e kadar tek bir görüntünün yanı sıra temel girdi nedir?

Sıfır-1'den 3'e, tek bir görüntü artı göreceli bir kamera pozuna göre koşullandırılır, böylece istenen bakış açısına göre döndürme ve çeviriyi siz belirlersiniz.

Sıfır 1'den 3'e ince ayar yapılarak oluşturulan model hangisidir?

Önceden eğitilmiş büyük bir 2D yayılma modeline ince ayar yapar, böylece web görüntülerinden dolaylı olarak öğrenilen modellerin geometrik önceliklerinden yararlanabilir.

Bir 2D yayılma modeli neden sıfır atışlı yeni görünüm sentezi gerçekleştirebiliyor?

Büyük ölçekli 2B eğitim, nesnelerin 3B'de nasıl göründüğüne ilişkin örtülü bilgi sağlar; bu ince ayar, kamera pozu yoluyla kontrol edilebilir hale getirir.

Sıfır 1'den 3'e eğitimin merkezinde hangi 3 boyutlu nesne veri kümesi vardı?

Objaverse gibi büyük sentetik 3 boyutlu nesne koleksiyonlarından oluşturulan görüntü-poz-görüntü üçlüleri üzerinde eğitildi.

Kaynak görüntünün ince ayrıntıları nesilde nasıl korunuyor?

Ham görüntü, gürültülü gizli görüntüye (anlambilim için bir CLIP yerleştirmenin yanı sıra) kanalla birleştirilmiştir, böylece kimlik ve ayrıntı devam eder.