Sıfır-1'den 3'e Roman Görünümü Dağıtımı
Sıfır-1'den 3'e, istediğiniz kamera dönüşüne bağlı bir yayılma modeli kullanarak, bir nesnenin tek bir fotoğrafını aynı nesnenin herhangi bir yeni açıdan görülen görüntülerine dönüştürür.
Genel Bakış
It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.
Derin Dalış
Sıfır-1'den 3'e (Columbia, 2023'ten), Kararlı Difüzyona ince ayar yaparak tek bir giriş görüntüsünden sıfır atışlı yeni görünüm sentezi gerçekleştirebilir. Ona tek bir resim artı göreceli bir kamera dönüşümü (döndürme ve küçük bir çeviri) beslersiniz ve model, nesnenin bu yeni bakış açısından nasıl görüneceğini üretir. Ana fikir, büyük web görüntü koleksiyonları üzerinde eğitilen büyük 2 boyutlu yayılma modellerinin, nesnelerin 3 boyutlu olarak nasıl göründüğüne ilişkin geometrik ve fiziksel öncelikleri örtülü olarak absorbe etmesidir. Model, birçok kontrollü kamera açısından (Objaverse kullanılarak) oluşturulan sentetik bir nesne veri kümesi üzerinde ince ayar yaparak, bu öncelikleri açık kamera kontrolüne eşlemeyi öğrenir. Oluşturulan görünümler daha sonra aşağı akışlı 3D yeniden yapılandırmayı besleyebilir.
Teknik Bilgi
Kaynak görüntüdeki model koşulları iki şekildedir: Çapraz dikkati yönlendirmek için bir CLIP yerleştirmesi ilgili kamera pozuyla (azimut, yükseklik, yarıçap) birleştirilirken ham görüntü, ince ayrıntıların ve kimliğin korunması için gürültülü gizli görüntüye kanalla birleştirilir. Eğitim, CAD nesnelerinden oluşturulan görüntü-poz-görüntü üçlülerini kullanır, böylece ağ, bir bakış açısı değişikliği ile bunun sonucunda ortaya çıkan piksel değişikliği arasındaki kontrol edilebilir eşlemeyi öğrenir.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Sıfır 1'den 3'e Roman Görünümü Yayılımının Geleceği
Sıfır 1'den 3'e, görüntüden 3D'ye ardışık düzen dalgasının tohumunu attı. Zero123-XL, SyncDreamer ve One-2-3-45 gibi halefler, çoklu görüntü tutarlılığına ve daha hızlı, daha güvenilir 3D ağ çıktısına doğru ilerlerken, Gaussian Splatting ve büyük yeniden yapılandırma modelleriyle entegrasyon, üretim süresini dakikalardan saniyelere indiriyor. Bakış açısıyla kontrol edilebilen bu yayılma modelleri, içerik oluşturma için standart araçlara dönüştükçe daha sıkı görüntü tutarlılığı, daha yüksek çözünürlük ve gerçek dünyaya (yalnızca sentetik nesne değil) genelleme bekleyebilirsiniz.
Gerçek Dünya Uygulaması
Tek bir ürün fotoğrafının döner tabla görünümlerini oluşturarak bir e-ticaret listesinin ürünü her yönden gösterebilmesini sağlamak
AR önizlemeleri için sıradan bir telefon anlık görüntüsünden bir nesnenin dokulu 3B ağını önyükleme
Oyun ve film konsept sanatçıları için bir karakterin veya sahne donanımının tutarlı, çok açılı referans sanatının oluşturulması
Görünmeyen geometriyi doldurmak için sentezlenmiş yeni görünümleri NeRF veya Gaussian Splatting yeniden yapılandırmasına besleme
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Roman Görünümü Sentezi
Sık sorulan sorular
What is Zero-1-to-3 Novel View Diffusion?
Sıfır-1'den 3'e, istediğiniz kamera dönüşüne bağlı bir yayılma modeli kullanarak, bir nesnenin tek bir fotoğrafını aynı nesnenin herhangi bir yeni açıdan görülen görüntülerine dönüştürür. Bu önemlidir çünkü nesneyi birden çok taraftan taramanıza gerek kalmadan 3 boyutlu tutarlı görünümleri yeniden oluşturmanıza olanak tanır.
Yeni bir görünüm oluşturmak için Sıfır 1'den 3'e kadar tek bir görüntünün yanı sıra temel girdi nedir?
Sıfır-1'den 3'e, tek bir görüntü artı göreceli bir kamera pozuna göre koşullandırılır, böylece istenen bakış açısına göre döndürme ve çeviriyi siz belirlersiniz.
Sıfır 1'den 3'e ince ayar yapılarak oluşturulan model hangisidir?
Önceden eğitilmiş büyük bir 2D yayılma modeline ince ayar yapar, böylece web görüntülerinden dolaylı olarak öğrenilen modellerin geometrik önceliklerinden yararlanabilir.
Bir 2D yayılma modeli neden sıfır atışlı yeni görünüm sentezi gerçekleştirebiliyor?
Büyük ölçekli 2B eğitim, nesnelerin 3B'de nasıl göründüğüne ilişkin örtülü bilgi sağlar; bu ince ayar, kamera pozu yoluyla kontrol edilebilir hale getirir.
Sıfır 1'den 3'e eğitimin merkezinde hangi 3 boyutlu nesne veri kümesi vardı?
Objaverse gibi büyük sentetik 3 boyutlu nesne koleksiyonlarından oluşturulan görüntü-poz-görüntü üçlüleri üzerinde eğitildi.
Kaynak görüntünün ince ayrıntıları nesilde nasıl korunuyor?
Ham görüntü, gürültülü gizli görüntüye (anlambilim için bir CLIP yerleştirmenin yanı sıra) kanalla birleştirilmiştir, böylece kimlik ve ayrıntı devam eder.