Rozpowszechnianie nowatorskich poglądów od zera 1 do 3
Zero 1 do 3 zamienia pojedyncze zdjęcie obiektu w obrazy tego samego obiektu widzianego pod dowolnym nowym kątem, korzystając z modelu dyfuzji uwarunkowanego żądanym obrotem aparatu.
Przegląd
It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.
Głębokie nurkowanie
Zero-1 do 3 (z Columbia, 2023) precyzyjnie dostraja Stable Diffusion, dzięki czemu może przeprowadzić syntezę nowego widoku zerowego z jednego obrazu wejściowego. Podajesz mu pojedynczy obraz i względną transformację kamery (obrót i małe przesunięcie), a model generuje, jak obiekt będzie wyglądał z nowego punktu widzenia. Kluczową ideą jest to, że duże modele dyfuzyjne 2D, wyszkolone na ogromnych kolekcjach obrazów internetowych, pośrednio wchłonęły geometryczne i fizyczne założenia dotyczące wyglądu obiektów w 3D. Dostrajając syntetyczny zbiór danych obiektów renderowanych pod wieloma kontrolowanymi kątami kamery (przy użyciu Objaverse), model uczy się mapować te priorytety na wyraźne sterowanie kamerą. Wygenerowane widoki mogą następnie posłużyć do późniejszej rekonstrukcji 3D.
Wgląd techniczny
Model warunkuje obraz źródłowy na dwa sposoby: osadzanie CLIP jest łączone ze względną pozycją kamery (azymut, wysokość, promień), aby skierować uwagę krzyżową, podczas gdy surowy obraz jest łączony kanałowo z ukrytym szumem, dzięki czemu zostają zachowane drobne szczegóły i tożsamość. Trening wykorzystuje trojaczki obraz-pozycja-obraz renderowane z obiektów CAD, dzięki czemu sieć uczy się kontrolowanego mapowania pomiędzy zmianą punktu widzenia a wynikającą z niej zmianą pikseli.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość rozpowszechniania nowatorskich poglądów od 1 do 3
Od zera 1 do 3 zapoczątkowała falę potoków przekształcania obrazu w 3D. Następcy, tacy jak Zero123-XL, SyncDreamer i One-2-3-45, dążą do spójności wielu widoków i szybszego, bardziej niezawodnego tworzenia siatek 3D, podczas gdy integracja z rozpryskiwaniem gaussowskim i dużymi modelami rekonstrukcji skraca czas generowania z minut do sekund. Spodziewaj się większej spójności widoku, wyższej rozdzielczości i uogólnienia świata rzeczywistego (a nie tylko obiektów syntetycznych), gdy te modele dyfuzji kontrolowane z punktu widzenia dojrzewają do standardowych narzędzi do tworzenia treści.
Implementacja w świecie rzeczywistym
Generowanie widoków pojedynczego zdjęcia produktu z obrotnicy, aby oferta e-commerce mogła pokazać przedmiot ze wszystkich stron
Ładowanie teksturowanej siatki 3D obiektu z jednej zwykłej migawki telefonu na potrzeby podglądów AR
Tworzenie spójnych, wielokątowych grafik referencyjnych postaci lub rekwizytów dla twórców koncepcji gier i filmów
Wprowadzanie zsyntetyzowanych nowych poglądów do rekonstrukcji NeRF lub Gaussa Splatting w celu wypełnienia niewidocznej geometrii
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Nowatorska synteza poglądów
Często zadawane pytania
What is Zero-1-to-3 Novel View Diffusion?
Zero 1 do 3 zamienia pojedyncze zdjęcie obiektu w obrazy tego samego obiektu widzianego pod dowolnym nowym kątem, korzystając z modelu dyfuzji uwarunkowanego żądanym obrotem aparatu. Ma to znaczenie, ponieważ umożliwia rekonstrukcję spójnych widoków 3D bez konieczności skanowania obiektu z wielu stron.
Jakie podstawowe dane wejściowe są potrzebne od zera do trzech oprócz pojedynczego obrazu, aby wygenerować nowy widok?
Wartość od zera do trzech jest uzależniona od pojedynczego obrazu i względnej pozycji aparatu, więc użytkownik określa obrót i przesunięcie do żądanego punktu widzenia.
Od zera do trzech powstaje poprzez dostrojenie jakiego rodzaju modelu?
Dostosowuje duży, wstępnie wytrenowany model dyfuzji 2D, dzięki czemu może wykorzystać geometryczne priorytety tych modeli, które zostały w sposób dorozumiany wyuczone z obrazów internetowych.
Dlaczego model dyfuzji 2D w ogóle może przeprowadzić syntezę nowatorskiego widoku zerowego?
Szkolenie 2D na dużą skalę przekazuje ukrytą wiedzę na temat wyglądu obiektów w 3D, której precyzyjne dostrojenie umożliwia sterowanie za pomocą pozycji kamery.
Jaki zbiór danych obiektów 3D miał kluczowe znaczenie w szkoleniu od zera 1 do 3?
Został wyszkolony na trójkach obrazu, pozycji i obrazu renderowanych z dużych kolekcji syntetycznych obiektów 3D, takich jak Objaverse.
W jaki sposób podczas generacji zachowywane są drobne szczegóły obrazu źródłowego?
Surowy obraz jest łączony kanałowo z ukrytym szumem (wraz z osadzeniem CLIP dla semantyki), dzięki czemu zachowana jest tożsamość i szczegóły.