PRZEWODNIK Wizualnej AI

Rozpowszechnianie nowatorskich poglądów od zera 1 do 3

Zero 1 do 3 zamienia pojedyncze zdjęcie obiektu w obrazy tego samego obiektu widzianego pod dowolnym nowym kątem, korzystając z modelu dyfuzji uwarunkowanego żądanym obrotem aparatu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Głębokie nurkowanie

Zero-1 do 3 (z Columbia, 2023) precyzyjnie dostraja Stable Diffusion, dzięki czemu może przeprowadzić syntezę nowego widoku zerowego z jednego obrazu wejściowego. Podajesz mu pojedynczy obraz i względną transformację kamery (obrót i małe przesunięcie), a model generuje, jak obiekt będzie wyglądał z nowego punktu widzenia. Kluczową ideą jest to, że duże modele dyfuzyjne 2D, wyszkolone na ogromnych kolekcjach obrazów internetowych, pośrednio wchłonęły geometryczne i fizyczne założenia dotyczące wyglądu obiektów w 3D. Dostrajając syntetyczny zbiór danych obiektów renderowanych pod wieloma kontrolowanymi kątami kamery (przy użyciu Objaverse), model uczy się mapować te priorytety na wyraźne sterowanie kamerą. Wygenerowane widoki mogą następnie posłużyć do późniejszej rekonstrukcji 3D.

Wgląd techniczny

Model warunkuje obraz źródłowy na dwa sposoby: osadzanie CLIP jest łączone ze względną pozycją kamery (azymut, wysokość, promień), aby skierować uwagę krzyżową, podczas gdy surowy obraz jest łączony kanałowo z ukrytym szumem, dzięki czemu zostają zachowane drobne szczegóły i tożsamość. Trening wykorzystuje trojaczki obraz-pozycja-obraz renderowane z obiektów CAD, dzięki czemu sieć uczy się kontrolowanego mapowania pomiędzy zmianą punktu widzenia a wynikającą z niej zmianą pikseli.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość rozpowszechniania nowatorskich poglądów od 1 do 3

Od zera 1 do 3 zapoczątkowała falę potoków przekształcania obrazu w 3D. Następcy, tacy jak Zero123-XL, SyncDreamer i One-2-3-45, dążą do spójności wielu widoków i szybszego, bardziej niezawodnego tworzenia siatek 3D, podczas gdy integracja z rozpryskiwaniem gaussowskim i dużymi modelami rekonstrukcji skraca czas generowania z minut do sekund. Spodziewaj się większej spójności widoku, wyższej rozdzielczości i uogólnienia świata rzeczywistego (a nie tylko obiektów syntetycznych), gdy te modele dyfuzji kontrolowane z punktu widzenia dojrzewają do standardowych narzędzi do tworzenia treści.

Implementacja w świecie rzeczywistym

Generowanie widoków pojedynczego zdjęcia produktu z obrotnicy, aby oferta e-commerce mogła pokazać przedmiot ze wszystkich stron

Ładowanie teksturowanej siatki 3D obiektu z jednej zwykłej migawki telefonu na potrzeby podglądów AR

Tworzenie spójnych, wielokątowych grafik referencyjnych postaci lub rekwizytów dla twórców koncepcji gier i filmów

Wprowadzanie zsyntetyzowanych nowych poglądów do rekonstrukcji NeRF lub Gaussa Splatting w celu wypełnienia niewidocznej geometrii

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Nowatorska synteza poglądów

Często zadawane pytania

What is Zero-1-to-3 Novel View Diffusion?

Zero 1 do 3 zamienia pojedyncze zdjęcie obiektu w obrazy tego samego obiektu widzianego pod dowolnym nowym kątem, korzystając z modelu dyfuzji uwarunkowanego żądanym obrotem aparatu. Ma to znaczenie, ponieważ umożliwia rekonstrukcję spójnych widoków 3D bez konieczności skanowania obiektu z wielu stron.

Jakie podstawowe dane wejściowe są potrzebne od zera do trzech oprócz pojedynczego obrazu, aby wygenerować nowy widok?

Wartość od zera do trzech jest uzależniona od pojedynczego obrazu i względnej pozycji aparatu, więc użytkownik określa obrót i przesunięcie do żądanego punktu widzenia.

Od zera do trzech powstaje poprzez dostrojenie jakiego rodzaju modelu?

Dostosowuje duży, wstępnie wytrenowany model dyfuzji 2D, dzięki czemu może wykorzystać geometryczne priorytety tych modeli, które zostały w sposób dorozumiany wyuczone z obrazów internetowych.

Dlaczego model dyfuzji 2D w ogóle może przeprowadzić syntezę nowatorskiego widoku zerowego?

Szkolenie 2D na dużą skalę przekazuje ukrytą wiedzę na temat wyglądu obiektów w 3D, której precyzyjne dostrojenie umożliwia sterowanie za pomocą pozycji kamery.

Jaki zbiór danych obiektów 3D miał kluczowe znaczenie w szkoleniu od zera 1 do 3?

Został wyszkolony na trójkach obrazu, pozycji i obrazu renderowanych z dużych kolekcji syntetycznych obiektów 3D, takich jak Objaverse.

W jaki sposób podczas generacji zachowywane są drobne szczegóły obrazu źródłowego?

Surowy obraz jest łączony kanałowo z ukrytym szumem (wraz z osadzeniem CLIP dla semantyki), dzięki czemu zachowana jest tożsamość i szczegóły.