PRZEWODNIK Wizualnej AI

Kaskady obrazu wideo

Imagen Video to system zamiany tekstu na wideo firmy Google na rok 2022, który tworzy klip na podstawie kaskady siedmiu modeli dyfuzji, z których każdy dodaje więcej klatek lub większą rozdzielczość.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Ma to znaczenie, ponieważ pokazało, jak układanie wyspecjalizowanych etapów w stosy pozwala uzyskać płynny w czasie obraz o wysokiej rozdzielczości już w jednym komunikacie.

Głębokie nurkowanie

Imagen Video, wprowadzony przez firmę Google Research w październiku 2022 r., rozszerza podejście Imagen do przetwarzania tekstu na obraz na ruch. Zamrożony koder tekstu T5 zamienia zachętę w bogate osadzenie językowe, które warunkuje każdy etap. Podstawowy model dyfuzyjny najpierw generuje mały film o niskiej liczbie klatek na sekundę, a następnie kaskada sześciu kolejnych modeli dyfuzyjnych naprzemiennie wykonuje superrozdzielczość czasową (dodawanie klatek pomiędzy istniejącymi) i superrozdzielczość przestrzenną (zwiększanie rozdzielczości pikseli). Pełny potok generuje wideo w rozdzielczości około 1280x768 przy 24 klatkach na sekundę i trwa kilka sekund. Ponieważ koder tekstu zapewnia głębokie zrozumienie języka, Imagen Video może renderować czytelny stylizowany tekst, zróżnicowaną estetykę artystyczną i ruch obiektów uwzględniający trójwymiarowość, demonstrując, że staranna inscenizacja przewyższa próbę zrobienia wszystkiego w jednym gigantycznym modelu.

Wgląd techniczny

Kaskada dzieli niemożliwie trudne, jednorazowe pokolenie na możliwe do rozwiązania podproblemy. Siedem modeli dyfuzyjnych działa sekwencyjnie: jeden generator bazowy oraz trzy modele przestrzenne i trzy czasowe modele superrozdzielczości. Każdy jest uwarunkowany szybkim osadzeniem i wynikami poprzedniego etapu. Techniki takie jak parametryzacja v-predykcji i destylacja progresywna przyspieszają pobieranie próbek, podczas gdy wskazówki pozbawione klasyfikatorów wzmacniają szybkie przestrzeganie zasad na każdym etapie łańcucha.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość kaskad wideo Imagen

Kaskadowe potoki w przestrzeni pikseli potwierdziły tę koncepcję, ale wymagają dużej liczby obliczeń i są powolne. Dziedzina ta w dużej mierze przesunęła się w stronę utajonej dyfuzji i szkieletów transformatorów, które generują w skompresowanej przestrzeni, obniżając koszty przy jednoczesnym zachowaniu jakości. Mimo to lekcja Imagen Video, dotycząca oddzielania zadań związanych z „co”, „jak się porusza” i „jak ostry”, w dalszym ciągu wpływa na wieloetapowe i udoskonalone projekty, a styl kondycjonowania T5 wpłynął na późniejsze generatory o wysokiej wierności i wierności tekstowi.

Implementacja w świecie rzeczywistym

Tworzenie klipu w wysokiej rozdzielczości z czytelnym, stylizowanym tekstem na ekranie z poziomu zachęty

Renderowanie tej samej opisanej sceny w wielu stylach graficznych, od akwareli po claymation

Generowanie krótkich animacji obiektów obsługujących 3D, takich jak obracająca się, poruszająca się rzeźba

Tworzenie płynnych klipów marketingowych lub koncepcyjnych w szybkości 24 klatek na sekundę bezpośrednio na podstawie pisemnego opisu

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen Video Cascades quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Sora i zamiana tekstu na wideo

Często zadawane pytania

Co to są kaskady obrazu Imagen?

Imagen Video to system zamiany tekstu na wideo firmy Google na rok 2022, który tworzy klip na podstawie kaskady siedmiu modeli dyfuzji, z których każdy dodaje więcej klatek lub większą rozdzielczość. Ma to znaczenie, ponieważ pokazało, jak układanie wyspecjalizowanych etapów w stosy pozwala uzyskać płynny w czasie obraz o wysokiej rozdzielczości już w jednym komunikacie.

Ile modeli dyfuzji tworzy kaskadę Imagen Video?

Imagen Video wykorzystuje siedem modeli dyfuzyjnych: jeden generator bazowy oraz trzy modele przestrzenne i trzy czasowe o superrozdzielczości.

Do czego służy czasowy stopień superrozdzielczości w kaskadzie?

Tymczasowa superrozdzielczość interpoluje dodatkowe klatki w celu zwiększenia liczby klatek na sekundę, podczas gdy superrozdzielczość przestrzenna zwiększa rozdzielczość pikseli.

Jaki komponent koduje zachętę tekstową w programie Imagen Video?

Imagen Video, podobnie jak Imagen, wykorzystuje duży, zamrożony koder tekstu T5 do tworzenia osadzania, które warunkują każdy etap dyfuzji.

Po co dzielić pokolenie na kaskadę, a nie na jeden duży model?

Każdy etap rozwiązuje węższe zadanie, generując zgrubną wersję roboczą, dodając klatki lub dodając rozdzielczość, co jest łatwiejsze do wykonania niż robienie wszystkiego na raz.

Jakie możliwości zademonstrował w szczególności Imagen Video?

Dzięki silnemu zrozumieniu tekstu T5, Imagen Video może renderować czytelny tekst stylizowany i szeroki zakres estetyki artystycznej.