PRZEWODNIK Wizualnej AI

Utwórz wideo z tekstu na wideo

Make-A-Video to system Meta na rok 2022, który zamienia monit tekstowy w krótki klip wideo bez konieczności szkolenia w zakresie oznaczonych par tekst-wideo.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

Głębokie nurkowanie

Funkcja Make-A-Video, ogłoszona przez Meta AI we wrześniu 2022 r., generuje kilkusekundowy film na podstawie zdania typu „pies w pelerynie superbohatera lecący po niebie”. Jego kluczową sztuczką jest oddzielenie wyglądu od ruchu: model tekstu na obraz (zbudowany na wspólnej przestrzeni tekst-obraz i rozproszeniu w stylu CLIP) uczy się, jak rzeczy wyglądają na podstawie miliardów obrazów z napisami, podczas gdy oddzielne warstwy czasoprzestrzenne uczą się, jak rzeczy się poruszają na podstawie samego wideo bez etykiety. Pozwala to uniknąć niedoboru wysokiej jakości par tekst-wideo. Model podstawowy tworzy klipy o niskiej rozdzielczości i niskiej liczbie klatek na sekundę, następnie dedykowane sieci interpolują dodatkowe klatki i zapewniają ekskluzywną rozdzielczość przestrzenną. Rezultat był uderzająco spójny jak na swoją epokę, chociaż klipy były krótkie, rozmyte i podatne na migotanie i wypaczanie.

Wgląd techniczny

Make-A-Video rozszerza sploty i uwagę związane z generowaniem obrazu 2D na 3D, dodając warstwy pseudotymczasowe. Wstępnie wytrenowane wagi przestrzenne są zamrażane lub dostrajane, podczas gdy nowe warstwy tymczasowe uczą się ruchu z surowego wideo, więc nie są potrzebne żadne etykiety tekstowe wideo. Następnie sieć interpolacji klatek zagęszcza oś czasu, a moduły dyfuzyjne o super rozdzielczości uwydatniają szczegóły przestrzenne, przekształcając gruby szkic składający się z 16 klatek o niskiej rozdzielczości w gładszy i ostrzejszy klip w kaskadowym potoku.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość przetwarzania tekstu na wideo w formacie Make-A-Video

Receptura Make-A-Video oparta na obrazie przed i ruchu bez etykiety zapoczątkowała całą falę konwersji tekstu na wideo. Jego potomkowie kładą nacisk na dłuższe, czasowo stabilne klipy o wyższej rozdzielczości z kontrolowanym ruchem kamery i dźwiękiem. Można się spodziewać, że podstawowa idea, czyli ponowne wykorzystanie ogromnej wiedzy o obrazie i niedrogie uczenie się ruchu, będzie trwała nawet wtedy, gdy architektury będą zmierzać w kierunku utajonego rozpowszechniania opartego na transformatorach i ujednoliconych modeli, które akceptują również warunkowanie obrazu lub wideo do edycji i kontynuacji.

Implementacja w świecie rzeczywistym

Animacja pojedynczego zdania opisowego w krótki, zapętlony klip do wpisu w mediach społecznościowych

Ożywienie statycznej koncepcji, takiej jak „miś malujący portret”, w postaci poruszającej ilustracji

Interpolacja pomiędzy dwoma nieruchomymi obrazami dostarczonymi przez użytkownika w celu stworzenia płynnego przejścia wideo

Generowanie szybkich szkiców wyimaginowanych scen do tworzenia scenorysów przed filmowaniem

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Sora i zamiana tekstu na wideo

Często zadawane pytania

What is Make-A-Video Text-to-Video?

Make-A-Video to system Meta na rok 2022, który zamienia monit tekstowy w krótki klip wideo bez konieczności szkolenia w zakresie oznaczonych par tekst-wideo. Ma to znaczenie, ponieważ pokazało, że wiedzę wizualną zawartą w modelach zamiany tekstu na obraz można „nauczyć” poruszania się wyłącznie przy użyciu nieoznakowanego materiału wideo.

Jaka była główna innowacja, która pozwoliła Make-A-Video uniknąć konieczności tworzenia par tekst-wideo z etykietami?

Make-A-Video rozwiązuje problem: model zamiany tekstu na obraz uczy się, jak rzeczy wyglądają na podstawie obrazów z napisami, podczas gdy oddzielne warstwy czasowe uczą się ruchu z surowego, nieoznakowanego wideo.

W jaki sposób Make-A-Video dodaje możliwość ruchu do modelu obrazu?

Rozszerza sploty przestrzenne 2D i uwagę dzięki nowym warstwom czasowym, które uczą się, jak treść zmienia się w czasie.

Do czego służą etapy interpolacji klatek i super rozdzielczości?

Po zgrubnym szkicu o niskiej rozdzielczości i niskiej liczbie klatek na sekundę, interpolacja dodaje klatki, a moduły o super rozdzielczości podnoszą rozdzielczość.

Jakie było typowe ograniczenie wyjścia Make-A-Video?

Klipy trwały tylko kilka sekund, miały stosunkowo niską rozdzielczość i były podatne na chwilowe migotanie i zniekształcenia.