Utwórz wideo z tekstu na wideo
Make-A-Video to system Meta na rok 2022, który zamienia monit tekstowy w krótki klip wideo bez konieczności szkolenia w zakresie oznaczonych par tekst-wideo.
Przegląd
It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.
Głębokie nurkowanie
Funkcja Make-A-Video, ogłoszona przez Meta AI we wrześniu 2022 r., generuje kilkusekundowy film na podstawie zdania typu „pies w pelerynie superbohatera lecący po niebie”. Jego kluczową sztuczką jest oddzielenie wyglądu od ruchu: model tekstu na obraz (zbudowany na wspólnej przestrzeni tekst-obraz i rozproszeniu w stylu CLIP) uczy się, jak rzeczy wyglądają na podstawie miliardów obrazów z napisami, podczas gdy oddzielne warstwy czasoprzestrzenne uczą się, jak rzeczy się poruszają na podstawie samego wideo bez etykiety. Pozwala to uniknąć niedoboru wysokiej jakości par tekst-wideo. Model podstawowy tworzy klipy o niskiej rozdzielczości i niskiej liczbie klatek na sekundę, następnie dedykowane sieci interpolują dodatkowe klatki i zapewniają ekskluzywną rozdzielczość przestrzenną. Rezultat był uderzająco spójny jak na swoją epokę, chociaż klipy były krótkie, rozmyte i podatne na migotanie i wypaczanie.
Wgląd techniczny
Make-A-Video rozszerza sploty i uwagę związane z generowaniem obrazu 2D na 3D, dodając warstwy pseudotymczasowe. Wstępnie wytrenowane wagi przestrzenne są zamrażane lub dostrajane, podczas gdy nowe warstwy tymczasowe uczą się ruchu z surowego wideo, więc nie są potrzebne żadne etykiety tekstowe wideo. Następnie sieć interpolacji klatek zagęszcza oś czasu, a moduły dyfuzyjne o super rozdzielczości uwydatniają szczegóły przestrzenne, przekształcając gruby szkic składający się z 16 klatek o niskiej rozdzielczości w gładszy i ostrzejszy klip w kaskadowym potoku.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość przetwarzania tekstu na wideo w formacie Make-A-Video
Receptura Make-A-Video oparta na obrazie przed i ruchu bez etykiety zapoczątkowała całą falę konwersji tekstu na wideo. Jego potomkowie kładą nacisk na dłuższe, czasowo stabilne klipy o wyższej rozdzielczości z kontrolowanym ruchem kamery i dźwiękiem. Można się spodziewać, że podstawowa idea, czyli ponowne wykorzystanie ogromnej wiedzy o obrazie i niedrogie uczenie się ruchu, będzie trwała nawet wtedy, gdy architektury będą zmierzać w kierunku utajonego rozpowszechniania opartego na transformatorach i ujednoliconych modeli, które akceptują również warunkowanie obrazu lub wideo do edycji i kontynuacji.
Implementacja w świecie rzeczywistym
Animacja pojedynczego zdania opisowego w krótki, zapętlony klip do wpisu w mediach społecznościowych
Ożywienie statycznej koncepcji, takiej jak „miś malujący portret”, w postaci poruszającej ilustracji
Interpolacja pomiędzy dwoma nieruchomymi obrazami dostarczonymi przez użytkownika w celu stworzenia płynnego przejścia wideo
Generowanie szybkich szkiców wyimaginowanych scen do tworzenia scenorysów przed filmowaniem
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Make-A-Video Text-to-Video quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Sora i zamiana tekstu na wideo
Często zadawane pytania
What is Make-A-Video Text-to-Video?
Make-A-Video to system Meta na rok 2022, który zamienia monit tekstowy w krótki klip wideo bez konieczności szkolenia w zakresie oznaczonych par tekst-wideo. Ma to znaczenie, ponieważ pokazało, że wiedzę wizualną zawartą w modelach zamiany tekstu na obraz można „nauczyć” poruszania się wyłącznie przy użyciu nieoznakowanego materiału wideo.
Jaka była główna innowacja, która pozwoliła Make-A-Video uniknąć konieczności tworzenia par tekst-wideo z etykietami?
Make-A-Video rozwiązuje problem: model zamiany tekstu na obraz uczy się, jak rzeczy wyglądają na podstawie obrazów z napisami, podczas gdy oddzielne warstwy czasowe uczą się ruchu z surowego, nieoznakowanego wideo.
W jaki sposób Make-A-Video dodaje możliwość ruchu do modelu obrazu?
Rozszerza sploty przestrzenne 2D i uwagę dzięki nowym warstwom czasowym, które uczą się, jak treść zmienia się w czasie.
Do czego służą etapy interpolacji klatek i super rozdzielczości?
Po zgrubnym szkicu o niskiej rozdzielczości i niskiej liczbie klatek na sekundę, interpolacja dodaje klatki, a moduły o super rozdzielczości podnoszą rozdzielczość.
Jakie było typowe ograniczenie wyjścia Make-A-Video?
Klipy trwały tylko kilka sekund, miały stosunkowo niską rozdzielczość i były podatne na chwilowe migotanie i zniekształcenia.