CogVideo i CogVideoX
CogVideo (2022) był pierwszym otwartym modelem zamiany tekstu na wideo na dużą skalę, a CogVideoX (2024) to jego znacznie wydajniejszy następca typu open source od Tsinghua/Zhipu AI.
Przegląd
They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.
Głębokie nurkowanie
CogVideo, wydany w 2022 r., opiera się na transformatorze zamiany tekstu na obraz CogView2 i wykorzystuje podejście autoregresyjne z dużą liczbą klatek na sekundę do generowania krótkich klipów, stając się pierwszym otwarcie wydanym dużym modelem zamiany tekstu na wideo i obsługującym podpowiedzi w języku chińskim i angielskim. Jego następca na rok 2024, CogVideoX, został całkowicie przeprojektowany: wykorzystuje przyczynowy autokoder 3D do kompresji wideo zarówno w przestrzeni, jak i w czasie, a następnie Expert Transformer z celem rozpowszechniania, który wspólnie nadzoruje połączone ze sobą tokeny tekstowe i wideo. Modele CogVideoX (w rozmiarach takich jak parametry 2B i 5B) generują kilka sekund spójnego, dynamicznego wideo w rozdzielczościach takich jak 720x480 i obsługują konwersję obrazu na wideo oraz kontynuację wideo. Co najważniejsze, wagi i kod są publiczne, co napędza falę udoskonaleń, narzędzi i badań społeczności.
Wgląd techniczny
Przyczynowy VAE 3D firmy CogVideoX zmniejsza surowe wideo do kompaktowej ukrytej objętości, zmniejszając liczbę tokenów, dzięki czemu transformator może modelować długie sekwencje w przystępnej cenie. Expert Transformer stosuje normę warstwy adaptacyjnej i łączy tokeny tekstowe i wizualne, dzięki czemu te dwie modalności bezpośrednio współdziałają ze sobą, poprawiając dopasowanie tekstu i wideo. Stopniowe szkolenie w zakresie zwiększania rozdzielczości i czasu trwania, a także staranne opisywanie danych, zapewnia płynniejszy i bardziej wierny semantycznie ruch.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość CogVideo i CogVideoX
Jako jeden z najsilniejszych otwartych modeli wideo, CogVideoX stanowi bazę dla szybko rozwijającego się ekosystemu precyzyjnych ustawień, adapterów sterujących i rozszerzeń o dłuższym czasie trwania. Spodziewaj się ciągłego wzrostu długości klipów, rozdzielczości, realizmu ruchu i sterowalności, a także ściślejszej integracji z procesami przetwarzania obrazu na wideo i edycji. Jego otwarte wagi oznaczają, że organizacje non-profit, badacze i małe studia mogą opierać się na generacji wideo najwyższej klasy bez zastrzeżonego nadzoru, przyspieszając zarówno kreatywne, jak i skoncentrowane na bezpieczeństwie eksperymenty.
Implementacja w świecie rzeczywistym
Generowanie krótkiego klipu narracyjnego z chińskiego lub angielskiego podpowiedzi przy użyciu całkowicie otwartych wag
Przekształcanie pojedynczego przesłanego nieruchomego obrazu w ruchomy film za pomocą funkcji przetwarzania obrazu na wideo CogVideoX
Dostosowywanie otwartego modelu do niestandardowego stylu lub postaci na potrzeby animacji niezależnej
Naukowcy porównują nowe metody generowania wideo z powtarzalnym, otwartym poziomem bazowym
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CogVideo and CogVideoX quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Edycja instrukcji InstructPix2Pix
Często zadawane pytania
What is CogVideo and CogVideoX?
CogVideo (2022) był pierwszym otwartym modelem zamiany tekstu na wideo na dużą skalę, a CogVideoX (2024) to jego znacznie wydajniejszy następca typu open source od Tsinghua/Zhipu AI. Mają znaczenie, ponieważ umożliwiają generowanie wysokiej jakości wideo w ręce otwartej społeczności, a nie tylko dużych laboratoriów korporacyjnych.
Co jest godnego uwagi w wydaniu CogVideo w 2022 r.?
CogVideo był pierwszym otwartym modelem zamiany tekstu na wideo na dużą skalę, obsługującym podpowiedzi zarówno w języku chińskim, jak i angielskim.
Co osiąga przyczynowy VAE 3D CogVideoX?
Przyczynowy VAE 3D kompresuje wideo zarówno w wymiarze przestrzennym, jak i czasowym, zmniejszając liczbę znaczników, dzięki czemu transformator może efektywnie je modelować.
W jaki sposób Expert Transformer w CogVideoX obsługuje tekst i wideo?
Expert Transformer łączy tokeny tekstowe i wizualne z adaptacyjną normalizacją, poprawiając dopasowanie między wyświetlanym i generowanym wideo.
Która grupa opracowała CogVideo i CogVideoX?
Rodzina CogVideo pochodzi od badaczy związanych z Uniwersytetem Tsinghua i Zhipu AI.
Jakie dodatkowe możliwości oprócz zamiany tekstu na wideo obsługuje CogVideoX?
CogVideoX może animować nieruchomy obraz (obraz do wideo) i rozszerzać istniejące klipy (kontynuacja) poza zwykłe podpowiedzi tekstowe.