PRZEWODNIK Wizualnej AI

CogVideo i CogVideoX

CogVideo (2022) był pierwszym otwartym modelem zamiany tekstu na wideo na dużą skalę, a CogVideoX (2024) to jego znacznie wydajniejszy następca typu open source od Tsinghua/Zhipu AI.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.

Głębokie nurkowanie

CogVideo, wydany w 2022 r., opiera się na transformatorze zamiany tekstu na obraz CogView2 i wykorzystuje podejście autoregresyjne z dużą liczbą klatek na sekundę do generowania krótkich klipów, stając się pierwszym otwarcie wydanym dużym modelem zamiany tekstu na wideo i obsługującym podpowiedzi w języku chińskim i angielskim. Jego następca na rok 2024, CogVideoX, został całkowicie przeprojektowany: wykorzystuje przyczynowy autokoder 3D do kompresji wideo zarówno w przestrzeni, jak i w czasie, a następnie Expert Transformer z celem rozpowszechniania, który wspólnie nadzoruje połączone ze sobą tokeny tekstowe i wideo. Modele CogVideoX (w rozmiarach takich jak parametry 2B i 5B) generują kilka sekund spójnego, dynamicznego wideo w rozdzielczościach takich jak 720x480 i obsługują konwersję obrazu na wideo oraz kontynuację wideo. Co najważniejsze, wagi i kod są publiczne, co napędza falę udoskonaleń, narzędzi i badań społeczności.

Wgląd techniczny

Przyczynowy VAE 3D firmy CogVideoX zmniejsza surowe wideo do kompaktowej ukrytej objętości, zmniejszając liczbę tokenów, dzięki czemu transformator może modelować długie sekwencje w przystępnej cenie. Expert Transformer stosuje normę warstwy adaptacyjnej i łączy tokeny tekstowe i wizualne, dzięki czemu te dwie modalności bezpośrednio współdziałają ze sobą, poprawiając dopasowanie tekstu i wideo. Stopniowe szkolenie w zakresie zwiększania rozdzielczości i czasu trwania, a także staranne opisywanie danych, zapewnia płynniejszy i bardziej wierny semantycznie ruch.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość CogVideo i CogVideoX

Jako jeden z najsilniejszych otwartych modeli wideo, CogVideoX stanowi bazę dla szybko rozwijającego się ekosystemu precyzyjnych ustawień, adapterów sterujących i rozszerzeń o dłuższym czasie trwania. Spodziewaj się ciągłego wzrostu długości klipów, rozdzielczości, realizmu ruchu i sterowalności, a także ściślejszej integracji z procesami przetwarzania obrazu na wideo i edycji. Jego otwarte wagi oznaczają, że organizacje non-profit, badacze i małe studia mogą opierać się na generacji wideo najwyższej klasy bez zastrzeżonego nadzoru, przyspieszając zarówno kreatywne, jak i skoncentrowane na bezpieczeństwie eksperymenty.

Implementacja w świecie rzeczywistym

Generowanie krótkiego klipu narracyjnego z chińskiego lub angielskiego podpowiedzi przy użyciu całkowicie otwartych wag

Przekształcanie pojedynczego przesłanego nieruchomego obrazu w ruchomy film za pomocą funkcji przetwarzania obrazu na wideo CogVideoX

Dostosowywanie otwartego modelu do niestandardowego stylu lub postaci na potrzeby animacji niezależnej

Naukowcy porównują nowe metody generowania wideo z powtarzalnym, otwartym poziomem bazowym

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Edycja instrukcji InstructPix2Pix

Często zadawane pytania

What is CogVideo and CogVideoX?

CogVideo (2022) był pierwszym otwartym modelem zamiany tekstu na wideo na dużą skalę, a CogVideoX (2024) to jego znacznie wydajniejszy następca typu open source od Tsinghua/Zhipu AI. Mają znaczenie, ponieważ umożliwiają generowanie wysokiej jakości wideo w ręce otwartej społeczności, a nie tylko dużych laboratoriów korporacyjnych.

Co jest godnego uwagi w wydaniu CogVideo w 2022 r.?

CogVideo był pierwszym otwartym modelem zamiany tekstu na wideo na dużą skalę, obsługującym podpowiedzi zarówno w języku chińskim, jak i angielskim.

Co osiąga przyczynowy VAE 3D CogVideoX?

Przyczynowy VAE 3D kompresuje wideo zarówno w wymiarze przestrzennym, jak i czasowym, zmniejszając liczbę znaczników, dzięki czemu transformator może efektywnie je modelować.

W jaki sposób Expert Transformer w CogVideoX obsługuje tekst i wideo?

Expert Transformer łączy tokeny tekstowe i wizualne z adaptacyjną normalizacją, poprawiając dopasowanie między wyświetlanym i generowanym wideo.

Która grupa opracowała CogVideo i CogVideoX?

Rodzina CogVideo pochodzi od badaczy związanych z Uniwersytetem Tsinghua i Zhipu AI.

Jakie dodatkowe możliwości oprócz zamiany tekstu na wideo obsługuje CogVideoX?

CogVideoX może animować nieruchomy obraz (obraz do wideo) i rozszerzać istniejące klipy (kontynuacja) poza zwykłe podpowiedzi tekstowe.