Визуальное руководство по искусственному интеллекту

CogVideo и CogVideoX

CogVideo (2022 г.) была первой крупномасштабной моделью преобразования текста в видео с открытым исходным кодом, а CogVideoX (2024 г.) — ее гораздо более функциональным преемником с открытым исходным кодом от Tsinghua/Zhipu AI.

2 минуты чтенияПоследнее обновление

Обзор

Они имеют значение, поскольку передают создание высококачественного видео в руки открытого сообщества, а не только крупных корпоративных лабораторий.

Глубокое погружение

CogVideo, выпущенный в 2022 году, построен на преобразователе текста в изображение CogView2 и использовал многочастотный авторегрессионный подход для создания коротких клипов, став первой открыто выпущенной большой моделью преобразования текста в видео и поддерживающей подсказки на китайском и английском языках. Его преемник 2024 года, CogVideoX, представляет собой полностью обновленный дизайн: он использует трехмерный причинно-вариационный автокодировщик для сжатия видео как в пространстве, так и во времени, а затем экспертный преобразователь с целью диффузии, который совместно обрабатывает текстовые и видеотокены, объединенные вместе. Модели CogVideoX (с такими размерами, как 2B и 5B) генерируют несколько секунд связного динамичного видео с такими разрешениями, как 720x480, и поддерживают преобразование изображения в видео и продолжение видео. Важно отметить, что веса и код являются общедоступными, что порождает волну доработок, инструментов и исследований сообщества.

Техническая информация

3D-каузальный VAE CogVideoX сжимает необработанное видео в компактный скрытый объем, сокращая количество токенов, поэтому преобразователь может моделировать длинные последовательности по доступной цене. Экспертный преобразователь применяет норму адаптивного слоя и объединяет текстовые и визуальные токены, так что эти две модальности напрямую взаимодействуют друг с другом, улучшая выравнивание текста и видео. Прогрессивная тренировка с увеличением разрешения и продолжительности, а также тщательная подписка к данным обеспечивают более плавное и семантически точное движение.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее CogVideo и CogVideoX

CogVideoX, одна из самых мощных моделей открытого видео, обеспечивает быстрорастущую экосистему тонких настроек, адаптеров управления и долгосрочных расширений. Ожидайте дальнейшего увеличения длины клипа, разрешения, реалистичности движения и управляемости, а также более тесной интеграции с рабочими процессами преобразования изображения в видео и редактирования. Его открытые веса означают, что некоммерческие организации, исследователи и небольшие студии могут создавать видео высочайшего класса без проприетарного контроля, что ускоряет как творческие эксперименты, так и эксперименты, ориентированные на безопасность.

Реальная реализация

Создание короткого сюжетного ролика из подсказки на китайском или английском языке с использованием полностью открытых весов.

Превращение одного загруженного неподвижного изображения в движущееся видео с помощью преобразования изображения в видео CogVideoX.

Точная настройка открытой модели по индивидуальному стилю или персонажу для инди-анимации.

Исследователи сравнивают новые методы генерации видео с воспроизводимыми открытыми базовыми показателями.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Редактирование инструкций InstructPix2Pix

Часто задаваемые вопросы

Что такое CogVideo и CogVideoX?

CogVideo (2022 г.) была первой крупномасштабной моделью преобразования текста в видео с открытым исходным кодом, а CogVideoX (2024 г.) — ее гораздо более функциональным преемником с открытым исходным кодом от Tsinghua/Zhipu AI. Они имеют значение, поскольку передают создание высококачественного видео в руки открытого сообщества, а не только крупных корпоративных лабораторий.

Чем примечательна версия CogVideo 2022 года?

CogVideo была первой широкомасштабной моделью преобразования текста в видео, выпущенной открыто и поддерживающей подсказки как на китайском, так и на английском языке.

Чего достигает 3D-каузальный VAE CogVideoX?

3D-каузальный VAE сжимает видео как в пространственном, так и во временном измерении, уменьшая количество токенов, чтобы преобразователь мог эффективно его моделировать.

Как Expert Transformer в CogVideoX обрабатывает текст и видео?

Expert Transformer объединяет текстовые и визуальные токены вместе с адаптивной нормализацией, улучшая согласованность между подсказкой и сгенерированным видео.

Какая группа разработала CogVideo и CogVideoX?

Семейство CogVideo создано исследователями, связанными с Университетом Цинхуа и Zhipu AI.

Какие дополнительные возможности поддерживает CogVideoX помимо преобразования текста в видео?

CogVideoX может анимировать неподвижное изображение (преобразование изображения в видео) и расширять существующие клипы (продолжение), выходя за рамки простых текстовых подсказок.