Визуальное руководство по искусственному интеллекту

Преобразование текста в видео

Make-A-Video — это система Meta 2022 года, которая превращает текстовую подсказку в короткий видеоклип без необходимости обучения помеченным парам текст-видео.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

Глубокое погружение

Функция Make-A-Video, анонсированная Meta AI в сентябре 2022 года, генерирует несколько секунд видео из такого предложения, как «собака в плаще супергероя, летящая по небу». Его ключевой трюк заключается в отделении внешнего вида от движения: модель преобразования текста в изображение (построенная на объединенном пространстве текста и изображения в стиле CLIP и диффузии) изучает, как выглядят вещи, на основе миллиардов изображений с субтитрами, в то время как отдельные пространственно-временные слои изучают, как объекты движутся, только на основе неразмеченного видео. Это позволяет избежать нехватки высококачественных пар текст-видео. Базовая модель создает клипы с низким разрешением и низкой частотой кадров, затем выделенные сети интерполируют дополнительные кадры и повышают пространственное разрешение. Результат был поразительно последовательным для своего времени, хотя клипы были короткими, размытыми и склонными к мерцанию и искажениям.

Техническая информация

Make-A-Video расширяет возможности создания 2D-изображений и внимания в 3D, добавляя псевдовременные слои. Предварительно обученные пространственные веса замораживаются или настраиваются, в то время как новые временные слои изучают движение из необработанного видео, поэтому метки текст-видео не нужны. Затем сеть кадровой интерполяции уплотняет временную шкалу, а модули диффузии сверхвысокого разрешения повышают пространственную детализацию, превращая грубый черновой вариант из 16 кадров с низким разрешением в более плавный и четкий клип в каскадном конвейере.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее преобразования текста в видео Make-A-Video

Рецепт Make-A-Video «изображение-предварительно плюс немаркированное движение» положил начало всей волне преобразования текста в видео. Его потомки делают акцент на более длинных, более высоком разрешении, стабильных во времени клипах с контролируемым движением камеры и звуком. Ожидается, что основная идея — повторное использование огромных знаний об изображениях и дешевое обучение движению — сохранится, даже когда архитектуры перейдут к скрытому распространению на основе трансформаторов и унифицированным моделям, которые также допускают обработку изображений или видео для редактирования и продолжения.

Реальная реализация

Анимация одного описательного предложения в короткий цикличный клип для публикации в социальной сети.

Воплощение статичной концепции, такой как «плюшевый мишка, рисующий портрет», в жизнь в виде движущейся иллюстрации.

Интерполяция между двумя предоставленными пользователем неподвижными изображениями для создания плавного перехода видео.

Создание быстрых набросков воображаемых сцен для раскадровки перед съемками.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Sora и преобразование текста в видео

Часто задаваемые вопросы

What is Make-A-Video Text-to-Video?

Make-A-Video — это система Meta 2022 года, которая превращает текстовую подсказку в короткий видеоклип без необходимости обучения помеченным парам текст-видео. Это важно, потому что оно показало, что визуальные знания внутри моделей преобразования текста в изображение можно «научить» перемещаться, используя только неразмеченное видео.

Какое главное нововведение позволило Make-A-Video избежать необходимости размечать пары текст-видео?

Make-A-Video решает проблему: модель преобразования текста в изображение изучает, как все выглядит, по изображениям с субтитрами, в то время как отдельные временные слои изучают движение из необработанного, непомеченного видео.

Как Make-A-Video добавляет возможность движения в модель изображения?

Он расширяет двумерные пространственные свертки и внимание новыми временными слоями, которые изучают, как контент меняется с течением времени.

Что делают этапы интерполяции кадров и суперразрешения?

После грубого черновика с низким разрешением и низкой частотой кадров интерполяция добавляет кадры, а модули сверхвысокого разрешения повышают разрешение.

Каковы были типичные ограничения продукции Make-A-Video?

Клипы длились всего несколько секунд, имели относительно низкое разрешение и были склонны к временному мерцанию и искажениям.