Визуальное руководство по искусственному интеллекту
Преобразование стиля видео в видео
Преобразование стиля видео в видео использует искусственный интеллект, обычно диффузионные модели, чтобы придать существующим отснятым материалам новый вид, например аниме, глиняную анимацию или масляную краску, сохраняя при этом исходное движение, время и композицию.
На этой странице4 минуты чтения
Обзор
Это важно, потому что позволяет создателям повторно использовать реальные выступления и операторскую работу в новых визуальных стилях. Также возникают вопросы о согласии и авторских правах, когда исходный материал показывает реальных людей или принадлежит кому-то другому.
Глубокое погружение
Большинство конвейеров видео-видео состоят из двух этапов. Сначала они извлекают структуру из исходного видео: карты глубины из таких моделей, как MiDaS или Depth Anything, карты границ или линий, скелеты поз человека из таких инструментов, как OpenPose, а иногда и оптический поток, который записывает, как пиксели перемещаются между кадрами. Затем они генерируют новые кадры, основанные на этой структуре, а также подсказку стиля или эталонное изображение. ControlNet, представленный в 2023 году, сделал это практичным для Stable Diffusion, позволив создавать карту глубины или скелет позы без переобучения базовой модели. Ключевой настройкой обычно является сила преобразования или шумоподавления. Исходный кадр частично зашумлен, а затем очищен от шума в соответствии с новым стилем. Низкая прочность остается близкой к исходной, но мало меняется. Высокая интенсивность дает более смелый стиль, но изображение начинает отклоняться от источника и мерцать между кадрами. Кондиционирование по глубине сохраняет планировку помещения и расположение объектов. Выработка позы сохраняет движения человека. Карты краев сохраняют четкие контуры. Существует три широких подхода. Покадровое распространение с помощью ControlNet основано на общих начальных числах и межкадровом внимании для ограничения мерцания. Методы ключевых кадров тщательно изменяют стиль нескольких кадров и распространяют их внешний вид на остальные, как это делает EbSynth с распространением на основе исправлений. Такие исследовательские методы, как Rerender-A-Video и TokenFlow, продвигаются дальше в этом направлении. Собственные видеомодели, принимающие входное видео, которые Runway Gen-1 предложили в 2023 году, обрабатывают время внутри модели. Распространенным заблуждением является то, что рестайлинг анонимизирует людей или превращает отснятый материал в новое, свободно используемое произведение. Это не делает ни того, ни другого автоматически. Походка, форма тела, голос и обстановка часто остаются узнаваемыми, права на изображение и рекламу по-прежнему могут применяться, а авторские права на отснятый материал сохраняются. Ответственное использование означает съемку собственного материала или получение разрешения, а также раскрытие информации о том, что отснятый материал был преобразован.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее трансформации стиля видео в видео
Модели редактирования видео, которые берут исходный клип и напрямую следуют за структурой и движением, заменяют созданные вручную покадровые конвейеры во многих инструментах. Вероятные области улучшения — это более длинные клипы, лучшее сохранение лиц и рук, а также более точный контроль над тем, какие области меняются. Что касается ответственного использования, все более актуальными становятся стандарты происхождения, такие как учетные данные контента C2PA, правила маркировки платформ и требования согласия для изображений реальных людей. Пока неясно, насколько последовательно инструменты будут обеспечивать соблюдение согласия, и разные платформы и юрисдикции могут решать эту проблему по-разному.
Реальная реализация
Инди-режиссер снимает актеров в гараже и преобразует отснятый материал в нарисованный фэнтезийный вид, используя карты глубины, чтобы стены, столы и дверные проемы сохраняли свою форму в каждом кадре.
Создатель танца извлекает скелеты поз из программы и создает анимированного персонажа, который исполняет ту же хореографию в то же время.
Небольшое агентство преобразует кадры, снятые со смартфона, в бумажный вид с помощью коммерческого инструмента для преобразования видео в видео, снижая силу преобразования, поэтому форма продукта и логотип остаются читабельными.
Кто-то превращает чужой вирусный клип в мультфильм и репостит его. Тело, голос и жесты человека по-прежнему узнаваемы, а авторские права автора, загрузившего видео, не исчезли.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Video-to-Video Style Transformation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Часто задаваемые вопросы
Что такое преобразование стиля видео в видео?
Преобразование стиля видео в видео использует искусственный интеллект, обычно диффузионные модели, чтобы придать существующим отснятым материалам новый вид, например аниме, глиняную анимацию или масляную краску, сохраняя при этом исходное движение, время и композицию. Это важно, потому что позволяет создателям повторно использовать реальные выступления и операторскую работу в новых визуальных стилях. Также возникают вопросы о согласии и авторских правах, когда исходный материал показывает реальных людей или принадлежит кому-то другому.
Каков типичный первый шаг в процессе рестайлинга видео?
Конвейеры сначала фиксируют структуру источника, чтобы генерация могла отслеживать его расположение и движение, одновременно меняя стиль.
Что ControlNet сделал практичным для Stable Diffusion?
ControlNet добавляет путь кондиционирования, чтобы структурные входные данные, такие как глубина или скелеты позы, определяли выходные данные существующей модели.
Что обычно происходит, когда вы увеличиваете силу преобразования или шумоподавления?
Более высокая сила зашумляет источник сильнее, что дает модели больше свободы. Это означает больше стиля, но меньше точности и больше непоследовательности от кадра к кадру.
Какой обусловливающий сигнал лучше всего подходит для сохранения хореографии танцора?
Скелеты поз фиксируют положение суставов с течением времени, поэтому они напрямую сохраняют движения человека.
Как методы ключевых кадров, такие как EbSynth, подходят к рестайлингу?
Распространение ключевых кадров тщательно меняет стиль нескольких кадров, а затем переносит этот внешний вид на остальную часть клипа.
Продолжайте учиться
Связанные руководства
Другие руководства, выбранные по этой теме