Что случилось
Исследователи Google представили набор из четырех взаимосвязанных мультиагентных платформ — Co-Director, CANVAS, A²RD и VQQA — предназначенных для автоматизации производства связного длинного видео. Эти системы функционируют как уровень оркестрации поверх базовых моделей, таких как Gemini и Veo, устраняя распространенные генеративные ошибки, такие как дрейф персонажей, непоследовательные декорации и коллапс повествования. Рассматривая генерацию видео как глобальную задачу оптимизации и отслеживания состояния мира, платформы автоматизируют задачи, начиная от подсказок по нескольким моделям и создания раскадровки и заканчивая визуальным уточнением в замкнутом цикле.
Набор фреймворков устраняет конкретные узкие места в генеративном конвейере. «Сорежиссер видео с искусственным интеллектом» использует алгоритм многорукого бандита для глобальной оптимизации творческой стратегии, режима повествования и эстетического тона, встраивая структурированные подсказки в основополагающие модели. Такой иерархический подход гарантирует, что весь производственный конвейер придерживается единого видения.
CANVAS (повествование с учетом непрерывности посредством визуальной агентной раскадровки) фокусируется на визуальной стойкости. Он поддерживает структурированную память о персонажах, объектах и локациях, позволяя системе извлекать визуальные привязки и гарантировать, что пространственная геометрия и черты персонажей остаются неизменными при повторном посещении сцен.
A²RD (Агентная авторегрессионная генерация видео) управляет фактическим синтезом минутного видео. Он использует цикл извлечения-синтеза-уточнения-обновления, который динамически переключается между экстраполяцией для развития повествования и интерполяцией для привязки сегментов к установленным визуальным состояниям.
VQQA (ответы на вопросы по качеству видео) действует как оптимизатор подсказок «черного ящика». Он использует модель языка видения для анализа созданного видео и обеспечения обратной связи на естественном языке, которая затем используется для итеративного уточнения текстовых подсказок для исправления композиционных дефектов без необходимости прямого редактирования на уровне пикселей.
Подробности об источнике: research.google ↗
Почему это важно
Текущие модели создания видео часто испытывают трудности с поддержанием визуальной и повествовательной согласованности на протяжении длительного времени, что часто приводит к «семантическому дрейфу», когда персонажи или окружающая среда непреднамеренно меняются в разных кадрах. Благодаря внедрению структурированной памяти и итеративных циклов обратной связи эти платформы выходят за рамки простой генерации на основе подсказок и переходят к более надежному агентному производственному конвейеру. Это нововведение имеет большое значение для создателей, поскольку оно отвлекает от технического бремени поддержания непрерывности, потенциально позволяя создавать последовательные видеоповествования продолжительностью в несколько минут, которые ранее были склонны к каскадным сбоям.
Основной проблемой при создании длинных видео является «проблема присвоения кредитов», когда ранние ошибки в последовательности распространяются и приводят к полному провалу повествования. Отделяя творческий синтез от согласованности и качества моделирования как цели тестирования, эти структуры предоставляют механизм для отслеживания и исправления ошибок до того, как они начнут распространяться каскадом.
Использование постоянной зрительной памяти и итеративных циклов обратной связи представляет собой переход к «агентскому» производству видео. Это позволяет системе действовать как творческий партнер, понимающий требования долгосрочного повествования, а не просто инструмент для создания изолированных коротких видеороликов.
Фреймворки не зависят от модели, то есть теоретически их можно применять к любой базовой генеративной модели. Такая гибкость предполагает путь к стандартизации того, как конвейеры генерации видео обеспечивают непрерывность, независимо от базовой архитектуры модели.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
What most distinguishes an AI agent from a basic chatbot?
Что посмотреть дальше
Исследование, включая структуру Co-Director, планируется представить на предстоящих конференциях, таких как COLM 2026 и EMNLP 2026. Наблюдателям следует следить за тем, интегрированы ли эти уровни оркестровки в общедоступные продукты для создания видео Google или они остаются ограниченными реализациями исследовательского уровня. Кроме того, эффективность этих инструментов в реальных сложных творческих рабочих процессах — помимо контролируемых критериев, указанных в исследовании, — еще предстоит выяснить.
Исследовательские работы, в том числе структура Co-Director (которая появится на COLM 2026) и CANVAS (которая появится на EMNLP 2026), дадут более глубокое понимание конкретных конфигураций обучения и сравнения базовых показателей.
Доступ и цены на эти платформы в настоящее время неизвестны, поскольку объявление сосредоточено на исследованиях и архитектурной методологии, а не на выпуске коммерческого продукта.
Использование базовых моделей, таких как Gemini и Veo, означает, что производительность этих платформ по своей сути привязана к возможностям и мерам безопасности этих базовых систем, включая использование водяных знаков SynthID.