Вернуться к новостям
ИнновацииAI Understanding брифинг

Исследователи Google представляют мультиагентную структуру для согласованной генерации длинного видео

Исследователи Google представили набор мультиагентных инфраструктур, предназначенных для решения проблемы визуальной согласованности и смещения повествования в длинных видео, созданных ИИ.

4 min readRead the primary source
Source-provided image accompanying Google researchers introduce multi-agent framework for coherent long-form video generation
ПервоисточникИсточник записан
Издатель
research.google
Ссылка на источник
research.googlehttps://research.google/blog/coherent-long-form-video-generation/
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель визуального языка (VLM)
Мультимодальная модель, совместно обрабатывающая визуальную и текстовую информацию.
Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Водяные знаки
Встраивание обнаруживаемого сигнала в текст или медиафайлы, сгенерированные ИИ, чтобы впоследствии его можно было идентифицировать как созданный машиной.
Проверьте себяВикторина «Агенты ИИ»
Source video from research.google · shown with attribution.

Что случилось

Исследователи Google представили набор из четырех взаимосвязанных мультиагентных платформ — Co-Director, CANVAS, A²RD и VQQA — предназначенных для автоматизации производства связного длинного видео. Эти системы функционируют как уровень оркестрации поверх базовых моделей, таких как Gemini и Veo, устраняя распространенные генеративные ошибки, такие как дрейф персонажей, непоследовательные декорации и коллапс повествования. Рассматривая генерацию видео как глобальную задачу оптимизации и отслеживания состояния мира, платформы автоматизируют задачи, начиная от подсказок по нескольким моделям и создания раскадровки и заканчивая визуальным уточнением в замкнутом цикле.

Набор фреймворков устраняет конкретные узкие места в генеративном конвейере. «Сорежиссер видео с искусственным интеллектом» использует алгоритм многорукого бандита для глобальной оптимизации творческой стратегии, режима повествования и эстетического тона, встраивая структурированные подсказки в основополагающие модели. Такой иерархический подход гарантирует, что весь производственный конвейер придерживается единого видения.

CANVAS (повествование с учетом непрерывности посредством визуальной агентной раскадровки) фокусируется на визуальной стойкости. Он поддерживает структурированную память о персонажах, объектах и ​​локациях, позволяя системе извлекать визуальные привязки и гарантировать, что пространственная геометрия и черты персонажей остаются неизменными при повторном посещении сцен.

A²RD (Агентная авторегрессионная генерация видео) управляет фактическим синтезом минутного видео. Он использует цикл извлечения-синтеза-уточнения-обновления, который динамически переключается между экстраполяцией для развития повествования и интерполяцией для привязки сегментов к установленным визуальным состояниям.

VQQA (ответы на вопросы по качеству видео) действует как оптимизатор подсказок «черного ящика». Он использует модель языка видения для анализа созданного видео и обеспечения обратной связи на естественном языке, которая затем используется для итеративного уточнения текстовых подсказок для исправления композиционных дефектов без необходимости прямого редактирования на уровне пикселей.

Подробности об источнике: research.google ↗

Почему это важно

Текущие модели создания видео часто испытывают трудности с поддержанием визуальной и повествовательной согласованности на протяжении длительного времени, что часто приводит к «семантическому дрейфу», когда персонажи или окружающая среда непреднамеренно меняются в разных кадрах. Благодаря внедрению структурированной памяти и итеративных циклов обратной связи эти платформы выходят за рамки простой генерации на основе подсказок и переходят к более надежному агентному производственному конвейеру. Это нововведение имеет большое значение для создателей, поскольку оно отвлекает от технического бремени поддержания непрерывности, потенциально позволяя создавать последовательные видеоповествования продолжительностью в несколько минут, которые ранее были склонны к каскадным сбоям.

Основной проблемой при создании длинных видео является «проблема присвоения кредитов», когда ранние ошибки в последовательности распространяются и приводят к полному провалу повествования. Отделяя творческий синтез от согласованности и качества моделирования как цели тестирования, эти структуры предоставляют механизм для отслеживания и исправления ошибок до того, как они начнут распространяться каскадом.

Использование постоянной зрительной памяти и итеративных циклов обратной связи представляет собой переход к «агентскому» производству видео. Это позволяет системе действовать как творческий партнер, понимающий требования долгосрочного повествования, а не просто инструмент для создания изолированных коротких видеороликов.

Фреймворки не зависят от модели, то есть теоретически их можно применять к любой базовой генеративной модели. Такая гибкость предполагает путь к стандартизации того, как конвейеры генерации видео обеспечивают непрерывность, независимо от базовой архитектуры модели.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Что посмотреть дальше

Исследование, включая структуру Co-Director, планируется представить на предстоящих конференциях, таких как COLM 2026 и EMNLP 2026. Наблюдателям следует следить за тем, интегрированы ли эти уровни оркестровки в общедоступные продукты для создания видео Google или они остаются ограниченными реализациями исследовательского уровня. Кроме того, эффективность этих инструментов в реальных сложных творческих рабочих процессах — помимо контролируемых критериев, указанных в исследовании, — еще предстоит выяснить.

Исследовательские работы, в том числе структура Co-Director (которая появится на COLM 2026) и CANVAS (которая появится на EMNLP 2026), дадут более глубокое понимание конкретных конфигураций обучения и сравнения базовых показателей.

Доступ и цены на эти платформы в настоящее время неизвестны, поскольку объявление сосредоточено на исследованиях и архитектурной методологии, а не на выпуске коммерческого продукта.

Использование базовых моделей, таких как Gemini и Veo, означает, что производительность этих платформ по своей сути привязана к возможностям и мерам безопасности этих базовых систем, включая использование водяных знаков SynthID.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаТрансформерыБудущее ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.
Нашли это полезным?