Назад до новин
ІнноваціяAI Understanding брифінг

Дослідники Google представляють багатоагентну структуру для генерації когерентного довгого відео

Дослідники Google представили набір мультиагентних фреймворків, призначених для вирішення проблеми візуальної узгодженості та дрейфу оповіді у довгому відео, створеному ШІ.

4 min readRead the primary source
Source-provided image accompanying Google researchers introduce multi-agent framework for coherent long-form video generation
Першоджерельний документДжерело записано
Видавець
research.google
Посилання на джерело
research.googlehttps://research.google/blog/coherent-long-form-video-generation/
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Модель мови бачення (VLM)
Мультимодальна модель, яка спільно обробляє візуальну та текстову інформацію.
Пам'ять (Пам'ять агента)
Збережений контекст агент штучного інтелекту використовує на етапах або сеансах для покращення безперервності.
Водяний знак
Вбудовування сигналу, який можна виявити, у текст або медіа, згенерований штучним інтелектом, щоб пізніше можна було ідентифікувати його як створений машиною.
Перевір себеВікторина агентів ШІ
Source video from research.google · shown with attribution.

Що сталося

Дослідники Google представили набір із чотирьох взаємопов’язаних мультиагентних фреймворків — Co-Director, CANVAS, A²RD і VQQA — призначених для автоматизації створення узгодженого довгоформатного відео. Ці системи функціонують як рівень оркестровки на базових моделях, таких як Gemini і Veo, усуваючи загальні генеративні помилки, такі як дрейф персонажів, непослідовність декорацій і крах оповіді. Розглядаючи генерацію відео як проблему глобальної оптимізації та відстеження світового стану, фреймворки автоматизують завдання, починаючи від багатомодельних підказок і створення розкадровки до замкнутого візуального вдосконалення.

Набір фреймворків усуває конкретні вузькі місця в генеративному конвеєрі. «Співрежисер відео зі штучним інтелектом» використовує алгоритм багаторукого бандита для глобальної оптимізації творчої стратегії, режиму оповіді та естетичного тону, вводячи структуровані підказки в основні моделі. Цей ієрархічний підхід гарантує, що весь виробничий конвеєр дотримується єдиного бачення.

CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding) зосереджується на візуальній стійкості. Він підтримує структуровану пам’ять про персонажів, об’єкти та місця розташування, дозволяючи системі отримувати візуальні прив’язки та гарантувати, що просторова геометрія та риси персонажів залишаються послідовними під час повторного перегляду сцен.

A²RD (Agentic Autoregressive Video Generation) керує фактичним синтезом хвилинного відео. Він використовує цикл отримання-синтезування-уточнення-оновлення, який динамічно перемикається між екстраполяцією для розвитку оповіді та інтерполяцією для прив’язки сегментів до встановлених візуальних станів.

VQQA (Відповіді на запитання про якість відео) діє як оптимізатор підказок чорної скриньки. Він використовує модель Vision-Language для критики згенерованого відео та надання зворотного зв’язку природною мовою, який потім використовується для повторного вдосконалення текстових підказок для виправлення композиційних дефектів без необхідності прямого редагування на рівні пікселів.

Деталі джерела: research.google ↗

Чому це важливо

Сучасним моделям генерації відео часто важко підтримувати узгодженість візуальної та оповідної частини протягом тривалого часу, що часто призводить до «семантичного дрейфу», коли персонажі чи середовище ненавмисно змінюються між кадрами. Завдяки впровадженню структурованої пам’яті та ітераційних циклів зворотного зв’язку ці інфраструктури виходять за межі простої генерації на основі підказок до більш надійного агентського конвеєра. Ця розробка є важливою для творців, оскільки вона знімає технічний тягар підтримки безперервності, потенційно дозволяючи створювати послідовні відеооповіді довжиною протягом хвилин, які раніше були схильні до каскадних збоїв.

Основною проблемою у створенні довгого відео є «проблема призначення кредиту», коли ранні помилки в послідовності поширюються та спричиняють повний провал оповіді. Відокремлюючи творчий синтез від узгодженості та якості моделювання як цілі тестування, ці фреймворки забезпечують механізм для відстеження та виправлення помилок перед їх каскадним розповсюдженням.

Використання постійної візуальної пам’яті та ітераційних циклів зворотного зв’язку означає перехід до «агентного» відеовиробництва. Це дозволяє системі діяти як творчий партнер, який розуміє вимоги довгострокового оповідання, а не просто інструмент для генерації окремих короткочасних кліпів.

Фреймворки не залежать від моделі, тобто теоретично їх можна застосувати до будь-якої базової генеративної моделі. Ця гнучкість пропонує шлях до стандартизації того, як конвеєри генерації відео обробляють безперервність, незалежно від базової архітектури моделі.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Що дивитися далі

Дослідження, включаючи фреймворк Co-Director, планується представити на наступних конференціях, таких як COLM 2026 і EMNLP 2026. Спостерігачі повинні стежити за тим, чи ці рівні оркестровки інтегровані в публічні продукти Google для створення відео, чи вони залишаються обмеженими реалізаціями дослідницького рівня. Крім того, ефективність цих інструментів у реальних, складних творчих робочих процесах — за межами контрольованих контрольних показників, наведених у дослідженні — ще належить побачити.

Дослідницькі документи, включно зі структурою Co-Director (з’явиться на COLM 2026) і CANVAS (з’явиться на EMNLP 2026), нададуть глибше розуміння конкретних конфігурацій навчання та базових порівнянь.

Доступ і ціни на ці фреймворки наразі невідомі, оскільки оголошення зосереджено на дослідженнях та архітектурній методології, а не на комерційному випуску продукту.

Залежність від базових моделей, таких як Gemini і Veo, означає, що продуктивність цих фреймворків за своєю суттю пов’язана з можливостями та захистом базових систем, включаючи використання водяних знаків SynthID.

Пов’язані посібники та вікторини

Агенти ШІПояснення моделей AIтрансформериМайбутнє ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосарії
Знайшли це корисним?