Vissza a Hírekhez
InnovációAI Understanding eligazítás

A Google kutatói többügynökös keretrendszert vezettek be a koherens hosszú formátumú videógeneráláshoz

A Google kutatói bemutatták a többügynököt tartalmazó keretrendszerek csomagját, amelyek célja a vizuális konzisztencia és a narratív sodródás megoldása a hosszú formájú AI által generált videókban.

4 min readRead the primary source
Source-provided image accompanying Google researchers introduce multi-agent framework for coherent long-form video generation
Elsődleges forrású dokumentumForrás rögzített
Kiadó
research.google
Forrás link
research.googlehttps://research.google/blog/coherent-long-form-video-generation/
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Vision-Language Model (VLM)
Multimodális modell, amely közösen dolgozza fel a vizuális és szöveges információkat.
Memória (ügynökmemória)
Tárolt kontextus, amelyet az AI-ügynök több lépésben vagy munkamenetben használ a folytonosság javítása érdekében.
Vízjelezés
Érzékelhető jel beágyazása mesterséges intelligencia által generált szövegbe vagy médiába, hogy később géppel előállítottként azonosítható legyen.
Teszteld magadAI ügynökök kvíz
Source video from research.google · shown with attribution.

Mi történt

A Google kutatói négy egymással összekapcsolt többügynök-keretrendszert mutattak be – Co-Director, CANVAS, A²RD és VQQA –, amelyek célja a koherens, hosszú formátumú videók előállításának automatizálása. Ezek a rendszerek hangszerelési rétegként működnek az olyan alapmodelleken, mint a Gemini és a Veo, és kezelik az olyan gyakori generatív hibákat, mint a karakterek elsodródása, az inkonzisztens díszlet és a narratív összeomlás. Azáltal, hogy a videógenerálást globális optimalizálási és világállapot-követési problémaként kezelik, a keretrendszerek automatizálják a feladatokat a többmodelles felszólítástól és a storyboard létrehozásától a zárt hurkú vizuális finomításig.

A keretrendszerek csomagja a generatív folyamat speciális szűk keresztmetszeteit kezeli. Az „AI videó társrendező” egy többkarú bandita algoritmust használ a kreatív stratégia, a narratív mód és az esztétikai hangnem globális optimalizálására, strukturált felszólításokat táplálva az alapmodellekbe. Ez a hierarchikus megközelítés biztosítja, hogy a teljes gyártási folyamat egységes elképzeléshez illeszkedjen.

A CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding) a vizuális tartósságra összpontosít. Karbantartja a karakterek, objektumok és helyszínek strukturált memóriáját, lehetővé téve a rendszer számára, hogy lekérje a vizuális horgonyokat, és gondoskodjon arról, hogy a térbeli geometria és a karakterjegyek konzisztensek maradjanak a jelenetek újralátogatásakor.

Az A²RD (Agent Autoregressive Video Generation) kezeli a percek hosszúságú videók tényleges szintézisét. Lekérése-szintetizálás-finomítás-frissítési ciklust alkalmaz, amely dinamikusan vált a narratív előrehaladás extrapolációja és az interpoláció között, hogy a szegmenseket a megállapított vizuális állapotokhoz rögzítse.

A VQQA (Video Quality Question Answering) a fekete doboz prompt optimalizálójaként működik. Vision-Language Modell segítségével bírálja a generált videót, és természetes nyelvű visszajelzést ad, amelyet aztán a szöveges felszólítások iteratív finomítására használ fel a kompozíciós hibák kijavítására anélkül, hogy közvetlen pixelszintű szerkesztést igényelne.

Forrás részletei: research.google ↗

Miért számít

A jelenlegi videógenerációs modellek gyakran küszködnek a vizuális és narratív konzisztencia fenntartásával hosszabb ideig, ami gyakran „szemantikai eltolódást” eredményez, ahol a karakterek vagy a környezet akaratlanul is megváltozik a felvételek során. A strukturált memória és az iteratív visszacsatolási hurkok bevezetésével ezek a keretrendszerek az egyszerű prompt-alapú generáláson túl egy megbízhatóbb, ügynöki gyártási folyamat felé haladnak. Ez a fejlesztés jelentős az alkotók számára, mivel elvonatkoztatja a folytonosság fenntartásának technikai terheit, és potenciálisan lehetővé teszi percekig tartó, konzisztens videonarratívák előállítását, amelyek korábban lépcsőzetes meghibásodásokra voltak hajlamosak.

A hosszú formátumú videógenerálás elsődleges kihívása a „kredit-hozzárendelési probléma”, ahol a sorozat korai hibái továbbterjednek, és a narratíva teljes kudarcát okozzák. Azáltal, hogy a kreatív szintézist leválasztják a konzisztenciáról és a modellezési minőséget, mint tesztidőbeli célt, ezek a keretrendszerek mechanizmust biztosítanak a hibák nyomon követésére és kijavítására, mielőtt kaszkádoznák őket.

A perzisztens vizuális memória és az iteratív visszacsatolási hurkok használata elmozdulást jelent az „ügynök” videógyártás felé. Ez lehetővé teszi a rendszer számára, hogy kreatív partnerként működjön, aki megérti a hosszú távú történetmesélés követelményeit, és nem csupán eszközként szolgálhat elszigetelt, rövid időtartamú klipek előállításához.

A keretrendszerek modell-agnosztikusak, vagyis elméletileg bármilyen alapozó generatív modellre alkalmazhatók. Ez a rugalmasság azt sugallja, hogy a videogeneráló folyamatfolyamatok szabványosítása felé haladjon, függetlenül az alapul szolgáló modell architektúrától.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktív koncepció ellenőrzése+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Mit nézzünk ezután

A kutatás, beleértve a Co-Director keretrendszert, a tervek szerint a következő konferenciákon, például a COLM 2026-on és az EMNLP 2026-on fog megjelenni. A megfigyelőknek figyelemmel kell kísérniük, hogy ezek a hangszerelési rétegek beépülnek-e a Google nyilvános videógeneráló termékeibe, vagy továbbra is a kutatási szintű megvalósításokra korlátozódnak. Ezen túlmenően, ezeknek az eszközöknek a hatékonysága a valós, összetett kreatív munkafolyamatokban – a kutatásban hivatkozott ellenőrzött benchmarkokon túl – továbbra is látható.

A kutatási dokumentumok, köztük a Co-Director keretrendszer (amely a COLM 2026-on fog megjelenni) és a CANVAS (az EMNLP 2026-on jelenik meg), mélyebb betekintést nyújtanak a konkrét képzési konfigurációkba és az alapvonal-összehasonlításokba.

Ezeknek a keretrendszereknek a hozzáférése és ára jelenleg nem ismert, mivel a bejelentés a kutatásra és az építészeti módszertanra összpontosít, nem pedig a kereskedelmi termékkiadásra.

Az olyan alapmodellekre való támaszkodás, mint a Gemini és a Veo, azt jelenti, hogy ezeknek a keretrendszereknek a teljesítménye eleve kötődik az alapul szolgáló rendszerek képességeihez és biztonsági korlátaihoz, beleértve a SynthID vízjel használatát is.

Kapcsolódó útmutatók és vetélkedők

AI ügynökökAz AI modellek magyarázataTranszformátorokAz MI jövőjeTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkben
Ezt hasznosnak találta?