Tillbaka till Nyheter
InnovationAI Understanding genomgång

Google forskare introducerar multi-agent ramverk för sammanhängande långformsvideogenerering

Google-forskare har avslöjat en svit med ramverk för flera agenter utformade för att lösa visuell konsekvens och narrativ drift i långformad AI-genererad video.

4 min readRead the primary source
Source-provided image accompanying Google researchers introduce multi-agent framework for coherent long-form video generation
Primärt källdokumentKälla inspelad
Förläggare
research.google
Källlänk
research.googlehttps://research.google/blog/coherent-long-form-video-generation/
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Vision-Language Model (VLM)
En multimodal modell som gemensamt bearbetar visuell och textuell information.
Minne (agentminne)
Lagrat sammanhang som en AI-agent använder över steg eller sessioner för att förbättra kontinuiteten.
Vattenmärkning
Inbädda en detekterbar signal i AI-genererad text eller media så att den senare kan identifieras som maskinproducerad.
Testa dig självAI Agents Quiz
Source video from research.google · shown with attribution.

Vad hände

Google-forskare har introducerat en svit av fyra sammankopplade ramverk för flera agenter – Co-Director, CANVAS, A²RD och VQQA – utformade för att automatisera produktionen av sammanhängande, långformad video. Dessa system fungerar som ett orkestreringslager ovanpå grundmodeller som Gemini och Veo, och åtgärdar vanliga generativa misslyckanden som karaktärsdrift, inkonsekventa landskap och narrativ kollaps. Genom att behandla videogenerering som ett globalt optimerings- och spårningsproblem i världsstaten, automatiserar ramverken uppgifter som sträcker sig från prompting med flera modeller och skapande av storyboard till visuell förfining med sluten slinga.

Sviten av ramverk tar upp specifika flaskhalsar i den generativa pipelinen. "AI-videomedregissören" använder en flerarmad banditalgoritm för att globalt optimera kreativ strategi, berättarläge och estetisk ton, och matar in strukturerade uppmaningar till grundmodeller. Detta hierarkiska tillvägagångssätt säkerställer att hela produktionspipelinen följer en enhetlig vision.

CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding) fokuserar på visuell uthållighet. Det upprätthåller ett strukturerat minne av karaktärer, objekt och platser, vilket gör att systemet kan hämta visuella ankare och säkerställa att rumslig geometri och karaktärsdrag förblir konsekventa när scener återbesöks.

A²RD (Agentic Autoregressive Video Generation) hanterar själva syntesen av minuter lång video. Den använder en återhämtning-syntetisera-förfina-uppdateringsslinga som dynamiskt växlar mellan extrapolering för narrativ progression och interpolation för att förankra segment till etablerade visuella tillstånd.

VQQA (Video Quality Question Answering) fungerar som en black-box-promptoptimerare. Den använder en Vision-Language Model för att kritisera genererad video och ge naturligt språkåterkoppling, som sedan används för att iterativt förfina textuppmaningarna för att korrigera kompositionsdefekter utan att kräva direkt redigering på pixelnivå.

Källinformation: research.google ↗

Varför det spelar roll

Nuvarande videogenereringsmodeller kämpar ofta med att bibehålla visuell och narrativ konsistens under långa varaktigheter, vilket ofta resulterar i "semantisk drift" där karaktärer eller miljöer ändras oavsiktligt över bilder. Genom att introducera strukturerat minne och iterativa återkopplingsslingor går dessa ramverk bortom enkel promptbaserad generering mot en mer pålitlig, agent produktionspipeline. Denna utveckling är betydelsefull för kreatörer, eftersom den abstraherar bort den tekniska bördan att upprätthålla kontinuitet, vilket potentiellt möjliggör produktion av minuter långa, konsekventa videoberättelser som tidigare var benägna att misslyckas.

Den primära utmaningen i långformsvideogenerering är "kredittilldelningsproblemet", där tidiga fel i en sekvens sprider sig och orsakar totalt narrativa misslyckanden. Genom att frikoppla kreativ syntes från konsistens och modelleringskvalitet som ett test-time-mål, tillhandahåller dessa ramverk en mekanism för att spåra och korrigera fel innan de överlappar.

Användningen av beständigt visuellt minne och iterativa återkopplingsslingor representerar en förskjutning mot "agentisk" videoproduktion. Detta gör att systemet kan agera som en kreativ partner som förstår kraven på berättande med lång horisont, snarare än bara ett verktyg för att generera isolerade klipp med kort varaktighet.

Ramarna är modellagnostiska, vilket innebär att de teoretiskt kan tillämpas på vilken grundgenerativ modell som helst. Denna flexibilitet föreslår en väg mot att standardisera hur videogenereringspipelines hanterar kontinuitet, oavsett den underliggande modellarkitekturen.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Vad du ska titta på härnäst

Forskningen, inklusive Co-Director-ramverket, är planerad att dyka upp vid kommande konferenser som COLM 2026 och EMNLP 2026. Observatörer bör övervaka om dessa orkestreringslager är integrerade i Google:s publika videogenereringsprodukter eller om de förblir begränsade till implementeringar av forskningsgrad. Dessutom återstår effektiviteten av dessa verktyg i verkliga, komplexa kreativa arbetsflöden – bortom de kontrollerade riktmärkena som nämns i forskningen – att se.

Forskningsdokumenten, inklusive Co-Director-ramverket (kommer att visas på COLM 2026) och CANVAS (som kommer att visas på EMNLP 2026), kommer att ge djupare insikter i de specifika utbildningskonfigurationerna och baslinjejämförelser.

Tillgång och prissättning för dessa ramverk är för närvarande okända, eftersom tillkännagivandet fokuserar på forskning och arkitekturmetodik snarare än en kommersiell produktrelease.

Beroendet på grundmodeller som Gemini och Veo innebär att prestandan för dessa ramverk är naturligt knuten till kapaciteten och skyddsräcken för de underliggande systemen, inklusive användningen av SynthID-vattenmärkning.

Relaterade guider och frågesporter

AI-agenterAI-modeller förklarasTransformatorerAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlista
Hittade du detta användbart?