Vad hände
MarkTechPost rapporterar att Google släppte Gemini Omni 1.1 Flash, en uppdatering av dess multimodala videogenererings- och redigeringsmodell. De rapporterade ändringarna fokuserar på direktbarhet och iterativ redigering: modellen kan analysera upp till 10 sekunder av föregående video när en scen utökas, acceptera fästa första och sista bildrutor, använda korta videoreferenser för karaktärs- eller objektkonsistens och bevara redigeringstillståndet över konversationssvängarna genom Interactions API. MarkTechPost säger att modellen är tillgänglig via Gemini API, Google AI Studio, Gemini Enterprise Agent Platform och Google Flow. Outlet säger att Adobe, Figma Weave, GMI Cloud och Runway redan är produktionsanvändare, men dessa påståenden om kundanvändning har inte bekräftats oberoende här.
MarkTechPost rapporterar att Google släppte Gemini Omni 1.1 Flash som en produktionsuppdatering till sin inhemska multimodala videogenererings- och redigeringsmodell. Enligt outlet accepterar den text, bilder, ljud och video i ett arbetsflöde och producerar video med ljud. Tillståndsfull konversationsredigering körs genom Google:s Interactions API: om du skickar ett previous_interaction_id kan modellen behålla tidigare videotillstånd och tillämpa en namngiven ändring utan att ladda upp den tidigare videon igen. Källan illustrerar detta genom att göra en genererad fiol osynlig samtidigt som andra ospecificerade element bevaras, men fastställer inte självständigt hur konsekvent det bevarandet fungerar.
Scenförlängning använder enligt uppgift upp till 10 sekunder av tidigare sammanhang, jämfört med endast sista sekunden i tidigare versioner. Modellen genererar en fortsättning på tre till 10 sekunder, med förlängningar som görs i steg om 10 sekunder upp till ett kumulativt tak på 40 sekunder. MarkTechPost säger att det tillagda sammanhanget är avsett att bevara rörelse, karaktärer och ljud, och att vissa slutliga bildrutor kan redigeras för att göra sömmen kontinuerlig. Tillägg läggs bara till i slutet, inte i början eller mitten. Uppladdade ingångar får inte vara längre än 10 sekunder om inte en modellgenererad video förlängs genom en interaktion med flera svängar. Ny dialog kan inte läggas till när du utökar ett uppladdat klipp där någon redan talar, medan talad dialog kan stödjas i flervändsförlängning.
Uppdateringen rapporteras också tillhandahålla första och sista bildruta interpolation: utvecklare tillhandahåller en startram och en slutram, och modellen genererar rörelse mellan dem. MarkTechPost identifierar kamerabanor, dolly-zoom och sömlösa loopar som avsedd användning, utan oberoende demonstrationer eller mätningar. Prompttaggar kan tilldela mediaroller, inklusive en stillbild som en stil- eller ämnesreferens och en video som en karaktärs- eller objektreferens. Videoreferenser är begränsade till tre klipp på upp till tre sekunder vardera; ljud inuti en videoreferens ignoreras, och resonemang över flera videor stöds inte och kan minska utdatakvaliteten. Modellen stöder 360p, 720p, 1080p och 4K, med 720p standard och de två högre upplösningarna som produceras genom uppskalning. Google säger att 360p-förhandsvisningar genererar upp till 60 % snabbare och kostar en tredjedel så mycket som 720p. Rapporterad prissättning är 1,50 USD per 1 miljon inmatade tokens, 9 USD per 1 miljon utgående texttokens och 17,50 USD per 1 miljon utgående videotokens, med en effektiv kostnad på cirka 0,10 USD per sekund för 720p under standardprissättning. Tillgänglighet genom Gemini API, Google AI Studio, Gemini Enterprise Agent Platform och Google Flow har inte verifierats oberoende.
Källinformation: marktechpost.com ↗
Varför det spelar roll
Den rapporterade uppdateringen tar upp praktiska flaskhalsar i AI-videoproduktion: bibehålla kontinuitet, kontrollera övergångar och iterera utan att återskapa ett helt klipp. Ett draft-at-360p-arbetsflöde kan minska kostnaderna och tiden för experiment, medan 1080p- och 4K-utgångar är tillgängliga som uppskalerade upplösningar. Dessa funktioner kan ha betydelse för utvecklare och kreativa team som bygger videoverktyg, även om källan inte tillhandahåller oberoende tester av utdatakvalitet, tillförlitlighet, latens eller kundresultat.
Om de rapporterade kontrollerna fungerar tillförlitligt kan Gemini Omni 1.1 Flash flytta vissa AI-videoarbetsflöden från upprepad fullständig regenerering till riktad redigering. Att bevara onämnda element över konversationssvängarna kan minska snabb återställning, klipprekonstruktion och manuell kombination av generationer, medan längre scenkontext kan minska diskontinuiteter. Kontroll av första och sista bildruta lägger till tydliga gränsvillkor: en startbild fastställer var ett klipp börjar och en slutbild begränsar var det slutar, vilket kan hjälpa övergångar, loopar och kontrollerade kamerarörelser. Rapporten fastställer dock inte fysisk rimlighet, ämneskonsistens, redigeringsnoggrannhet, tidsmässig konsekvens, identitetsbevarande eller ljudkontinuitet genom neutral testning.
Det rapporterade alternativet för utkast till resolution kan göra experiment mer tillgängligt för team som betalar per genererad utdata. MarkTechPost säger att 360p-förhandsvisningar är snabbare och betydligt billigare än 720p, medan 1080p och 4K är uppskalade utgångar. Ett utkast till ett exklusivt arbetsflöde kan sänka kostnaderna för promptiteration och hjälpa team att avvisa svaga koncept innan en slutlig rendering. Källan jämför inte fina detaljer, textåtergivning, ansikten, rörelseartefakter eller ljudkvalitet mellan utkast och slutliga utdata. Modellen är också betald och har inget alternativ för provisionerad genomströmning, vilket kan begränsa förutsägbar storskalig användning. Dessa funktioner kan ha betydelse för utvecklare och kreativa team som bygger videoverktyg, men källan ger inga oberoende tester av utdatakvalitet, tillförlitlighet, latens eller kundresultat.
Den rapporterade härkomstfunktionen kan ha betydelse för utgivare och plattformar som hanterar syntetiska medier. MarkTechPost säger att varje genererad video har en osynlig SynthID-vattenstämpel som tittare inte kan se men programvara kan upptäcka. Det skulle kunna stödja nedströms identifiering, men källan förklarar inte detektionstäckning, robusthet efter redigering eller komprimering, tillgång till detektionsverktyg eller om vattenstämpeln identifierar den specifika modellen eller generationen; det ska inte behandlas som ett fullständigt autenticitets- eller tillskrivningssystem. De namngivna produktionskunderna – Adobe, Figma Weave, GMI Cloud och Runway – kunde signalera tidig användning, men rapporten specificerar inte distributionsomfång, funktioner, volymer, prestandaresultat eller oberoende bekräftelse. Den här recensionen behandlar dessa uttalanden som påståenden som tillskrivs MarkTechPost snarare än etablerade fakta.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Vad du ska titta på härnäst
Huvudfrågorna är om de rapporterade kontrollerna ger en pålitlig kontinuitet utanför noggrant förberedda exempel och hur modellen presterar på dialog, flera ämnen, komplexa rörelser och längre arbetsflöden. Källan identifierar betydande begränsningar: tillägg läggs bara till i slutet, uppladdade klipp måste i allmänhet vara 10 sekunder eller kortare, röstredigering och ljudreferenser stöds inte, och uppladdad videoredigering eller tillägg är inte tillgänglig i EES, Schweiz och Storbritannien. MarkTechPost säger att dess påståenden kontrollerades mot Google-dokumentation och prissättning, men den här recensionen har inte oberoende bekräftat dessa dokument, priser, tillgänglighet eller kundinstallationer.
Det första problemet är kontinuitet i den verkliga världen över upprepade tillägg. Källan säger att modellen kan använda upp till 10 sekunders sammanhang och förlänga ett klipp till 40 sekunder, men rapporterar inga framgångsfrekvenser eller oberoende tester. Framtida utvärderingar bör undersöka karaktärer, objekt, kamerarörelser, ljus, rumsliga relationer och ljud över på varandra följande tillägg, och särskilja modellgenererade klipp från uppladdade klipp eftersom deras rapporterade regler skiljer sig åt. Oberoende tester bör också undersöka svåra övergångar där ramar skiljer sig åt i pose, synvinkel, ljussättning, objektarrangemang eller scengeometri. Även om källan namnger orbits, dolly-zoom och sömlösa loopar, etablerar den inte prestanda, misslyckade generationer, oönskade ämnesändringar, tidsmässiga artefakter eller nödvändig snabb iteration.
Tillgänglighet och regionala begränsningar kommer att påverka användningen. MarkTechPost rapporterar tillgänglighet genom flera Google-tjänster, men säger att uppladdade videoredigering eller tillägg inte är tillgängligt i EES, Schweiz och Storbritannien. Det står också att det inte finns någon gratis nivå och ingen provisionerad genomströmning. Utvecklare måste bekräfta aktuell åtkomst, regional behörighet, kvoter, prissättning och leveranskrav för filer över 4 MB. Källan säger att utdata över den storleken kräver URI-leverans och polling via Files API tills filen blir aktiv. De ostödda kontrollerna är också följdriktiga: modellen saknar enligt uppgift systeminstruktioner, temperatur, top_p, stoppsekvenser, negativa promptkontroller, röstredigering, ljudreferenser och YouTube URL:er som källingångar. Negativ måste placeras i vanlig snabbtext.
Språktäckning och proveniens kräver uppföljning. MarkTechPost säger att engelska stöds fullt ut medan andra språk inte utvärderas. De mest användbara bevisen skulle vara reproducerbara tester, aktuell API-dokumentation, tydliga regionala termer och oberoende användare som beskriver faktiska arbetsflöden. MarkTechPost säger att dess påståenden kontrollerades mot Gemini API-dokumentation och prissättning, men denna recension har inte oberoende bekräftat Google:s dokumentation, de angivna priserna, listad tillgänglighet, SynthID-beteende eller namngivna produktionsinstallationer. Kunduttalanden bör beskriva faktisk användning snarare än att bara namnge företag som användare, och testning bör täcka dialog, flera ämnen, komplexa rörelser och längre arbetsflöden.