Tillbaka till Nyheter
ProduktAI Understanding genomgång

MarkTechPost rapporterar Google uppdaterad Gemini Omni 1.1 Flash med längre videotillägg och ramkontroller

MarkTechPost rapporterar att Google:s Gemini Omni 1.1 Flash lägger till upp till 10 sekunders scenkontext, kumulativa 40-sekunders tillägg, kontroll av första och sista bildruta, billigare 360p-utkast och 4K-uppskalning. Rapporten säger att modellen är tillgänglig via Google:s Gemini API, AI Studio och Gemini Enterprise Agent Platform.

7 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Google updated Gemini Omni 1.1 Flash with longer video extensions and frame controls
KällhänvisningKälla inspelad
Förläggare
marktechpost.com
Källlänk
marktechpost.comhttps://www.marktechpost.com/2026/08/29/google-ai-releases-gemini-omni-1-1-flash-40-second-scene-extension-first-last-frame-control-and-4k-upscaling/
Källtyp
Länkad källa – status för primär källa har inte fastställts.
Också citerad

Berättelsen senast reviderad

SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

API (Application Programming Interface)
Ett strukturerat sätt för ett mjukvarusystem att skicka förfrågningar till och ta emot svar från ett annat system.
Temperatur
En samplingsinställning som kontrollerar slumpmässighet i genererade utdata.
Robusthet
En modells förmåga att bibehålla prestanda under buller, skift eller motstridiga ingångar.
Testa dig självVad är AI? Frågesport

Vad har förändrats sedan publiceringen

  1. Först publicerad
  2. Den här dokumentationen är en väsentlig teknisk uppdatering av samma Gemini Omni 1.1 Flash-version som täcks av den kanoniska posten. Den lägger till modell-ID, förhandsgranskningsstatus, releasedatum, inmatnings- och utdatamodaliteter, videogenererings- och redigeringsfunktioner, ljudgenereringsstöd, token- och filgränser, format som stöds, regional information och konsumtionsbegränsningar.
  3. Den här Google DeepMind-bloggen främjar materiellt den fortsatta Gemini Omni 1.1 Flash-utgåvan genom att detaljera scentillägg som använder upp till 10 sekunder av föregående sammanhang och når 40 sekunder kumulativt, interpolering av första och sista bildrutan, 360p-påståenden AIU2X och 6XZ snabbare upp till 6XZ-förhandsvisningar. en tredjedel av kostnaden för 720p, 1080p och 4K-uppskalning, videoreferensingångar på upp till tre sekunder och tillgänglighet via Google AI Studio, Agent Platform API, Google Flow och Gemini-appen.
  4. MarkTechPost utvecklar väsentligt den fortsatta Gemini Omni 1.1 Flash-releasehistorien genom att rapportera implementering, tillgänglighet, prissättning, upplösning, härkomst och redigeringsgränsdetaljer, inklusive 10 sekunders scenkontext, 40-sekunders kumulativa tillägg, kontroll av första och sista bildruta och rendering av 360p-utkast. Dessa uppgifter tillskrivs MarkTechPost och bekräftas inte oberoende av den medföljande källan.
  5. Den här kandidaten avancerar väsentligt samma Gemini Omni 1.1 Flash-version som redan representeras av den kvalificerade kanoniska uppdateringen. MarkTechPost rapporterar ytterligare konkreta detaljer om uppdateringens 10-sekunders scenkontext, kumulativa 40-sekunders förlängningstak, första och sista bildruteinterpolation, videoreferensgränser, 360p-utkastsekonomi, SynthID-vattenmärkning, regionala begränsningar, kontroller som inte stöds, prissättning och namngivna produktionsanvändare. Dessa uppgifter tillskrivs MarkTechPost och har inte bekräftats oberoende här.

Vad hände

MarkTechPost rapporterar att Google släppte Gemini Omni 1.1 Flash, en uppdatering av dess multimodala videogenererings- och redigeringsmodell. De rapporterade ändringarna fokuserar på direktbarhet och iterativ redigering: modellen kan analysera upp till 10 sekunder av föregående video när en scen utökas, acceptera fästa första och sista bildrutor, använda korta videoreferenser för karaktärs- eller objektkonsistens och bevara redigeringstillståndet över konversationssvängarna genom Interactions API. MarkTechPost säger att modellen är tillgänglig via Gemini API, Google AI Studio, Gemini Enterprise Agent Platform och Google Flow. Outlet säger att Adobe, Figma Weave, GMI Cloud och Runway redan är produktionsanvändare, men dessa påståenden om kundanvändning har inte bekräftats oberoende här.

MarkTechPost rapporterar att Google släppte Gemini Omni 1.1 Flash som en produktionsuppdatering till sin inhemska multimodala videogenererings- och redigeringsmodell. Enligt outlet accepterar den text, bilder, ljud och video i ett arbetsflöde och producerar video med ljud. Tillståndsfull konversationsredigering körs genom Google:s Interactions API: om du skickar ett previous_interaction_id kan modellen behålla tidigare videotillstånd och tillämpa en namngiven ändring utan att ladda upp den tidigare videon igen. Källan illustrerar detta genom att göra en genererad fiol osynlig samtidigt som andra ospecificerade element bevaras, men fastställer inte självständigt hur konsekvent det bevarandet fungerar.

Scenförlängning använder enligt uppgift upp till 10 sekunder av tidigare sammanhang, jämfört med endast sista sekunden i tidigare versioner. Modellen genererar en fortsättning på tre till 10 sekunder, med förlängningar som görs i steg om 10 sekunder upp till ett kumulativt tak på 40 sekunder. MarkTechPost säger att det tillagda sammanhanget är avsett att bevara rörelse, karaktärer och ljud, och att vissa slutliga bildrutor kan redigeras för att göra sömmen kontinuerlig. Tillägg läggs bara till i slutet, inte i början eller mitten. Uppladdade ingångar får inte vara längre än 10 sekunder om inte en modellgenererad video förlängs genom en interaktion med flera svängar. Ny dialog kan inte läggas till när du utökar ett uppladdat klipp där någon redan talar, medan talad dialog kan stödjas i flervändsförlängning.

Uppdateringen rapporteras också tillhandahålla första och sista bildruta interpolation: utvecklare tillhandahåller en startram och en slutram, och modellen genererar rörelse mellan dem. MarkTechPost identifierar kamerabanor, dolly-zoom och sömlösa loopar som avsedd användning, utan oberoende demonstrationer eller mätningar. Prompttaggar kan tilldela mediaroller, inklusive en stillbild som en stil- eller ämnesreferens och en video som en karaktärs- eller objektreferens. Videoreferenser är begränsade till tre klipp på upp till tre sekunder vardera; ljud inuti en videoreferens ignoreras, och resonemang över flera videor stöds inte och kan minska utdatakvaliteten. Modellen stöder 360p, 720p, 1080p och 4K, med 720p standard och de två högre upplösningarna som produceras genom uppskalning. Google säger att 360p-förhandsvisningar genererar upp till 60 % snabbare och kostar en tredjedel så mycket som 720p. Rapporterad prissättning är 1,50 USD per 1 miljon inmatade tokens, 9 USD per 1 miljon utgående texttokens och 17,50 USD per 1 miljon utgående videotokens, med en effektiv kostnad på cirka 0,10 USD per sekund för 720p under standardprissättning. Tillgänglighet genom Gemini API, Google AI Studio, Gemini Enterprise Agent Platform och Google Flow har inte verifierats oberoende.

Källinformation: marktechpost.com ↗

Varför det spelar roll

Den rapporterade uppdateringen tar upp praktiska flaskhalsar i AI-videoproduktion: bibehålla kontinuitet, kontrollera övergångar och iterera utan att återskapa ett helt klipp. Ett draft-at-360p-arbetsflöde kan minska kostnaderna och tiden för experiment, medan 1080p- och 4K-utgångar är tillgängliga som uppskalerade upplösningar. Dessa funktioner kan ha betydelse för utvecklare och kreativa team som bygger videoverktyg, även om källan inte tillhandahåller oberoende tester av utdatakvalitet, tillförlitlighet, latens eller kundresultat.

Om de rapporterade kontrollerna fungerar tillförlitligt kan Gemini Omni 1.1 Flash flytta vissa AI-videoarbetsflöden från upprepad fullständig regenerering till riktad redigering. Att bevara onämnda element över konversationssvängarna kan minska snabb återställning, klipprekonstruktion och manuell kombination av generationer, medan längre scenkontext kan minska diskontinuiteter. Kontroll av första och sista bildruta lägger till tydliga gränsvillkor: en startbild fastställer var ett klipp börjar och en slutbild begränsar var det slutar, vilket kan hjälpa övergångar, loopar och kontrollerade kamerarörelser. Rapporten fastställer dock inte fysisk rimlighet, ämneskonsistens, redigeringsnoggrannhet, tidsmässig konsekvens, identitetsbevarande eller ljudkontinuitet genom neutral testning.

Det rapporterade alternativet för utkast till resolution kan göra experiment mer tillgängligt för team som betalar per genererad utdata. MarkTechPost säger att 360p-förhandsvisningar är snabbare och betydligt billigare än 720p, medan 1080p och 4K är uppskalade utgångar. Ett utkast till ett exklusivt arbetsflöde kan sänka kostnaderna för promptiteration och hjälpa team att avvisa svaga koncept innan en slutlig rendering. Källan jämför inte fina detaljer, textåtergivning, ansikten, rörelseartefakter eller ljudkvalitet mellan utkast och slutliga utdata. Modellen är också betald och har inget alternativ för provisionerad genomströmning, vilket kan begränsa förutsägbar storskalig användning. Dessa funktioner kan ha betydelse för utvecklare och kreativa team som bygger videoverktyg, men källan ger inga oberoende tester av utdatakvalitet, tillförlitlighet, latens eller kundresultat.

Den rapporterade härkomstfunktionen kan ha betydelse för utgivare och plattformar som hanterar syntetiska medier. MarkTechPost säger att varje genererad video har en osynlig SynthID-vattenstämpel som tittare inte kan se men programvara kan upptäcka. Det skulle kunna stödja nedströms identifiering, men källan förklarar inte detektionstäckning, robusthet efter redigering eller komprimering, tillgång till detektionsverktyg eller om vattenstämpeln identifierar den specifika modellen eller generationen; det ska inte behandlas som ett fullständigt autenticitets- eller tillskrivningssystem. De namngivna produktionskunderna – Adobe, Figma Weave, GMI Cloud och Runway – kunde signalera tidig användning, men rapporten specificerar inte distributionsomfång, funktioner, volymer, prestandaresultat eller oberoende bekräftelse. Den här recensionen behandlar dessa uttalanden som påståenden som tillskrivs MarkTechPost snarare än etablerade fakta.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Vad du ska titta på härnäst

Huvudfrågorna är om de rapporterade kontrollerna ger en pålitlig kontinuitet utanför noggrant förberedda exempel och hur modellen presterar på dialog, flera ämnen, komplexa rörelser och längre arbetsflöden. Källan identifierar betydande begränsningar: tillägg läggs bara till i slutet, uppladdade klipp måste i allmänhet vara 10 sekunder eller kortare, röstredigering och ljudreferenser stöds inte, och uppladdad videoredigering eller tillägg är inte tillgänglig i EES, Schweiz och Storbritannien. MarkTechPost säger att dess påståenden kontrollerades mot Google-dokumentation och prissättning, men den här recensionen har inte oberoende bekräftat dessa dokument, priser, tillgänglighet eller kundinstallationer.

Det första problemet är kontinuitet i den verkliga världen över upprepade tillägg. Källan säger att modellen kan använda upp till 10 sekunders sammanhang och förlänga ett klipp till 40 sekunder, men rapporterar inga framgångsfrekvenser eller oberoende tester. Framtida utvärderingar bör undersöka karaktärer, objekt, kamerarörelser, ljus, rumsliga relationer och ljud över på varandra följande tillägg, och särskilja modellgenererade klipp från uppladdade klipp eftersom deras rapporterade regler skiljer sig åt. Oberoende tester bör också undersöka svåra övergångar där ramar skiljer sig åt i pose, synvinkel, ljussättning, objektarrangemang eller scengeometri. Även om källan namnger orbits, dolly-zoom och sömlösa loopar, etablerar den inte prestanda, misslyckade generationer, oönskade ämnesändringar, tidsmässiga artefakter eller nödvändig snabb iteration.

Tillgänglighet och regionala begränsningar kommer att påverka användningen. MarkTechPost rapporterar tillgänglighet genom flera Google-tjänster, men säger att uppladdade videoredigering eller tillägg inte är tillgängligt i EES, Schweiz och Storbritannien. Det står också att det inte finns någon gratis nivå och ingen provisionerad genomströmning. Utvecklare måste bekräfta aktuell åtkomst, regional behörighet, kvoter, prissättning och leveranskrav för filer över 4 MB. Källan säger att utdata över den storleken kräver URI-leverans och polling via Files API tills filen blir aktiv. De ostödda kontrollerna är också följdriktiga: modellen saknar enligt uppgift systeminstruktioner, temperatur, top_p, stoppsekvenser, negativa promptkontroller, röstredigering, ljudreferenser och YouTube URL:er som källingångar. Negativ måste placeras i vanlig snabbtext.

Språktäckning och proveniens kräver uppföljning. MarkTechPost säger att engelska stöds fullt ut medan andra språk inte utvärderas. De mest användbara bevisen skulle vara reproducerbara tester, aktuell API-dokumentation, tydliga regionala termer och oberoende användare som beskriver faktiska arbetsflöden. MarkTechPost säger att dess påståenden kontrollerades mot Gemini API-dokumentation och prissättning, men denna recension har inte oberoende bekräftat Google:s dokumentation, de angivna priserna, listad tillgänglighet, SynthID-beteende eller namngivna produktionsinstallationer. Kunduttalanden bör beskriva faktisk användning snarare än att bara namnge företag som användare, och testning bör täcka dialog, flera ämnen, komplexa rörelser och längre arbetsflöden.

Relaterade guider och frågesporter

Vad är AI?AI-modeller förklarasAI-etikAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker

Uppdateringar och korrigeringar

Denna kanoniska berättelse uppdateras på plats när händelsen som utvecklas väsentligt förändras. Dess URL och ursprungliga publiceringsdatum ändras aldrig.

  • Den här kandidaten avancerar väsentligt samma Gemini Omni 1.1 Flash-version som redan representeras av den kvalificerade kanoniska uppdateringen. MarkTechPost rapporterar ytterligare konkreta detaljer om uppdateringens 10-sekunders scenkontext, kumulativa 40-sekunders förlängningstak, första och sista bildruteinterpolation, videoreferensgränser, 360p-utkastsekonomi, SynthID-vattenmärkning, regionala begränsningar, kontroller som inte stöds, prissättning och namngivna produktionsanvändare. Dessa uppgifter tillskrivs MarkTechPost och har inte bekräftats oberoende här.
  • MarkTechPost utvecklar väsentligt den fortsatta Gemini Omni 1.1 Flash-releasehistorien genom att rapportera implementering, tillgänglighet, prissättning, upplösning, härkomst och redigeringsgränsdetaljer, inklusive 10 sekunders scenkontext, 40-sekunders kumulativa tillägg, kontroll av första och sista bildruta och rendering av 360p-utkast. Dessa uppgifter tillskrivs MarkTechPost och bekräftas inte oberoende av den medföljande källan.
  • Den här Google DeepMind-bloggen främjar materiellt den fortsatta Gemini Omni 1.1 Flash-utgåvan genom att detaljera scentillägg som använder upp till 10 sekunder av föregående sammanhang och når 40 sekunder kumulativt, interpolering av första och sista bildrutan, 360p-påståenden AIU2X och 6XZ snabbare upp till 6XZ-förhandsvisningar. en tredjedel av kostnaden för 720p, 1080p och 4K-uppskalning, videoreferensingångar på upp till tre sekunder och tillgänglighet via Google AI Studio, Agent Platform API, Google Flow och Gemini-appen.
  • Den här dokumentationen är en väsentlig teknisk uppdatering av samma Gemini Omni 1.1 Flash-version som täcks av den kanoniska posten. Den lägger till modell-ID, förhandsgranskningsstatus, releasedatum, inmatnings- och utdatamodaliteter, videogenererings- och redigeringsfunktioner, ljudgenereringsstöd, token- och filgränser, format som stöds, regional information och konsumtionsbegränsningar.
Se den offentliga korrigeringsloggen
Hittade du detta användbart?