Kembali ke Berita
ProdukAI Understanding pengarahan

MarkTechPost melaporkan Google memperbarui Gemini Omni 1.1 Flash dengan ekstensi video yang lebih panjang dan kontrol bingkai

MarkTechPost melaporkan bahwa Google Gemini Omni 1.1 Flash menambahkan konteks adegan hingga 10 detik, ekstensi kumulatif 40 detik, kontrol bingkai pertama dan terakhir, draf 360p yang lebih murah, dan peningkatan 4K. Laporan tersebut mengatakan model tersebut tersedia melalui Gemini API Gemini, AI Studio, dan Platform Agen Perusahaan Gemini.

7 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Google updated Gemini Omni 1.1 Flash with longer video extensions and frame controls
Referensi sumberSumber direkam
Penerbit
marktechpost.com
Tautan sumber
marktechpost.comhttps://www.marktechpost.com/2026/08/29/google-ai-releases-gemini-omni-1-1-flash-40-second-scene-extension-first-last-frame-control-and-4k-upscaling/
Jenis sumber
Sumber tertaut — status sumber utama belum ditetapkan.
Juga dikutip

Cerita terakhir direvisi

KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

API (Antarmuka Pemrograman Aplikasi)
Cara terstruktur bagi satu sistem perangkat lunak untuk mengirim permintaan dan menerima tanggapan dari sistem lain.
Suhu
Pengaturan pengambilan sampel yang mengontrol keacakan dalam keluaran yang dihasilkan.
Kekokohan
Kemampuan model untuk mempertahankan performa di bawah gangguan, pergeseran, atau masukan yang berlawanan.
Uji diri Anda sendiriApa itu AI? Kuis

Apa yang berubah sejak publikasi

  1. Pertama kali diterbitkan
  2. Dokumentasi ini merupakan pembaruan teknis material untuk rilis Flash Gemini Omni 1.1 yang sama yang tercakup dalam entri kanonik. Ia menambahkan ID model, status pratinjau, tanggal rilis, modalitas input dan output, fungsi pembuatan dan pengeditan video, dukungan pembuatan suara, batas token dan file, format yang didukung, informasi regional dan batasan konsumsi.
  3. Blog Google DeepMind ini secara signifikan memajukan rilis Gemini Omni 1.1 Flash yang berkelanjutan dengan merinci ekstensi adegan yang menggunakan konteks sebelumnya hingga 10 detik dan mencapai 40 detik secara kumulatif, interpolasi bingkai pertama dan terakhir, pratinjau 360p yang diklaim Google hingga 60% lebih cepat dan sepertiga biayanya Peningkatan 720p, 1080p, dan 4K, input referensi video hingga tiga detik, dan ketersediaan melalui Google AI Studio, Agent Platform API, Google Flow, dan aplikasi Gemini.
  4. MarkTechPost secara signifikan memajukan kisah rilis Flash Gemini Omni 1.1 yang berkelanjutan dengan melaporkan implementasi, ketersediaan, harga, resolusi, asal, dan detail batas pengeditan, termasuk konteks adegan 10 detik, ekstensi kumulatif 40 detik, kontrol bingkai pertama dan terakhir, dan rendering draf 360p. Detail ini dikaitkan dengan MarkTechPost dan tidak dikonfirmasi secara independen dalam sumber yang disediakan.
  5. Kandidat ini secara materi memajukan rilis Flash Gemini Omni 1.1 yang sama yang sudah diwakili oleh pembaruan kanonik yang memenuhi syarat. MarkTechPost melaporkan rincian konkrit tambahan tentang konteks adegan 10 detik pembaruan, batas maksimum perpanjangan 40 detik kumulatif, interpolasi bingkai pertama dan terakhir, batas referensi video, rancangan ekonomi 360p, tanda air SynthID, pembatasan regional, kontrol yang tidak didukung, harga, dan nama pengguna produksi. Detail tersebut dikaitkan dengan MarkTechPost dan belum dikonfirmasi secara independen di sini.

Apa yang terjadi

MarkTechPost melaporkan bahwa Google merilis Gemini Omni 1.1 Flash, pembaruan pada model pembuatan dan pengeditan video multimodal. Perubahan yang dilaporkan berfokus pada keterarahan dan pengeditan berulang: model dapat menganalisis video sebelumnya hingga 10 detik saat memperluas adegan, menerima frame pertama dan terakhir yang disematkan, menggunakan referensi video pendek untuk konsistensi karakter atau objek, dan mempertahankan status pengeditan di seluruh percakapan melalui API Interaksi. MarkTechPost mengatakan model ini tersedia melalui Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, dan Google Flow. Outlet tersebut mengatakan Adobe, Figma Weave, GMI Cloud, dan Runway sudah menjadi pengguna produksi, tetapi klaim penggunaan pelanggan tersebut belum dikonfirmasi secara independen di sini.

MarkTechPost melaporkan bahwa Google merilis Gemini Omni 1.1 Flash sebagai pembaruan produksi untuk model pembuatan dan pengeditan video multimodal aslinya. Menurut outlet tersebut, ia menerima teks, gambar, audio, dan video dalam satu alur kerja dan menghasilkan video dengan audio. Pengeditan percakapan stateful dijalankan melalui API Interaksi Google: meneruskan previous_interaction_id memungkinkan model mempertahankan status video sebelumnya dan menerapkan perubahan bernama tanpa mengupload lagi video sebelumnya. Sumber tersebut mengilustrasikan hal ini dengan membuat biola yang dihasilkan tidak terlihat sambil mempertahankan elemen lain yang tidak ditentukan, namun tidak secara independen menetapkan seberapa konsisten pelestarian tersebut berhasil.

Ekstensi adegan dilaporkan menggunakan konteks sebelumnya hingga 10 detik, dibandingkan dengan hanya detik terakhir di versi sebelumnya. Model ini menghasilkan kelanjutan tiga hingga 10 detik, dengan perpanjangan yang dilakukan dalam peningkatan 10 detik hingga batas maksimum kumulatif 40 detik. MarkTechPost mengatakan konteks tambahan dimaksudkan untuk mempertahankan gerakan, karakter, dan audio, dan beberapa frame akhir dapat diedit untuk membuat jahitannya berkesinambungan. Ekstensi hanya ditambahkan di bagian akhir, bukan di awal atau tengah. Input yang diupload tidak boleh lebih dari 10 detik kecuali video yang dihasilkan model diperpanjang melalui interaksi multi-putaran. Dialog baru tidak dapat ditambahkan saat memperluas klip yang diunggah yang sudah berisi seseorang berbicara, sedangkan dialog lisan dapat didukung dalam ekstensi multi-putaran.

Pembaruan ini juga dilaporkan menyediakan interpolasi bingkai pertama dan terakhir: pengembang menyediakan bingkai awal dan bingkai akhir, dan model menghasilkan gerakan di antara keduanya. MarkTechPost mengidentifikasi orbit kamera, dolly-zoom, dan loop mulus sesuai tujuan penggunaan, tanpa demonstrasi atau pengukuran independen. Tag prompt dapat menetapkan peran media, termasuk gambar diam sebagai referensi gaya atau subjek dan video sebagai referensi karakter atau objek. Referensi video dibatasi hingga tiga klip masing-masing hingga tiga detik; audio di dalam referensi video diabaikan, dan penalaran di beberapa video tidak didukung dan dapat mengurangi kualitas output. Model ini mendukung 360p, 720p, 1080p, dan 4K, dengan default 720p dan dua resolusi lebih tinggi yang dihasilkan melalui peningkatan. Google dilaporkan mengatakan pratinjau 360p menghasilkan hingga 60% lebih cepat dan biaya sepertiganya sama dengan 720p. Harga yang dilaporkan adalah $1,50 per 1 juta token masukan, $9 per 1 juta token teks keluaran, dan $17,50 per 1 juta token video keluaran, dengan biaya efektif sekitar $0,10 per detik untuk 720p di bawah harga standar. Ketersediaan melalui Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, dan Google Flow belum diverifikasi secara independen.

Detail sumber: marktechpost.com ↗

Mengapa itu penting

Pembaruan yang dilaporkan mengatasi hambatan praktis dalam produksi video AI: menjaga kontinuitas, mengendalikan transisi, dan melakukan iterasi tanpa membuat ulang seluruh klip. Alur kerja draf pada 360p dapat mengurangi biaya dan waktu eksperimen, sementara output 1080p dan 4K tersedia sebagai resolusi yang ditingkatkan. Kemampuan ini mungkin penting bagi pengembang dan tim kreatif yang membuat alat video, meskipun sumbernya tidak menyediakan pengujian independen terhadap kualitas keluaran, keandalan, latensi, atau hasil pelanggan.

Jika kontrol yang dilaporkan berfungsi dengan baik, Gemini Omni 1.1 Flash dapat memindahkan beberapa alur kerja AI-video dari regenerasi penuh berulang ke pengeditan yang ditargetkan. Mempertahankan elemen yang tidak disebutkan di seluruh alur percakapan dapat mengurangi penyajian kembali secara cepat, rekonstruksi klip, dan kombinasi generasi secara manual, sementara konteks adegan yang lebih panjang dapat mengurangi diskontinuitas. Kontrol bingkai pertama dan terakhir menambahkan kondisi batas yang eksplisit: bingkai awal menetapkan tempat dimulainya klip dan bingkai akhir membatasi tempat klip berakhir, berpotensi membantu transisi, loop, dan mengontrol pergerakan kamera. Namun, laporan tersebut tidak menetapkan masuk akal secara fisik, konsistensi subjek, akurasi pengeditan, konsistensi temporal, pelestarian identitas, atau kontinuitas audio melalui pengujian netral.

Opsi resolusi draf yang dilaporkan mungkin membuat eksperimen lebih mudah diakses oleh tim yang membayar per keluaran yang dihasilkan. MarkTechPost mengatakan pratinjau 360p lebih cepat dan jauh lebih murah daripada 720p, sementara 1080p dan 4K adalah keluaran yang ditingkatkan. Alur kerja draf kemudian ditingkatkan dapat menurunkan biaya iterasi cepat dan membantu tim menolak konsep yang lemah sebelum rendering akhir. Sumber tidak membandingkan detail halus, rendering teks, wajah, artefak gerakan, atau kualitas audio antara draf dan keluaran akhir. Model ini juga hanya berbayar dan tidak memiliki opsi throughput yang disediakan, sehingga dapat membatasi penggunaan skala besar yang dapat diprediksi. Kemampuan ini mungkin penting bagi pengembang dan tim kreatif yang membuat alat video, namun sumbernya tidak memberikan pengujian independen terhadap kualitas keluaran, keandalan, latensi, atau hasil pelanggan.

Fitur asal yang dilaporkan mungkin penting bagi penerbit dan platform yang menangani media sintetis. MarkTechPost mengatakan setiap video yang dihasilkan membawa tanda air SynthID yang tidak terlihat yang tidak dapat dilihat oleh pemirsa tetapi dapat dideteksi oleh perangkat lunak. Hal ini dapat mendukung identifikasi hilir, namun sumbernya tidak menjelaskan cakupan deteksi, ketahanan setelah pengeditan atau kompresi, akses ke alat deteksi, atau apakah tanda air mengidentifikasi model atau generasi tertentu; itu tidak boleh diperlakukan sebagai sistem keaslian atau atribusi yang lengkap. Pelanggan produksi yang disebutkan—Adobe, Figma Weave, GMI Cloud, dan Runway—dapat menandakan adopsi awal, namun laporan tersebut tidak menentukan cakupan penerapan, fitur, volume, hasil kinerja, atau konfirmasi independen. Tinjauan ini memperlakukan pernyataan tersebut sebagai klaim yang dikaitkan dengan MarkTechPost dan bukan fakta yang sudah ada.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Apa yang harus ditonton selanjutnya

Pertanyaan utamanya adalah apakah kontrol yang dilaporkan menghasilkan kontinuitas yang dapat diandalkan di luar contoh yang disiapkan dengan cermat dan bagaimana kinerja model pada dialog, banyak subjek, gerakan kompleks, dan alur kerja yang lebih panjang. Sumber mengidentifikasi batasan yang signifikan: ekstensi hanya ditambahkan di bagian akhir, klip yang diupload umumnya harus berdurasi 10 detik atau lebih pendek, pengeditan suara dan referensi audio tidak didukung, dan pengeditan atau ekstensi video yang diupload tidak tersedia di EEA, Swiss, dan Inggris Raya. MarkTechPost mengatakan klaimnya telah diperiksa berdasarkan dokumentasi dan harga Google, namun tinjauan ini belum secara independen mengonfirmasi dokumen, harga, ketersediaan, atau penerapan pelanggan tersebut.

Masalah pertama adalah kesinambungan dunia nyata atas perluasan yang berulang-ulang. Sumber tersebut mengatakan model tersebut dapat menggunakan konteks hingga 10 detik dan memperpanjang klip hingga 40 detik, namun tidak melaporkan tingkat keberhasilan atau pengujian independen. Evaluasi di masa depan harus memeriksa karakter, objek, gerakan kamera, pencahayaan, hubungan spasial, dan audio di seluruh ekstensi yang berurutan, membedakan klip yang dibuat model dari klip yang diupload karena aturan yang dilaporkan berbeda. Pengujian independen juga harus memeriksa transisi sulit di mana bingkai berbeda dalam pose, sudut pandang, pencahayaan, susunan objek, atau geometri pemandangan. Meskipun sumber menyebutkan orbit, dolly-zoom, dan loop mulus, sumber tersebut tidak menentukan performa, generasi yang gagal, perubahan subjek yang tidak diinginkan, artefak temporal, atau iterasi cepat yang diperlukan.

Ketersediaan dan pembatasan regional akan mempengaruhi penggunaan. MarkTechPost melaporkan ketersediaan melalui beberapa layanan Google, tetapi mengatakan pengeditan atau ekstensi video yang diunggah tidak tersedia di EEA, Swiss, dan Inggris. Ia juga mengatakan tidak ada tingkat gratis dan tidak ada throughput yang disediakan. Pengembang perlu mengonfirmasi akses saat ini, kelayakan regional, kuota, harga, dan persyaratan pengiriman untuk file di atas 4MB. Sumber mengatakan output di atas ukuran tersebut memerlukan pengiriman URI dan polling melalui Files API hingga file menjadi aktif. Kontrol yang tidak didukung juga memiliki konsekuensi: model tersebut dilaporkan tidak memiliki instruksi sistem, suhu, top_p, urutan berhenti, kontrol prompt negatif, pengeditan suara, referensi audio, dan URL YouTube sebagai input sumber. Negatif harus ditempatkan dalam teks prompt biasa.

Cakupan bahasa dan asal usulnya memerlukan tindak lanjut. MarkTechPost mengatakan bahasa Inggris didukung sepenuhnya sementara bahasa lain tidak dievaluasi. Bukti yang paling berguna akan mencakup pengujian yang dapat direproduksi, dokumentasi API terkini, persyaratan regional yang jelas, dan pengguna independen yang menjelaskan alur kerja sebenarnya. MarkTechPost mengatakan klaimnya telah diperiksa berdasarkan dokumentasi dan harga API Gemini, namun tinjauan ini belum secara independen mengkonfirmasi dokumentasi Google, harga yang disebutkan, ketersediaan yang terdaftar, perilaku SynthID, atau penerapan produksi yang disebutkan. Pernyataan pelanggan harus menggambarkan penggunaan aktual, bukan sekadar menyebut perusahaan sebagai pengguna, dan pengujian harus mencakup dialog, banyak subjek, pergerakan kompleks, dan alur kerja yang lebih panjang.

Panduan & kuis terkait

Apa itu AI?Model AI DijelaskanEtika AIMasa Depan AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI

Pembaruan dan koreksi

Kisah kanonik ini diperbarui ketika peristiwa yang berkembang berubah secara signifikan. URL dan tanggal publikasi aslinya tidak pernah berubah.

  • Kandidat ini secara materi memajukan rilis Flash Gemini Omni 1.1 yang sama yang sudah diwakili oleh pembaruan kanonik yang memenuhi syarat. MarkTechPost melaporkan rincian konkrit tambahan tentang konteks adegan 10 detik pembaruan, batas maksimum perpanjangan 40 detik kumulatif, interpolasi bingkai pertama dan terakhir, batas referensi video, rancangan ekonomi 360p, tanda air SynthID, pembatasan regional, kontrol yang tidak didukung, harga, dan nama pengguna produksi. Detail tersebut dikaitkan dengan MarkTechPost dan belum dikonfirmasi secara independen di sini.
  • MarkTechPost secara signifikan memajukan kisah rilis Flash Gemini Omni 1.1 yang berkelanjutan dengan melaporkan implementasi, ketersediaan, harga, resolusi, asal, dan detail batas pengeditan, termasuk konteks adegan 10 detik, ekstensi kumulatif 40 detik, kontrol bingkai pertama dan terakhir, dan rendering draf 360p. Detail ini dikaitkan dengan MarkTechPost dan tidak dikonfirmasi secara independen dalam sumber yang disediakan.
  • Blog Google DeepMind ini secara signifikan memajukan rilis Gemini Omni 1.1 Flash yang berkelanjutan dengan merinci ekstensi adegan yang menggunakan konteks sebelumnya hingga 10 detik dan mencapai 40 detik secara kumulatif, interpolasi bingkai pertama dan terakhir, pratinjau 360p yang diklaim Google hingga 60% lebih cepat dan sepertiga biayanya Peningkatan 720p, 1080p, dan 4K, input referensi video hingga tiga detik, dan ketersediaan melalui Google AI Studio, Agent Platform API, Google Flow, dan aplikasi Gemini.
  • Dokumentasi ini merupakan pembaruan teknis material untuk rilis Flash Gemini Omni 1.1 yang sama yang tercakup dalam entri kanonik. Ia menambahkan ID model, status pratinjau, tanggal rilis, modalitas input dan output, fungsi pembuatan dan pengeditan video, dukungan pembuatan suara, batas token dan file, format yang didukung, informasi regional dan batasan konsumsi.
Lihat log koreksi publik
Apakah ini berguna?