Apa yang terjadi
MarkTechPost melaporkan bahwa Google merilis Gemini Omni 1.1 Flash, pembaruan pada model pembuatan dan pengeditan video multimodal. Perubahan yang dilaporkan berfokus pada keterarahan dan pengeditan berulang: model dapat menganalisis video sebelumnya hingga 10 detik saat memperluas adegan, menerima frame pertama dan terakhir yang disematkan, menggunakan referensi video pendek untuk konsistensi karakter atau objek, dan mempertahankan status pengeditan di seluruh percakapan melalui API Interaksi. MarkTechPost mengatakan model ini tersedia melalui Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, dan Google Flow. Outlet tersebut mengatakan Adobe, Figma Weave, GMI Cloud, dan Runway sudah menjadi pengguna produksi, tetapi klaim penggunaan pelanggan tersebut belum dikonfirmasi secara independen di sini.
MarkTechPost melaporkan bahwa Google merilis Gemini Omni 1.1 Flash sebagai pembaruan produksi untuk model pembuatan dan pengeditan video multimodal aslinya. Menurut outlet tersebut, ia menerima teks, gambar, audio, dan video dalam satu alur kerja dan menghasilkan video dengan audio. Pengeditan percakapan stateful dijalankan melalui API Interaksi Google: meneruskan previous_interaction_id memungkinkan model mempertahankan status video sebelumnya dan menerapkan perubahan bernama tanpa mengupload lagi video sebelumnya. Sumber tersebut mengilustrasikan hal ini dengan membuat biola yang dihasilkan tidak terlihat sambil mempertahankan elemen lain yang tidak ditentukan, namun tidak secara independen menetapkan seberapa konsisten pelestarian tersebut berhasil.
Ekstensi adegan dilaporkan menggunakan konteks sebelumnya hingga 10 detik, dibandingkan dengan hanya detik terakhir di versi sebelumnya. Model ini menghasilkan kelanjutan tiga hingga 10 detik, dengan perpanjangan yang dilakukan dalam peningkatan 10 detik hingga batas maksimum kumulatif 40 detik. MarkTechPost mengatakan konteks tambahan dimaksudkan untuk mempertahankan gerakan, karakter, dan audio, dan beberapa frame akhir dapat diedit untuk membuat jahitannya berkesinambungan. Ekstensi hanya ditambahkan di bagian akhir, bukan di awal atau tengah. Input yang diupload tidak boleh lebih dari 10 detik kecuali video yang dihasilkan model diperpanjang melalui interaksi multi-putaran. Dialog baru tidak dapat ditambahkan saat memperluas klip yang diunggah yang sudah berisi seseorang berbicara, sedangkan dialog lisan dapat didukung dalam ekstensi multi-putaran.
Pembaruan ini juga dilaporkan menyediakan interpolasi bingkai pertama dan terakhir: pengembang menyediakan bingkai awal dan bingkai akhir, dan model menghasilkan gerakan di antara keduanya. MarkTechPost mengidentifikasi orbit kamera, dolly-zoom, dan loop mulus sesuai tujuan penggunaan, tanpa demonstrasi atau pengukuran independen. Tag prompt dapat menetapkan peran media, termasuk gambar diam sebagai referensi gaya atau subjek dan video sebagai referensi karakter atau objek. Referensi video dibatasi hingga tiga klip masing-masing hingga tiga detik; audio di dalam referensi video diabaikan, dan penalaran di beberapa video tidak didukung dan dapat mengurangi kualitas output. Model ini mendukung 360p, 720p, 1080p, dan 4K, dengan default 720p dan dua resolusi lebih tinggi yang dihasilkan melalui peningkatan. Google dilaporkan mengatakan pratinjau 360p menghasilkan hingga 60% lebih cepat dan biaya sepertiganya sama dengan 720p. Harga yang dilaporkan adalah $1,50 per 1 juta token masukan, $9 per 1 juta token teks keluaran, dan $17,50 per 1 juta token video keluaran, dengan biaya efektif sekitar $0,10 per detik untuk 720p di bawah harga standar. Ketersediaan melalui Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, dan Google Flow belum diverifikasi secara independen.
Detail sumber: marktechpost.com ↗
Mengapa itu penting
Pembaruan yang dilaporkan mengatasi hambatan praktis dalam produksi video AI: menjaga kontinuitas, mengendalikan transisi, dan melakukan iterasi tanpa membuat ulang seluruh klip. Alur kerja draf pada 360p dapat mengurangi biaya dan waktu eksperimen, sementara output 1080p dan 4K tersedia sebagai resolusi yang ditingkatkan. Kemampuan ini mungkin penting bagi pengembang dan tim kreatif yang membuat alat video, meskipun sumbernya tidak menyediakan pengujian independen terhadap kualitas keluaran, keandalan, latensi, atau hasil pelanggan.
Jika kontrol yang dilaporkan berfungsi dengan baik, Gemini Omni 1.1 Flash dapat memindahkan beberapa alur kerja AI-video dari regenerasi penuh berulang ke pengeditan yang ditargetkan. Mempertahankan elemen yang tidak disebutkan di seluruh alur percakapan dapat mengurangi penyajian kembali secara cepat, rekonstruksi klip, dan kombinasi generasi secara manual, sementara konteks adegan yang lebih panjang dapat mengurangi diskontinuitas. Kontrol bingkai pertama dan terakhir menambahkan kondisi batas yang eksplisit: bingkai awal menetapkan tempat dimulainya klip dan bingkai akhir membatasi tempat klip berakhir, berpotensi membantu transisi, loop, dan mengontrol pergerakan kamera. Namun, laporan tersebut tidak menetapkan masuk akal secara fisik, konsistensi subjek, akurasi pengeditan, konsistensi temporal, pelestarian identitas, atau kontinuitas audio melalui pengujian netral.
Opsi resolusi draf yang dilaporkan mungkin membuat eksperimen lebih mudah diakses oleh tim yang membayar per keluaran yang dihasilkan. MarkTechPost mengatakan pratinjau 360p lebih cepat dan jauh lebih murah daripada 720p, sementara 1080p dan 4K adalah keluaran yang ditingkatkan. Alur kerja draf kemudian ditingkatkan dapat menurunkan biaya iterasi cepat dan membantu tim menolak konsep yang lemah sebelum rendering akhir. Sumber tidak membandingkan detail halus, rendering teks, wajah, artefak gerakan, atau kualitas audio antara draf dan keluaran akhir. Model ini juga hanya berbayar dan tidak memiliki opsi throughput yang disediakan, sehingga dapat membatasi penggunaan skala besar yang dapat diprediksi. Kemampuan ini mungkin penting bagi pengembang dan tim kreatif yang membuat alat video, namun sumbernya tidak memberikan pengujian independen terhadap kualitas keluaran, keandalan, latensi, atau hasil pelanggan.
Fitur asal yang dilaporkan mungkin penting bagi penerbit dan platform yang menangani media sintetis. MarkTechPost mengatakan setiap video yang dihasilkan membawa tanda air SynthID yang tidak terlihat yang tidak dapat dilihat oleh pemirsa tetapi dapat dideteksi oleh perangkat lunak. Hal ini dapat mendukung identifikasi hilir, namun sumbernya tidak menjelaskan cakupan deteksi, ketahanan setelah pengeditan atau kompresi, akses ke alat deteksi, atau apakah tanda air mengidentifikasi model atau generasi tertentu; itu tidak boleh diperlakukan sebagai sistem keaslian atau atribusi yang lengkap. Pelanggan produksi yang disebutkan—Adobe, Figma Weave, GMI Cloud, dan Runway—dapat menandakan adopsi awal, namun laporan tersebut tidak menentukan cakupan penerapan, fitur, volume, hasil kinerja, atau konfirmasi independen. Tinjauan ini memperlakukan pernyataan tersebut sebagai klaim yang dikaitkan dengan MarkTechPost dan bukan fakta yang sudah ada.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Apa yang harus ditonton selanjutnya
Pertanyaan utamanya adalah apakah kontrol yang dilaporkan menghasilkan kontinuitas yang dapat diandalkan di luar contoh yang disiapkan dengan cermat dan bagaimana kinerja model pada dialog, banyak subjek, gerakan kompleks, dan alur kerja yang lebih panjang. Sumber mengidentifikasi batasan yang signifikan: ekstensi hanya ditambahkan di bagian akhir, klip yang diupload umumnya harus berdurasi 10 detik atau lebih pendek, pengeditan suara dan referensi audio tidak didukung, dan pengeditan atau ekstensi video yang diupload tidak tersedia di EEA, Swiss, dan Inggris Raya. MarkTechPost mengatakan klaimnya telah diperiksa berdasarkan dokumentasi dan harga Google, namun tinjauan ini belum secara independen mengonfirmasi dokumen, harga, ketersediaan, atau penerapan pelanggan tersebut.
Masalah pertama adalah kesinambungan dunia nyata atas perluasan yang berulang-ulang. Sumber tersebut mengatakan model tersebut dapat menggunakan konteks hingga 10 detik dan memperpanjang klip hingga 40 detik, namun tidak melaporkan tingkat keberhasilan atau pengujian independen. Evaluasi di masa depan harus memeriksa karakter, objek, gerakan kamera, pencahayaan, hubungan spasial, dan audio di seluruh ekstensi yang berurutan, membedakan klip yang dibuat model dari klip yang diupload karena aturan yang dilaporkan berbeda. Pengujian independen juga harus memeriksa transisi sulit di mana bingkai berbeda dalam pose, sudut pandang, pencahayaan, susunan objek, atau geometri pemandangan. Meskipun sumber menyebutkan orbit, dolly-zoom, dan loop mulus, sumber tersebut tidak menentukan performa, generasi yang gagal, perubahan subjek yang tidak diinginkan, artefak temporal, atau iterasi cepat yang diperlukan.
Ketersediaan dan pembatasan regional akan mempengaruhi penggunaan. MarkTechPost melaporkan ketersediaan melalui beberapa layanan Google, tetapi mengatakan pengeditan atau ekstensi video yang diunggah tidak tersedia di EEA, Swiss, dan Inggris. Ia juga mengatakan tidak ada tingkat gratis dan tidak ada throughput yang disediakan. Pengembang perlu mengonfirmasi akses saat ini, kelayakan regional, kuota, harga, dan persyaratan pengiriman untuk file di atas 4MB. Sumber mengatakan output di atas ukuran tersebut memerlukan pengiriman URI dan polling melalui Files API hingga file menjadi aktif. Kontrol yang tidak didukung juga memiliki konsekuensi: model tersebut dilaporkan tidak memiliki instruksi sistem, suhu, top_p, urutan berhenti, kontrol prompt negatif, pengeditan suara, referensi audio, dan URL YouTube sebagai input sumber. Negatif harus ditempatkan dalam teks prompt biasa.
Cakupan bahasa dan asal usulnya memerlukan tindak lanjut. MarkTechPost mengatakan bahasa Inggris didukung sepenuhnya sementara bahasa lain tidak dievaluasi. Bukti yang paling berguna akan mencakup pengujian yang dapat direproduksi, dokumentasi API terkini, persyaratan regional yang jelas, dan pengguna independen yang menjelaskan alur kerja sebenarnya. MarkTechPost mengatakan klaimnya telah diperiksa berdasarkan dokumentasi dan harga API Gemini, namun tinjauan ini belum secara independen mengkonfirmasi dokumentasi Google, harga yang disebutkan, ketersediaan yang terdaftar, perilaku SynthID, atau penerapan produksi yang disebutkan. Pernyataan pelanggan harus menggambarkan penggunaan aktual, bukan sekadar menyebut perusahaan sebagai pengguna, dan pengujian harus mencakup dialog, banyak subjek, pergerakan kompleks, dan alur kerja yang lebih panjang.