PANDUAN AI Visual
Transformasi Gaya Video-ke-Video
Transformasi gaya video-ke-video menggunakan AI, biasanya model difusi, untuk memberikan tampilan baru pada rekaman yang ada, seperti anime, animasi tanah liat, atau cat minyak, sambil mempertahankan gerakan, pengaturan waktu, dan komposisi aslinya.
Di halaman ini4 menit membaca
Ikhtisar
Hal ini penting karena memungkinkan pembuat konten menggunakan kembali pertunjukan nyata dan hasil kamera dalam gaya visual baru. Hal ini juga menimbulkan pertanyaan tentang izin dan hak cipta ketika rekaman sumber menunjukkan orang sungguhan atau milik orang lain.
Menyelam Lebih Dalam
Sebagian besar saluran video-ke-video memiliki dua langkah. Pertama, mereka mengekstrak struktur dari video sumber: peta kedalaman dari model seperti MiDaS atau Depth Anything, peta tepi atau garis, kerangka pose manusia dari alat seperti OpenPose, dan terkadang aliran optik, yang mencatat bagaimana piksel berpindah antar bingkai. Kemudian mereka menghasilkan frame baru yang dikondisikan pada struktur itu ditambah style prompt atau gambar referensi. ControlNet, yang diperkenalkan pada tahun 2023, menjadikan hal ini praktis untuk Stable Diffusion dengan memungkinkan pembuatan peta kedalaman atau pose kerangka tanpa melatih ulang model dasar. Pengaturan kuncinya biasanya adalah transformasi atau penyangkalan kekuatan. Bingkai sumber diberi noise sebagian dan kemudian di-noise ke arah gaya baru. Kekuatan rendah tetap mendekati aslinya tetapi hanya sedikit perubahan. Kekuatan tinggi memberikan gaya yang lebih berani, namun output mulai menyimpang dari sumber dan berkedip di antara frame. Pengkondisian kedalaman menjaga tata letak ruangan dan penempatan objek. Pengondisian pose menjaga pergerakan manusia. Peta tepi mempertahankan garis tepi yang halus. Ada tiga pendekatan luas. Difusi per frame dengan ControlNet mengandalkan benih bersama dan perhatian lintas frame untuk membatasi kedipan. Metode keyframe mengubah gaya beberapa frame dengan hati-hati dan menyebarkan tampilan tersebut ke frame lainnya, seperti yang dilakukan EbSynth dengan propagasi berbasis patch. Metode penelitian seperti Rerender-A-Video dan TokenFlow mendorong lebih jauh ke arah tersebut. Model video asli yang menerima video input, yang ditawarkan oleh Runway Gen-1 pada tahun 2023, menangani waktu di dalam model. Kesalahpahaman yang umum terjadi adalah bahwa penataan ulang membuat orang menjadi anonim atau mengubah rekaman menjadi karya baru yang dapat digunakan secara bebas. Ia tidak melakukan keduanya secara otomatis. Gaya berjalan, bentuk tubuh, suara, dan latar sering kali tetap dapat diidentifikasi, hak kemiripan dan publisitas masih berlaku, dan rekaman yang mendasarinya tetap memiliki hak cipta. Penggunaan yang bertanggung jawab berarti memfilmkan materi Anda sendiri atau mendapatkan izin, dan mengungkapkan bahwa rekaman tersebut telah diubah.
Dampak Strategis
Kecepatan dan skala
Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.
Pilihan Build
Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.
Tim dan alur kerja
Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.
Masa Depan Transformasi Gaya Video-ke-Video
Model pengeditan video asli yang mengambil klip sumber dan mengikuti struktur serta gerakan secara langsung menggantikan alur per-frame yang dibuat dengan tangan di banyak alat. Area perbaikan yang mungkin terjadi adalah klip yang lebih panjang, pelestarian wajah dan tangan yang lebih baik, dan kontrol yang lebih baik terhadap perubahan area mana. Di sisi penggunaan yang bertanggung jawab, standar asal seperti Kredensial Konten C2PA, aturan pelabelan platform, dan persyaratan izin untuk kemiripan dengan orang sungguhan menjadi lebih relevan. Seberapa konsisten alat-alat tersebut dalam menegakkan persetujuan masih belum jelas, dan platform serta yurisdiksi yang berbeda mungkin menanganinya secara berbeda.
Implementasi Dunia Nyata
Seorang pembuat film indie memotret aktor di garasi dan mengubah rekamannya menjadi tampilan fantasi yang dilukis, menggunakan peta kedalaman sehingga dinding, meja, dan pintu tetap mempertahankan bentuknya di setiap bingkai.
Pencipta tari mengekstrak kerangka pose dari rutinitas dan menghasilkan karakter animasi yang menampilkan koreografi yang sama dengan waktu yang sama.
Sebuah agensi kecil menata ulang rekaman produk ponsel pintar menjadi tampilan kerajinan kertas dengan alat video-ke-video komersial, sehingga menurunkan kekuatan transformasi sehingga bentuk dan logo produk tetap mudah dibaca.
Seseorang mengubah klip viral orang asing menjadi kartun dan memposting ulang. Tubuh, suara, dan gerak tubuh orang tersebut masih dapat dikenali, dan hak cipta pengunggah asli belum hilang.
Risiko & Pagar Pembatas
Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.
Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.
Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.
Peta Jalan Implementasi
Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.
Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.
Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.
Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Video-to-Video Style Transformation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Pertanyaan yang sering diajukan
Apa itu Transformasi Gaya Video-ke-Video?
Transformasi gaya video-ke-video menggunakan AI, biasanya model difusi, untuk memberikan tampilan baru pada rekaman yang ada, seperti anime, animasi tanah liat, atau cat minyak, sambil mempertahankan gerakan, pengaturan waktu, dan komposisi aslinya. Hal ini penting karena memungkinkan pembuat konten menggunakan kembali pertunjukan nyata dan hasil kamera dalam gaya visual baru. Hal ini juga menimbulkan pertanyaan tentang izin dan hak cipta ketika rekaman sumber menunjukkan orang sungguhan atau milik orang lain.
Apa langkah pertama yang biasanya dilakukan dalam alur penataan ulang video-ke-video?
Pipeline pertama-tama menangkap struktur sumber sehingga pembuatannya dapat mengikuti tata letak dan gerakannya sambil mengubah gaya.
Apa yang dibuat ControlNet secara praktis untuk Stable Diffusion?
ControlNet menambahkan jalur pengkondisian sehingga masukan struktural seperti kedalaman atau kerangka pose memandu keluaran model yang ada.
Apa yang biasanya terjadi ketika Anda meningkatkan kekuatan transformasi atau denoising?
Kekuatan yang lebih tinggi akan menimbulkan lebih banyak noise pada sumbernya, sehingga memberikan lebih banyak kebebasan pada model. Itu berarti lebih banyak gaya tetapi kurang setia dan lebih banyak inkonsistensi frame-to-frame.
Sinyal pengondisian manakah yang paling cocok untuk melestarikan koreografi penari?
Kerangka pose menangkap posisi sendi dari waktu ke waktu, sehingga secara langsung melestarikan gerakan manusia.
Bagaimana metode keyframe seperti pendekatan EbSynth melakukan penataan ulang?
Propagasi keyframe mengubah gaya beberapa frame dengan hati-hati dan kemudian membawa tampilan tersebut ke seluruh klip.
Teruslah belajar
Panduan terkait
Panduan lainnya dipilih untuk topik ini