Buat-A-Video Teks-ke-Video
Make-A-Video adalah sistem Meta tahun 2022 yang mengubah perintah teks menjadi klip video pendek tanpa pernah melatih pasangan teks-video berlabel.
Ikhtisar
It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.
Menyelam Lebih Dalam
Make-A-Video, diumumkan oleh Meta AI pada bulan September 2022, menghasilkan video berdurasi beberapa detik dari kalimat seperti 'seekor anjing mengenakan jubah superhero terbang melintasi langit.' Trik utamanya adalah memisahkan tampilan dari gerakan: model teks-ke-gambar (dibangun pada ruang dan difusi gabungan teks-gambar gaya CLIP) mempelajari tampilan sesuatu dari miliaran gambar yang diberi teks, sementara lapisan spatiotemporal terpisah mempelajari bagaimana segala sesuatunya berpindah dari video yang tidak berlabel saja. Hal ini menghindari kelangkaan pasangan teks-video berkualitas tinggi. Model dasar menghasilkan klip dengan resolusi rendah dan kecepatan frame rendah, kemudian jaringan khusus menginterpolasi frame tambahan dan meningkatkan resolusi spasial. Hasilnya sangat koheren untuk zamannya, meskipun klipnya pendek, buram, dan cenderung berkedip dan melengkung.
Wawasan Teknis
Make-A-Video memperluas konvolusi dan perhatian pembuatan gambar 2D ke dalam 3D dengan menambahkan lapisan pseudo-temporal. Bobot spasial yang telah dilatih sebelumnya dibekukan atau disempurnakan sementara lapisan temporal baru mempelajari gerakan dari video mentah, sehingga tidak diperlukan label teks-video. Jaringan interpolasi bingkai kemudian memadatkan garis waktu dan modul difusi resolusi super meningkatkan detail spasial, mengubah rancangan kasar 16 bingkai dan beresolusi rendah menjadi klip yang lebih halus dan tajam dalam alur berjenjang.
Dampak Strategis
Kecepatan dan skala
Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.
Build choices
Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.
Team and workflow
Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.
Masa Depan Teks-ke-Video Make-A-Video
Resep gambar-sebelum-plus-gerakan-tanpa label Make-A-Video mengungguli seluruh gelombang teks-ke-video. Keturunannya menekankan klip yang lebih panjang, beresolusi lebih tinggi, dan stabil sementara dengan gerakan kamera dan audio yang dapat dikontrol. Harapkan ide inti, menggunakan kembali pengetahuan gambar dalam jumlah besar dan mempelajari gerakan dengan murah, akan tetap bertahan bahkan ketika arsitektur beralih ke difusi laten berbasis transformator dan model terpadu yang juga menerima pengondisian gambar atau video untuk pengeditan dan kelanjutan.
Implementasi Dunia Nyata
Menganimasikan satu kalimat deskriptif menjadi klip perulangan pendek untuk postingan media sosial
Menghidupkan konsep statis seperti 'boneka beruang yang sedang melukis potret' sebagai ilustrasi bergerak
Menginterpolasi antara dua gambar diam yang disediakan pengguna untuk membuat video transisi yang mulus
Menghasilkan draf gerak cepat dari adegan yang dibayangkan untuk pembuatan storyboard sebelum pembuatan film apa pun
Risiko & Pagar Pembatas
Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.
Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.
Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.
Peta Jalan Implementasi
Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.
Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.
Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.
Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Make-A-Video Text-to-Video quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Sora dan Teks-ke-Video
Pertanyaan yang sering diajukan
What is Make-A-Video Text-to-Video?
Make-A-Video adalah sistem Meta tahun 2022 yang mengubah perintah teks menjadi klip video pendek tanpa pernah melatih pasangan teks-video berlabel. Hal ini penting karena menunjukkan bahwa pengetahuan visual dalam model text-to-image dapat 'diajarkan' untuk bergerak hanya dengan menggunakan video tanpa label.
Apa inovasi utama yang membuat Make-A-Video tidak lagi membutuhkan pasangan teks-video yang diberi label?
Make-A-Video memisahkan masalah ini: model teks-ke-gambar mempelajari tampilan sesuatu dari gambar yang diberi teks, sementara lapisan temporal yang terpisah mempelajari gerakan dari video mentah yang tidak diberi label.
Bagaimana Make-A-Video menambahkan kemampuan gerakan pada model gambar?
Ini memperluas konvolusi dan perhatian spasial 2D dengan lapisan temporal baru yang mempelajari bagaimana konten berubah seiring waktu.
Apa yang dilakukan tahap interpolasi bingkai dan resolusi super?
Setelah draf kasar beresolusi rendah dan kecepatan bingkai rendah, interpolasi menambahkan bingkai dan modul resolusi super menaikkan resolusi.
Apa batasan umum keluaran Make-A-Video?
Klip hanya berdurasi beberapa detik, resolusi relatif rendah, dan rentan terhadap kedipan dan distorsi sementara.