PANDUAN AI Visual

Buat-A-Video Teks-ke-Video

Make-A-Video ialah sistem 2022 Meta yang menukar gesaan teks menjadi klip video pendek tanpa pernah melatih pasangan teks-video berlabel.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

Menyelam dalam

Make-A-Video, diumumkan oleh Meta AI pada September 2022, menghasilkan beberapa saat video daripada ayat seperti 'anjing memakai jubah wira-wira terbang di langit.' Helah utamanya ialah mengasingkan penampilan daripada gerakan: model teks-ke-imej (dibina pada ruang imej teks bersama gaya CLIP dan resapan) mempelajari rupa perkara daripada berbilion-bilion imej berkapsyen, manakala lapisan spatiotemporal yang berasingan mempelajari cara sesuatu bergerak daripada video tidak berlabel sahaja. Ini mengelakkan kekurangan pasangan teks-video berkualiti tinggi. Model asas menghasilkan klip resolusi rendah, kadar bingkai rendah, kemudian rangkaian khusus menginterpolasi bingkai tambahan dan resolusi spatial kelas atas. Hasilnya adalah sangat koheren untuk eranya, walaupun klip pendek, kabur dan terdedah kepada kelipan dan meledingkan.

Wawasan Teknikal

Make-A-Video memanjangkan lilitan penjanaan imej 2D dan perhatian ke dalam 3D dengan menambahkan lapisan pseudo-temporal. Pemberat ruang yang telah dilatih dibekukan atau diperhalusi sementara lapisan temporal baharu mempelajari gerakan daripada video mentah, jadi tiada label video teks diperlukan. Rangkaian interpolasi bingkai kemudiannya memadatkan garis masa dan modul resapan resolusi super meningkatkan perincian spatial, menukar draf kasar 16 bingkai, resolusi rendah menjadi klip yang lebih licin dan tajam dalam saluran paip bertingkat.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan Buat-Video Teks-ke-Video

Resipi gerakan imej-sebelum-tambah-tidak-berlabel Make-A-Video menyemai keseluruhan gelombang teks-ke-video. Keturunannya menekankan klip yang lebih panjang, resolusi lebih tinggi, stabil sementara dengan gerakan kamera dan audio yang boleh dikawal. Jangkakan idea teras, menggunakan semula pengetahuan imej besar-besaran dan gerakan pembelajaran dengan murah, untuk berterusan walaupun seni bina beralih ke arah resapan terpendam berasaskan pengubah dan model bersatu yang turut menerima penyesuaian imej atau video untuk penyuntingan dan penerusan.

Pelaksanaan Dunia Sebenar

Menghidupkan ayat deskriptif tunggal menjadi klip gelung pendek untuk siaran media sosial

Menghidupkan konsep statik seperti 'teddy bear melukis potret' sebagai ilustrasi yang bergerak

Menginterpolasi antara dua imej pegun yang dibekalkan pengguna untuk mencipta video peralihan yang lancar

Menjana draf gerakan pantas adegan yang dibayangkan untuk papan cerita sebelum sebarang penggambaran

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Sora dan Teks-ke-Video

Soalan lazim

What is Make-A-Video Text-to-Video?

Make-A-Video ialah sistem 2022 Meta yang menukar gesaan teks menjadi klip video pendek tanpa pernah melatih pasangan teks-video berlabel. Ia penting kerana ia menunjukkan bahawa pengetahuan visual dalam model teks-ke-imej boleh 'diajar' untuk bergerak menggunakan video yang tidak berlabel sahaja.

Apakah inovasi utama yang membolehkan Make-A-Video mengelak daripada memerlukan pasangan teks-video berlabel?

Make-A-Video menyelesaikan masalah: model teks ke imej mempelajari rupa perkara daripada imej berkapsyen, manakala lapisan temporal yang berasingan mempelajari gerakan daripada video mentah yang tidak berlabel.

Bagaimanakah Make-A-Video menambah keupayaan gerakan pada model imej?

Ia memanjangkan lilitan spatial 2D dan perhatian dengan lapisan temporal baharu yang mempelajari cara kandungan berubah dari semasa ke semasa.

Apakah yang dilakukan oleh peringkat interpolasi bingkai dan resolusi super?

Selepas draf resolusi rendah kasar, kadar bingkai rendah, interpolasi menambah bingkai dan modul resolusi super meningkatkan peleraian.

Apakah had biasa output Make-A-Video?

Klip hanya beberapa saat, resolusi yang agak rendah, dan terdedah kepada kelipan sementara dan herotan.