คู่มือ AI แบบเห็นภาพ

สร้าง-A-Video ข้อความเป็นวิดีโอ

Make-A-Video คือระบบปี 2022 ของ Meta ที่เปลี่ยนข้อความแจ้งเป็นคลิปวิดีโอสั้นโดยไม่ต้องฝึกคู่ข้อความ-วิดีโอที่มีป้ายกำกับเลย

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

เจาะลึก

Make-A-Video ซึ่งประกาศโดย Meta AI ในเดือนกันยายน 2022 สร้างวิดีโอไม่กี่วินาทีจากประโยคเช่น "สุนัขสวมเสื้อคลุมซูเปอร์ฮีโร่ที่บินผ่านท้องฟ้า" เคล็ดลับสำคัญคือการแยกลักษณะที่ปรากฏออกจากการเคลื่อนไหว: โมเดลข้อความเป็นรูปภาพ (สร้างขึ้นบนพื้นที่ข้อความและรูปภาพร่วมสไตล์ CLIP) เรียนรู้ว่าสิ่งต่างๆ มีลักษณะอย่างไรจากภาพที่มีคำบรรยายนับพันล้านภาพ ในขณะที่เลเยอร์ Spatiotemporal ที่แยกจากกันเรียนรู้ว่าสิ่งต่างๆ เคลื่อนไหวอย่างไรจากวิดีโอที่ไม่มีป้ายกำกับเพียงอย่างเดียว ซึ่งจะช่วยหลีกเลี่ยงปัญหาการขาดแคลนคู่ข้อความและวิดีโอคุณภาพสูง โมเดลพื้นฐานจะสร้างคลิปที่มีความละเอียดต่ำ อัตราเฟรมต่ำ จากนั้นเครือข่ายเฉพาะจะสอดแทรกเฟรมพิเศษและเพิ่มความละเอียดเชิงพื้นที่ ผลลัพธ์มีความสอดคล้องกันอย่างน่าทึ่งสำหรับยุคนั้น แม้ว่าคลิปจะสั้น เบลอ และมีแนวโน้มที่จะสั่นไหวและบิดเบี้ยวก็ตาม

ข้อมูลเชิงลึกทางเทคนิค

Make-A-Video ขยายการสร้างภาพ 2D และความใส่ใจให้เป็น 3D โดยการเพิ่มเลเยอร์หลอกชั่วคราว ตุ้มน้ำหนักเชิงพื้นที่ที่ได้รับการฝึกไว้ล่วงหน้าจะถูกแช่แข็งหรือปรับแต่งอย่างละเอียด ในขณะที่เลเยอร์ชั่วคราวใหม่จะเรียนรู้การเคลื่อนไหวจากวิดีโอ Raw ดังนั้นจึงไม่จำเป็นต้องมีป้ายกำกับข้อความหรือวิดีโอ จากนั้นเครือข่ายการแก้ไขเฟรมจะหนาแน่นไทม์ไลน์และโมดูลการแพร่กระจายที่มีความละเอียดสูงจะเพิ่มรายละเอียดเชิงพื้นที่ เปลี่ยนร่างแบบหยาบ 16 เฟรม ความละเอียดต่ำให้เป็นคลิปที่นุ่มนวลและคมชัดยิ่งขึ้นในไปป์ไลน์แบบเรียงซ้อน

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแปลงข้อความเป็นวิดีโอ Make-A-Video

สูตรภาพเคลื่อนไหวก่อนบวกไม่มีป้ายกำกับของ Make-A-Video ทำให้เกิดคลื่นข้อความเป็นวิดีโอทั้งหมด รุ่นต่อๆ ไปเน้นที่คลิปที่ยาวขึ้น มีความละเอียดสูงกว่า และมีเสถียรภาพชั่วคราว พร้อมด้วยการเคลื่อนไหวและเสียงของกล้องที่ควบคุมได้ คาดหวังว่าแนวคิดหลักคือการนำความรู้เกี่ยวกับภาพขนาดใหญ่และการเรียนรู้การเคลื่อนไหวในราคาถูกกลับมาใช้ใหม่ จะยังคงมีอยู่แม้ในขณะที่สถาปัตยกรรมเปลี่ยนไปสู่การแพร่กระจายแฝงที่อิงหม้อแปลงและโมเดลแบบครบวงจรที่ยังยอมรับการปรับสภาพภาพหรือวิดีโอสำหรับการแก้ไขและดำเนินการต่อ

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างภาพเคลื่อนไหวประโยคอธิบายเพียงประโยคเดียวให้เป็นคลิปวนซ้ำสั้นๆ สำหรับโพสต์บนโซเชียลมีเดีย

นำแนวคิดแบบคงที่ เช่น 'ตุ๊กตาหมีวาดภาพบุคคล' มาสู่ชีวิตในรูปแบบภาพประกอบที่เคลื่อนไหวได้

การสอดแทรกระหว่างภาพนิ่งสองภาพที่ผู้ใช้ให้มาเพื่อสร้างวิดีโอการเปลี่ยนผ่านที่ราบรื่น

การสร้างภาพร่างของฉากที่จินตนาการไว้อย่างรวดเร็วสำหรับการทำสตอรี่บอร์ดก่อนการถ่ายทำใดๆ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

Sora และการแปลงข้อความเป็นวิดีโอ

คำถามที่พบบ่อย

What is Make-A-Video Text-to-Video?

Make-A-Video คือระบบปี 2022 ของ Meta ที่เปลี่ยนข้อความแจ้งเป็นคลิปวิดีโอสั้นโดยไม่ต้องฝึกคู่ข้อความ-วิดีโอที่มีป้ายกำกับเลย สิ่งสำคัญเพราะมันแสดงให้เห็นว่าความรู้ด้านภาพภายในโมเดลข้อความเป็นรูปภาพสามารถ 'สอน' เพื่อย้ายโดยใช้วิดีโอที่ไม่มีป้ายกำกับเท่านั้น

นวัตกรรมหลักที่ช่วยให้ Make-A-Video ไม่ต้องใช้คู่ข้อความ-วิดีโอที่มีป้ายกำกับคืออะไร

Make-A-Video แยกปัญหาออก: โมเดลข้อความเป็นรูปภาพจะเรียนรู้ว่าสิ่งต่างๆ มีลักษณะอย่างไรจากรูปภาพที่มีคำอธิบายภาพ ในขณะที่เลเยอร์ชั่วคราวที่แยกจากกันจะเรียนรู้การเคลื่อนไหวจากวิดีโอดิบที่ไม่มีป้ายกำกับ

Make-A-Video เพิ่มความสามารถในการเคลื่อนไหวให้กับโมเดลรูปภาพได้อย่างไร

ขยายขอบเขตความสนใจและมิติเชิงพื้นที่ 2 มิติด้วยเลเยอร์ชั่วคราวใหม่ที่เรียนรู้ว่าเนื้อหาเปลี่ยนแปลงไปอย่างไรเมื่อเวลาผ่านไป

ขั้นตอนการแก้ไขเฟรมและขั้นตอนความละเอียดสูงพิเศษทำหน้าที่อะไร

หลังจากแบบร่างที่มีความละเอียดต่ำและอัตราเฟรมต่ำแบบหยาบ การแก้ไขจะเพิ่มเฟรมและโมดูลความละเอียดสูงพิเศษจะเพิ่มความละเอียด

อะไรคือข้อจำกัดโดยทั่วไปของเอาต์พุตของ Make-A-Video

คลิปใช้เวลาเพียงไม่กี่วินาที มีความละเอียดค่อนข้างต่ำ และมีแนวโน้มที่จะเกิดการสั่นไหวและการบิดเบี้ยวชั่วคราว