คู่มือ AI แบบเห็นภาพ

การสร้างภาพเคลื่อนไหว AnimateDiff

AnimateDiff เป็นเทคนิคที่เพิ่มการเคลื่อนไหวให้กับโมเดลการแพร่กระจายข้อความเป็นรูปภาพที่มีอยู่ เช่น Stable Diffusion โดยเปลี่ยนตัวสร้างภาพนิ่งให้เป็นตัวสร้างวิดีโอสั้น ๆ โดยไม่ต้องฝึกโมเดลทั้งหมดใหม่

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it lets the huge ecosystem of image models and custom styles produce animation cheaply.

เจาะลึก

AnimateDiff ทำงานโดยการฝึก 'โมดูลการเคลื่อนไหว' แยกต่างหากบนคลิปวิดีโอ จากนั้นเสียบโมดูลนั้นเข้ากับโมเดลการแพร่กระจายภาพที่แช่แข็งและผ่านการฝึกอบรมแล้ว เช่น Stable Diffusion โมเดลรูปภาพยังคงจัดการกับรูปลักษณ์ สไตล์ และเนื้อหา ในขณะที่โมดูลการเคลื่อนไหวจะเรียนรู้ว่าพิกเซลควรเคลื่อนไหวและคงความสม่ำเสมอในเฟรมอย่างไร สิ่งสำคัญอย่างยิ่ง เนื่องจากโมเดลพื้นฐานยังคงนิ่งอยู่ โมดูลการเคลื่อนไหวเดียวกันจึงสามารถปล่อยลงบนการปรับแต่งชุมชนและ LoRA นับพันได้ ดังนั้นอะนิเมะที่กำหนดเองของผู้ใช้ รูปภาพ หรือจุดตรวจวาดภาพจึงเคลื่อนไหวในทันที โดยทั่วไปผลลัพธ์จะเป็นคลิปสั้นประมาณ 16 เฟรม เวอร์ชันต่อมาได้เพิ่ม LoRA การเคลื่อนไหวเพื่อควบคุมการเคลื่อนไหวของกล้อง (แพน ซูม ม้วน) และ SparseCtrl สำหรับการปรับสภาพบนกรอบนำบางส่วน

ข้อมูลเชิงลึกทางเทคนิค

โมดูลการเคลื่อนไหวถูกแทรกเป็นชั้นความสนใจชั่วคราวระหว่างชั้นเชิงพื้นที่ที่มีอยู่ของ U-Net ในระหว่างการลดสัญญาณรบกวน แต่ละเฟรมสามารถเข้าร่วมกับเฟรมอื่นๆ ตามแกนเวลา ดังนั้นใบหน้าหรือวัตถุที่สร้างขึ้นในเฟรม 1 จะยังคงสอดคล้องกันในเฟรม 8 เฉพาะเลเยอร์ชั่วคราวเหล่านี้เท่านั้นที่ได้รับการฝึกในวิดีโอ น้ำหนักเชิงพื้นที่ยังคงเดิม ซึ่งเป็นเหตุผลว่าทำไมโมเดลภาพที่ปรับแต่งแบบละเอียดตามอำเภอใจจึงยังคงใช้งานร่วมกันได้

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการสร้างภาพเคลื่อนไหว AnimateDiff

AnimateDiff เชื่อมช่องว่างก่อนที่จะมีโมเดลวิดีโอเฉพาะ และปรัชญาปลั๊กอินของมันยังคงมีอิทธิพลต่อภาคสนาม คาดหวังว่าโมดูลการเคลื่อนไหวจะรองรับคลิปที่ยาวขึ้น ความละเอียดที่สูงขึ้น และการควบคุมกล้องและวิถีที่แม่นยำยิ่งขึ้น รวมถึงการผสานรวมกับการนำทางสไตล์ ControlNet เมื่อการกระจายวิดีโอแบบเนทีฟขนาดใหญ่และโมเดลวิดีโอหม้อแปลงเติบโตเต็มที่ อะแดปเตอร์แบบ AnimateDiff ก็มีแนวโน้มที่จะยังคงมีคุณค่าสำหรับการสร้างแอนิเมชันคลังภาพขนาดใหญ่ที่มีจุดตรวจสอบเฉพาะทางและมีสไตล์ซึ่งโมเดลวิดีโอขนาดใหญ่ไม่ได้ทำซ้ำในราคาประหยัด

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างแอนิเมชันจุดตรวจสอบ Stable Diffusion สไตล์อนิเมะแบบกำหนดเองให้เป็นคลิปตัวละครแบบวนซ้ำสั้นๆ

การเพิ่มการซูมหรือการแพนกล้องแบบช้าๆ ให้กับทิวทัศน์ที่สร้างขึ้นโดยใช้ LoRA แบบเคลื่อนไหว

การสร้างสติกเกอร์เคลื่อนไหวสั้นๆ หรือลูปโซเชียลมีเดียจากข้อความแจ้งเดียว

การใช้ SparseCtrl กับคีย์เฟรมสองสามรายการเพื่อเป็นแนวทางในการเปลี่ยนระหว่างสองฉาก

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AnimateDiff Motion Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างวิดีโอ Lumiere Space-Time

คำถามที่พบบ่อย

What is AnimateDiff Motion Generation?

AnimateDiff เป็นเทคนิคที่เพิ่มการเคลื่อนไหวให้กับโมเดลการแพร่กระจายข้อความเป็นรูปภาพที่มีอยู่ เช่น Stable Diffusion โดยเปลี่ยนตัวสร้างภาพนิ่งให้เป็นตัวสร้างวิดีโอสั้น ๆ โดยไม่ต้องฝึกโมเดลทั้งหมดใหม่ เป็นเรื่องสำคัญเพราะมันช่วยให้ระบบนิเวศขนาดใหญ่ของโมเดลรูปภาพและสไตล์ที่กำหนดเองสร้างแอนิเมชั่นได้ในราคาถูก

แนวคิดหลักเบื้องหลัง AnimateDiff คืออะไร

AnimateDiff แทรกโมดูลการเคลื่อนไหวที่ได้รับการฝึกแยกต่างหากลงในโมเดลข้อความเป็นรูปภาพที่แช่แข็งที่มีอยู่ เพื่อให้สามารถสร้างการเคลื่อนไหวโดยไม่ต้องฝึกโมเดลพื้นฐานใหม่

เหตุใด AnimateDiff จึงสามารถทำงานร่วมกับโมเดลรูปภาพที่สร้างโดยชุมชนจำนวนมากได้

เนื่องจากน้ำหนักของรูปลักษณ์ (เชิงพื้นที่) ไม่ได้ถูกแตะต้อง โมดูลการเคลื่อนไหวจึงสามารถปล่อยลงบนการปรับแต่งและ LoRA นับพันได้

โมดูลการเคลื่อนไหวรักษาเฟรมให้สอดคล้องกันอย่างไร

ชั้นความสนใจชั่วคราวที่เพิ่มเข้าไปใน U-Net ช่วยให้แต่ละเฟรมสนใจกับเฟรมอื่นตามแกนเวลา โดยรักษาความเชื่อมโยงกัน

ตระกูลโมเดลใดที่ AnimateDiff เกี่ยวข้องกับการขยายมากที่สุด

AnimateDiff ถูกสร้างขึ้นเพื่อเพิ่มการเคลื่อนไหวให้กับโมเดลการแพร่กระจายข้อความเป็นรูปภาพสไตล์ Stable Diffusion

โดยทั่วไปแล้ว LoRA การเคลื่อนไหวในระบบนิเวศ AnimateDiff ควบคุมอะไร

Motion LoRA ได้รับการแนะนำเพื่อควบคุมการเคลื่อนไหวของกล้อง เช่น การแพน การซูม และการหมุน