CogVideo และ CogVideoX
CogVideo (2022) เป็นโมเดลข้อความเป็นวิดีโอแบบเปิดขนาดใหญ่รุ่นแรก และ CogVideoX (2024) เป็นผู้สืบทอดโอเพ่นซอร์สที่มีความสามารถมากกว่ามากจาก Tsinghua/Zhipu AI
ภาพรวม
พวกเขามีความสําคัญเพราะพวกเขานําการสร้างวิดีโอคุณภาพสูงเข้าสู่มือของชุมชนเปิด ไม่ใช่แค่ห้องแล็บของบริษัทใหญ่
เจาะลึก
CogVideo เปิดตัวในปี 2022 สร้างขึ้นบนตัวแปลงข้อความเป็นรูปภาพ CogView2 และใช้วิธีการแบบถดถอยอัตโนมัติที่มีอัตราหลายเฟรมเพื่อสร้างคลิปสั้น กลายเป็นโมเดลข้อความเป็นวิดีโอขนาดใหญ่รุ่นแรกที่เปิดตัวอย่างเปิดเผย และรองรับข้อความแจ้งภาษาจีนและอังกฤษ CogVideoX ผู้สืบทอดตำแหน่งในปี 2024 คือการออกแบบใหม่ทั้งหมด โดยใช้โปรแกรมเปลี่ยนไฟล์อัตโนมัติแบบสาเหตุ 3 มิติเพื่อบีบอัดวิดีโอทั้งในพื้นที่และเวลา จากนั้นจึงใช้ Expert Transformer ที่มีวัตถุประสงค์ในการแพร่กระจายซึ่งร่วมกันดูแลผ่านโทเค็นข้อความและวิดีโอที่หลอมรวมเข้าด้วยกัน โมเดล CogVideoX (ในขนาดเช่นพารามิเตอร์ 2B และ 5B) สร้างวิดีโอที่มีการเคลื่อนไหวสูงต่อเนื่องกันเป็นเวลาหลายวินาทีที่ความละเอียด เช่น 720x480 และรองรับความต่อเนื่องของภาพต่อวิดีโอและวิดีโอ สิ่งสำคัญที่สุดคือ น้ำหนักและรหัสเป็นแบบสาธารณะ ซึ่งกระตุ้นให้เกิดคลื่นการปรับแต่ง เครื่องมือ และการวิจัยของชุมชน
ข้อมูลเชิงลึกทางเทคนิค
VAE เชิงสาเหตุ 3 มิติของ CogVideoX ย่อขนาดวิดีโอ Raw ให้เป็นวอลลุ่มแฝงที่มีขนาดกะทัดรัด ช่วยลดจำนวนโทเค็นลง เพื่อให้หม้อแปลงสามารถสร้างแบบจำลองลำดับที่ยาวได้ในราคาประหยัด Expert Transformer ใช้บรรทัดฐานของเลเยอร์ที่ปรับเปลี่ยนได้และเชื่อมโทเค็นข้อความและภาพเข้าด้วยกัน เพื่อให้ทั้งสองรูปแบบเชื่อมโยงกันโดยตรง ปรับปรุงการจัดตำแหน่งข้อความและวิดีโอ การฝึกอบรมแบบก้าวหน้าเกี่ยวกับการเพิ่มความละเอียดและระยะเวลา บวกกับคำบรรยายข้อมูลที่ระมัดระวัง จะทำให้ได้การเคลื่อนไหวที่ราบรื่นและมีความหมายมากขึ้น
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของ CogVideo และ CogVideoX
ในฐานะหนึ่งในโมเดลวิดีโอแบบเปิดที่แข็งแกร่งที่สุด CogVideoX ยึดระบบนิเวศที่เติบโตอย่างรวดเร็วของการปรับแต่ง อะแดปเตอร์ควบคุม และส่วนขยายที่มีระยะเวลานานขึ้น คาดหวังความยาวคลิป ความละเอียด ความสมจริงของภาพเคลื่อนไหว และความสามารถในการควบคุมที่เพิ่มขึ้นอย่างต่อเนื่อง บวกกับการบูรณาการที่แน่นแฟ้นยิ่งขึ้นกับขั้นตอนการทำงานระหว่างรูปภาพเป็นวิดีโอและการแก้ไข น้ำหนักแบบเปิดหมายความว่าองค์กรไม่แสวงผลกำไร นักวิจัย และสตูดิโอขนาดเล็กสามารถสร้างวิดีโอระดับแนวหน้าได้โดยไม่ต้องเฝ้าประตูที่เป็นกรรมสิทธิ์ ช่วยเร่งการทดลองที่สร้างสรรค์และเน้นความปลอดภัย
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างคลิปบรรยายสั้นๆ จากพรอมต์ภาษาจีนหรืออังกฤษโดยใช้น้ำหนักแบบเปิดเต็มที่
เปลี่ยนภาพนิ่งที่อัปโหลดเพียงภาพเดียวให้เป็นวิดีโอเคลื่อนไหวผ่าน CogVideoX จากภาพเป็นวิดีโอ
ปรับแต่งโมเดลเปิดอย่างละเอียดตามสไตล์หรือตัวละครที่กำหนดเองสำหรับแอนิเมชันอินดี้
นักวิจัยเปรียบเทียบวิธีการสร้างวิดีโอใหม่กับพื้นฐานแบบเปิดที่สามารถทำซ้ำได้
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CogVideo and CogVideoX quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
InstructPix2Pix การแก้ไขคำสั่ง
คำถามที่พบบ่อย
CogVideo และ CogVideoX คืออะไร?
CogVideo (2022) เป็นโมเดลข้อความเป็นวิดีโอแบบเปิดขนาดใหญ่รุ่นแรก และ CogVideoX (2024) เป็นผู้สืบทอดโอเพ่นซอร์สที่มีความสามารถมากกว่ามากจาก Tsinghua/Zhipu AI สิ่งเหล่านี้มีความสำคัญเพราะพวกเขามอบการสร้างวิดีโอคุณภาพสูงให้กับชุมชนเปิด ไม่ใช่แค่ห้องปฏิบัติการขององค์กรขนาดใหญ่เท่านั้น
สิ่งที่โดดเด่นเกี่ยวกับการเปิดตัวของ CogVideo ในปี 2022 คืออะไร
CogVideo เป็นโมเดลข้อความเป็นวิดีโอขนาดใหญ่รุ่นแรกที่เปิดตัวอย่างเปิดเผย โดยรองรับทั้งข้อความแจ้งภาษาจีนและภาษาอังกฤษ
VAE เชิงสาเหตุ 3 มิติของ CogVideoX ทำอะไรได้บ้าง
VAE เชิงสาเหตุ 3 มิติบีบอัดวิดีโอทั้งมิติเชิงพื้นที่และเชิงเวลา ช่วยลดจำนวนโทเค็น เพื่อให้หม้อแปลงสามารถสร้างแบบจำลองได้อย่างมีประสิทธิภาพ
Expert Transformer ใน CogVideoX จัดการข้อความและวิดีโออย่างไร
Expert Transformer หลอมรวมข้อความและโทเค็นภาพเข้ากับการปรับมาตรฐาน ปรับปรุงการจัดตำแหน่งระหว่างวิดีโอพร้อมท์และวิดีโอที่สร้างขึ้น
กลุ่มใดที่พัฒนา CogVideo และ CogVideoX
กลุ่มผลิตภัณฑ์ CogVideo มาจากนักวิจัยที่เกี่ยวข้องกับมหาวิทยาลัย Tsinghua และ Zhipu AI
นอกจากการแปลงข้อความเป็นวิดีโอแล้ว CogVideoX ยังรองรับความสามารถเพิ่มเติมอะไรบ้าง
CogVideoX สามารถสร้างภาพเคลื่อนไหว (ภาพเป็นวิดีโอ) และขยายคลิปที่มีอยู่ (ต่อเนื่อง) นอกเหนือจากข้อความธรรมดา