HƯỚNG DẪN AI trực quan

CogVideo và CogVideoX

CogVideo (2022) là mô hình chuyển văn bản thành video mở quy mô lớn đầu tiên và CogVideoX (2024) là mô hình nguồn mở kế thừa có khả năng hơn nhiều từ Tsinghua/Zhipu AI.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.

Lặn sâu

CogVideo, phát hành vào năm 2022, được xây dựng trên biến thể chuyển văn bản thành hình ảnh CogView2 và sử dụng phương pháp tự hồi quy, nhiều tốc độ khung hình để tạo các đoạn clip ngắn, trở thành mô hình chuyển văn bản thành video lớn được phát hành công khai đầu tiên và hỗ trợ lời nhắc bằng tiếng Trung và tiếng Anh. Người kế nhiệm năm 2024 của nó, CogVideoX, là một thiết kế lại hoàn toàn: nó sử dụng bộ mã hóa tự động biến đổi nhân quả 3D để nén video trong cả không gian và thời gian, sau đó là Expert Transformer với mục tiêu khuếch tán cùng tham gia vào các mã thông báo văn bản và video được hợp nhất với nhau. Các mô hình CogVideoX (ở các kích thước như thông số 2B và 5B) tạo ra một vài giây video chuyển động cao, mạch lạc ở độ phân giải như 720x480 và hỗ trợ liên tục chuyển đổi hình ảnh sang video và video. Điều quan trọng là trọng số và mã được công khai, thúc đẩy làn sóng tinh chỉnh, công cụ và nghiên cứu trong cộng đồng.

Hiểu biết kỹ thuật

VAE nhân quả 3D của CogVideoX thu nhỏ video thô thành âm lượng tiềm ẩn nhỏ gọn, giảm số lượng mã thông báo để máy biến áp có thể tạo mô hình các chuỗi dài với chi phí hợp lý. Expert Transformer áp dụng chuẩn mực lớp thích ứng và ghép nối văn bản và mã thông báo hình ảnh để hai phương thức kết hợp trực tiếp với nhau, cải thiện sự liên kết giữa văn bản và video. Quá trình đào tạo tiến bộ về cách tăng độ phân giải và thời lượng, cộng với việc chú thích dữ liệu cẩn thận, mang lại chuyển động mượt mà hơn, trung thực hơn về mặt ngữ nghĩa.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của CogVideo và CogVideoX

Là một trong những mô hình video mở mạnh nhất, CogVideoX nắm giữ một hệ sinh thái đang phát triển nhanh chóng gồm các tinh chỉnh, bộ điều khiển và tiện ích mở rộng có thời lượng dài hơn. Mong đợi sự gia tăng liên tục về độ dài clip, độ phân giải, độ chân thực của chuyển động và khả năng kiểm soát, cùng với sự tích hợp chặt chẽ hơn với quy trình chỉnh sửa và chuyển hình ảnh sang video. Trọng lượng mở của nó có nghĩa là các tổ chức phi lợi nhuận, nhà nghiên cứu và studio nhỏ có thể xây dựng thế hệ video đẳng cấp hàng đầu mà không cần có sự giám sát độc quyền, thúc đẩy cả thử nghiệm tập trung vào tính sáng tạo và an toàn.

Triển khai trong thế giới thực

Tạo một đoạn tường thuật ngắn từ lời nhắc tiếng Trung hoặc tiếng Anh bằng cách sử dụng các trọng số mở hoàn toàn

Biến một hình ảnh tĩnh được tải lên thành video chuyển động thông qua tính năng chuyển hình ảnh thành video CogVideoX

Tinh chỉnh mô hình mở theo kiểu hoặc ký tự tùy chỉnh cho hoạt hình độc lập

Các nhà nghiên cứu đánh giá các phương pháp tạo video mới dựa trên đường cơ sở mở có thể tái tạo

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Chỉnh sửa hướng dẫn InstructPix2Pix

Câu hỏi thường gặp

What is CogVideo and CogVideoX?

CogVideo (2022) là mô hình chuyển văn bản thành video mở quy mô lớn đầu tiên và CogVideoX (2024) là mô hình nguồn mở kế thừa có khả năng hơn nhiều từ Tsinghua/Zhipu AI. Chúng quan trọng vì chúng đưa việc tạo video chất lượng cao đến tay cộng đồng mở chứ không chỉ các phòng thí nghiệm của công ty lớn.

Điều gì đáng chú ý về bản phát hành năm 2022 của CogVideo?

CogVideo là mô hình chuyển văn bản thành video quy mô lớn đầu tiên được phát hành công khai, hỗ trợ cả lời nhắc tiếng Trung và tiếng Anh.

VAE nhân quả 3D của CogVideoX thực hiện được những gì?

VAE nhân quả 3D nén video theo cả chiều không gian và thời gian, giảm số lượng mã thông báo để máy biến áp có thể mô hình hóa video một cách hiệu quả.

Expert Transformer trong CogVideoX xử lý văn bản và video như thế nào?

Expert Transformer kết hợp các mã thông báo văn bản và hình ảnh cùng với tính năng chuẩn hóa thích ứng, cải thiện sự liên kết giữa video nhắc và video được tạo.

Nhóm nào đã phát triển CogVideo và CogVideoX?

Nhóm CogVideo đến từ các nhà nghiên cứu liên kết với Đại học Thanh Hoa và Zhipu AI.

Ngoài tính năng chuyển văn bản thành video, CogVideoX còn hỗ trợ khả năng bổ sung nào?

CogVideoX có thể tạo hoạt ảnh cho hình ảnh tĩnh (từ hình ảnh sang video) và mở rộng các clip hiện có (tiếp theo), ngoài những lời nhắc bằng văn bản đơn giản.