Mô hình khuếch tán video
Các mô hình khuếch tán video tạo ra các hình ảnh chuyển động bằng cách dần dần biến nhiễu ngẫu nhiên thành các khung hình mạch lạc, mở rộng ý tưởng khuếch tán từ hình ảnh sang thời gian.
Tổng quan
Chúng là động cơ đứng sau video AI chân thực nhất hiện nay.
Lặn sâu
Các mô hình khuếch tán học cách đảo ngược quá trình gây nhiễu: trong quá trình huấn luyện, dữ liệu sạch sẽ dần dần thêm nhiễu và mạng học cách dự đoán cũng như loại bỏ nhiễu đó theo từng bước. Khuếch tán video áp dụng điều này cho các chuỗi khung hình, với sự bổ sung quan trọng của mô hình hóa thời gian để chuyển động luôn mượt mà và các vật thể vẫn nhất quán theo thời gian. Để giữ cho tính toán dễ thực hiện, hầu hết các hệ thống đều là mô hình khuếch tán tiềm ẩn, hoạt động trong không gian tiềm ẩn được nén thay vì trên các pixel thô. Các kiến trúc bao gồm từ U-Net 3D chú ý đến không gian và thời gian cho đến các máy biến áp khuếch tán (DiT) xử lý video dưới dạng mã thông báo không-thời gian. Dòng này hỗ trợ Sora, Khuếch tán video ổn định, Runway Gen-3, Google Veo và Pika, đồng thời hỗ trợ chỉnh sửa chuyển văn bản thành video, hình ảnh thành video và video.
Hiểu biết kỹ thuật
Bí quyết quan trọng là thêm các lớp thời gian, chẳng hạn như chú ý theo thời gian hoặc tích chập 3D, để các khung hình được khử nhiễu cùng nhau thay vì độc lập, giúp ngăn chặn hiện tượng nhấp nháy và chuyển động không mạch lạc. Generation sử dụng hướng dẫn không có trình phân loại để tuân theo lời nhắc văn bản một cách mạnh mẽ và bộ mã hóa/giải mã VAE đã học sẽ di chuyển giữa các pixel và không gian tiềm ẩn. Việc lấy mẫu nhiều bước khử nhiễu diễn ra chậm, do đó, phương pháp chưng cất và bộ giải nhanh hơn được sử dụng để cắt giảm số bước cần thiết.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của các mô hình khuếch tán video
Nghiên cứu đang chạy đua hướng tới việc tạo ra thời gian thực dài hơn, độ phân giải cao hơn với âm thanh được đồng bộ hóa và độ chân thực vật lý tốt hơn nhiều. Máy biến áp khuếch tán có khả năng mở rộng quy mô một cách rõ ràng với dữ liệu và điện toán đang trở thành thiết kế chủ đạo và các mô hình chắt lọc vài bước đang giúp quá trình tạo dữ liệu nhanh hơn đáng kể. Mong đợi khả năng kiểm soát chặt chẽ hơn đối với máy ảnh, ký tự và chỉnh sửa, cùng với các phương pháp tiếp cận kết hợp kết hợp sự khuếch tán với các phương pháp tổng hợp khác. Khi chất lượng tăng lên, các tiêu chuẩn về hình mờ và xuất xứ nội dung mạnh mẽ sẽ rất cần thiết để quản lý việc sử dụng sai mục đích.
Triển khai trong thế giới thực
Hỗ trợ các công cụ chuyển văn bản thành video như Stable Video Diffusion, Runway Gen-3 và Pika cho người sáng tạo
Hoạt ảnh chuyển từ hình ảnh sang video giúp một bức ảnh trở nên sống động với chuyển động chân thực
Chỉnh sửa video, vẽ và chuyển phong cách được hỗ trợ bởi AI trong quy trình hậu sản xuất chuyên nghiệp
Tạo cảnh đào tạo tổng hợp và mô phỏng cho nghiên cứu về robot và xe tự hành
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Video Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình khuếch tán GLIDE
Câu hỏi thường gặp
Mô hình khuếch tán video là gì?
Các mô hình khuếch tán video tạo ra các hình ảnh chuyển động bằng cách dần dần biến nhiễu ngẫu nhiên thành các khung hình mạch lạc, mở rộng ý tưởng khuếch tán từ hình ảnh sang thời gian. Chúng là động cơ đằng sau video AI chân thực nhất hiện nay.
Ý tưởng cơ bản đằng sau mô hình khuếch tán là gì?
Các mô hình khuếch tán được huấn luyện để loại bỏ nhiễu được thêm dần vào dữ liệu, sau đó tạo ra bằng cách khử nhiễu từ nhiễu thuần túy.
Mô hình khuếch tán video bổ sung gì so với mô hình khuếch tán hình ảnh?
Ngoài việc tạo ra từng khung hình, việc khuếch tán video phải phối hợp các khung hình theo thời gian, yêu cầu các lớp thời gian giữ cho chuyển động được mạch lạc.
Tại sao hầu hết các mô hình khuếch tán video đều hoạt động trong không gian “tiềm ẩn”?
Video thô rất lớn; mã hóa nó vào một không gian tiềm ẩn nhỏ hơn thông qua VAE giúp việc khử nhiễu hiệu quả hơn nhiều.
Vai trò của sự chú ý theo thời gian hoặc sự tích chập 3D trong các mô hình này là gì?
Các lớp tạm thời kết nối thông tin giữa các khung hình, ngăn chặn hiện tượng nhấp nháy và tạo ra chuyển động mạch lạc thay vì các khung hình độc lập, chập chờn.
Kỹ thuật nào giúp mô hình phổ biến video tuân theo lời nhắc văn bản một cách mạnh mẽ?
Hướng dẫn không cần phân loại sẽ thúc đẩy quá trình khử nhiễu mạnh mẽ hơn theo hướng nhắc điều hòa, cải thiện việc tuân thủ nhanh chóng.