Hình ảnh sáng tạo được đeo mặt nạ của Muse
Muse là mô hình chuyển văn bản thành hình ảnh của Google tạo ra hình ảnh bằng cách điền tất cả các mã thông báo hình ảnh bị che cùng một lúc, khiến quá trình này nhanh hơn nhiều so với việc truyền bá từng bước.
Tổng quan
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
Lặn sâu
Muse hoạt động trong không gian mã thông báo riêng biệt của hình ảnh. VQGAN được huấn luyện trước sẽ biến một hình ảnh thành một mạng lưới các mã thông báo số nguyên, giống như từ vựng của các khối xây dựng trực quan. Trong quá trình đào tạo, một phần lớn các mã thông báo này bị che giấu và Máy biến áp học cách dự đoán chúng trở lại, dựa trên việc nhúng văn bản từ mô hình ngôn ngữ lớn cố định (T5-XXL). Tại thời điểm tạo, Muse bắt đầu từ một lưới được che toàn bộ và giải mã theo các vòng song song, dự đoán nhiều mã thông báo trên mỗi bước và che lại những mã thông báo kém tin cậy nhất. Thiết kế hai giai đoạn trước tiên tạo ra lưới mã thông báo có độ phân giải thấp, sau đó mô hình siêu phân giải sẽ lấp đầy lưới có độ phân giải cao hơn. Bởi vì hàng chục mã thông báo được phân giải đồng thời nên các mô hình tham số 900M và 3B tạo ra hình ảnh 256 hoặc 512 pixel chỉ trong một số lần chuyển tiếp.
Hiểu biết kỹ thuật
Bí quyết cốt lõi là giải mã song song với tính năng tạo mặt nạ dựa trên độ tin cậy, thường được gọi là lấy mẫu kiểu MaskGIT. Thay vì dự đoán từng mã thông báo một (tự hồi quy) hoặc khử nhiễu hàng trăm lần (khuếch tán), Muse dự đoán tất cả các mã thông báo bị che giấu, giữ lại những mã thông báo đáng tin cậy nhất và che lại phần còn lại cho vòng tiếp theo. Việc sử dụng bộ mã hóa văn bản T5-XXL cố định mang lại khả năng hiểu ngôn ngữ mạnh mẽ miễn phí và hoạt động trên các mã thông báo riêng biệt cho phép mô hình suy luận về hình ảnh giống từ ngữ hơn.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của hình ảnh sáng tạo đeo mặt nạ Muse
Các điểm giải mã song song được che giấu hướng tới các trình tạo vừa có chất lượng cao vừa thực sự nhanh, điều này rất cần thiết cho việc chỉnh sửa tương tác và sử dụng trên thiết bị. Mong đợi ý tưởng dự đoán mã thông báo sẽ hợp nhất với các phương pháp video khuếch tán và tự hồi quy, đồng thời hỗ trợ khả năng chỉnh sửa trong, ngoài và không có mặt nạ ngay lập tức. Khi các mã thông báo rời rạc được cải thiện, hình ảnh được che dấu có thể mở rộng sang video và 3D, trong đó việc giải mã song song có thể cắt giảm đáng kể chi phí tạo ra nhiều khung hình hoặc chế độ xem.
Triển khai trong thế giới thực
Nghệ thuật khái niệm nhanh và bảng tâm trạng trong đó nghệ sĩ cần nhiều biến thể hình ảnh trong vài giây thay vì vài phút.
Vẽ tranh không bắn, chẳng hạn như loại bỏ một vật thể và để mô hình lấp đầy vùng bị che một cách nhất quán với môi trường xung quanh.
Outpainting để mở rộng ảnh ra ngoài đường viền ban đầu của nó cho các biểu ngữ hoặc các tỷ lệ khung hình khác nhau.
Chỉnh sửa không cần mặt nạ, chẳng hạn như thay đổi màu của con chó hoặc bầu trời thành hoàng hôn bằng cách chỉnh sửa lời nhắc văn bản và giải mã lại các mã thông báo bị ảnh hưởng.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Bộ mã hóa tự động đeo mặt nạ
Câu hỏi thường gặp
What is Muse Masked Generative Imaging?
Muse là mô hình chuyển văn bản thành hình ảnh của Google tạo ra hình ảnh bằng cách điền tất cả các mã thông báo hình ảnh bị che cùng một lúc, khiến quá trình này nhanh hơn nhiều so với việc truyền bá từng bước. Điều này quan trọng vì nó cho thấy bạn có thể có được hình ảnh chất lượng cao, được căn chỉnh tốt mà không cần khử nhiễu lặp lại chậm mà hầu hết các trình tạo đều dựa vào.
Muse dự đoán điều gì trong quá trình tạo thay vì khử nhiễu các pixel?
Muse hoạt động trong không gian mã thông báo riêng biệt, dự đoán mã thông báo hình ảnh bị che được tạo bởi mã thông báo VQGAN thay vì hoạt động trực tiếp trên pixel.
Tại sao Muse thường nhanh hơn các mẫu khuếch tán tiêu chuẩn?
Muse điền đồng thời nhiều mã thông báo được che dấu và chỉ cần một số vòng giải mã, không giống như nhiều bước khử nhiễu tuần tự của khuếch tán.
Muse hiểu được lời nhắc văn bản ở đâu?
Muse tạo điều kiện cho việc nhúng văn bản từ mô hình ngôn ngữ T5-XXL đã được huấn luyện trước cố định, mang lại cho nó khả năng hiểu ngôn ngữ mạnh mẽ.
Vai trò của việc tạo lại mặt nạ dựa trên sự tự tin trong Muse là gì?
Sau mỗi dự đoán song song, Muse giữ lại các mã thông báo có độ tin cậy cao nhất và che giấu những mã thông báo kém tin cậy nhất để tinh chỉnh qua các vòng tiếp theo.
Muse xử lý việc tạo ra hình ảnh có độ phân giải cao hơn như thế nào?
Trước tiên, Muse tạo lưới mã thông báo có độ phân giải thấp, sau đó mô hình siêu phân giải thứ hai tạo ra lưới mã thông báo có độ phân giải cao hơn.