HƯỚNG DẪN AI trực quan

Giải mã mã thông báo song song MaskGIT

MaskGIT tạo ra hình ảnh bằng cách dự đoán nhiều mã thông báo cùng một lúc và điền vào những mã thông báo đáng tin cậy nhất trước tiên, thay thế việc tạo từ trái sang phải chậm chạp bằng một số bước song song nhanh.

Đọc trong 2 phútCập nhật lần cuối

Lặn sâu

MaskGIT (Masked Generative Image Transformer), từ Google vào năm 2022, xem xét lại cách giải mã các mô hình hình ảnh dựa trên mã thông báo. Các máy biến áp trước đó như VQGAN đã tạo ra các mã thông báo tự động hồi quy, lần lượt từng mã thông báo theo thứ tự raster, tốc độ này rất chậm và không tự nhiên đối với hình ảnh 2D. Thay vào đó, MaskGIT đào tạo với mục tiêu lập mô hình được che giấu như BERT: các tập hợp con ngẫu nhiên của mã thông báo hình ảnh bị ẩn và mô hình học cách dự đoán tất cả chúng đồng thời bằng cách sử dụng sự chú ý hai chiều. Tại thời điểm tạo, nó bắt đầu từ một lưới được che kín hoàn toàn và giải mã theo số lần lặp cố định (thường là 8 đến 12). Mỗi bước, nó dự đoán mọi mã thông báo bị che, giữ các dự đoán có độ tin cậy cao nhất và che lại phần còn lại cho vòng tiếp theo. Điều này tạo ra hình ảnh chất lượng cao với ít bước hơn so với giải mã tự hồi quy.

Hiểu biết kỹ thuật

Thành phần quan trọng là lịch trình che giấu dựa trên sự tự tin. Lịch trình cosine quyết định số lượng mã thông báo sẽ hiển thị trong mỗi lần lặp, bắt đầu chậm và tăng tốc. Bởi vì sự chú ý là hai chiều, mọi mã thông báo đều nhìn thấy toàn bộ hình ảnh một phần, do đó, việc đưa ra những dự đoán chắc chắn nhất trước tiên sẽ cho phép các bước sau đó có điều kiện dựa trên bối cảnh chắc chắn, giống như giải các phần dễ của một câu đố trước những phần mơ hồ.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của việc giải mã mã thông báo song song MaskGIT

Giải mã lặp song song của MaskGIT đã truyền cảm hứng cho một làn sóng các trình tạo không tự hồi quy, bao gồm MUSE cho các phương pháp chuyển văn bản thành hình ảnh và che mặt cho video. Mẫu dự đoán song song các mã thông báo và tinh chỉnh qua một vài bước, nằm giữa GAN một lần và khuếch tán nhiều bước, mang lại sự cân bằng về chất lượng và tốc độ có thể điều chỉnh được. Mong đợi quá trình giải mã mã thông báo được che dấu sẽ tiếp tục xuất hiện trong các trình tạo và hệ thống chỉnh sửa đa phương thức nhanh, nơi các phần tô trong bức tranh và có điều kiện là phù hợp tự nhiên.

Triển khai trong thế giới thực

Tạo hình ảnh đầy đủ trong khoảng 8 đến 12 bước song song thay vì hàng trăm dự đoán mã thông báo tự động hồi quy

Vẽ vùng bị che của ảnh bằng cách chỉ dự đoán lại các mã thông báo ẩn với bối cảnh xung quanh

Tổng hợp hình ảnh có điều kiện trên ImageNet với chất lượng cạnh tranh với các mô hình chậm hơn nhiều

Đóng vai trò là xương sống giải mã cho các hệ thống chuyển văn bản thành hình ảnh như MUSE của Google cần tạo nhanh

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Giải mã song song bộ xương suy nghĩ

Câu hỏi thường gặp

Giải mã mã thông báo song song MaskGIT là gì?

MaskGIT tạo ra hình ảnh bằng cách dự đoán nhiều mã thông báo cùng một lúc và điền vào những mã thông báo đáng tin cậy nhất trước tiên, thay thế việc tạo từ trái sang phải chậm chạp bằng một số bước song song nhanh.

MaskGIT giải mã mã thông báo hình ảnh khác với máy biến áp của VQGAN như thế nào?

MaskGIT dự đoán đồng thời tất cả các mã thông báo bị che giấu với sự chú ý hai chiều, không giống như giải mã tự động hồi quy chậm từ trái sang phải của VQGAN.

MaskGIT mượn mục tiêu đào tạo nào từ các mô hình ngôn ngữ?

MaskGIT ẩn các tập hợp con mã thông báo ngẫu nhiên và học cách dự đoán chúng, một mục tiêu mô hình hóa được che giấu tương tự như BERT.

Trong quá trình tạo, MaskGIT cam kết những mã thông báo nào ở mỗi lần lặp?

Mỗi bước giữ lại những dự đoán chắc chắn nhất và ẩn đi những dự đoán còn lại, để các bước sau đó có điều kiện dựa trên bối cảnh đáng tin cậy.

MaskGIT thường cần bao nhiêu lần lặp để tạo một hình ảnh?

MaskGIT giải mã theo một số bước cố định nhỏ, thường là 8 đến 12, ít hơn nhiều so với các phương pháp tự hồi quy hoặc khuếch tán.

Lịch trình nào kiểm soát số lượng token MaskGIT tiết lộ mỗi bước?

Lịch trình cosine tiết lộ một số mã thông báo sớm và nhiều mã thông báo muộn hơn, cân bằng chất lượng và tốc độ qua các lần lặp.