Tổng hợp hình ảnh VQGAN và Codebook
VQGAN nén hình ảnh vào một lưới các mã thông báo riêng biệt được rút ra từ sách mã đã học, cho phép máy biến áp tạo ra hình ảnh giống như cách các mô hình ngôn ngữ tạo ra văn bản.
Lặn sâu
VQGAN, được giới thiệu trong bài báo năm 2021 'Thuần hóa máy biến áp để tổng hợp hình ảnh độ phân giải cao', kết hợp bộ mã hóa tự động lượng tử hóa vectơ (VQVAE) với đào tạo đối nghịch và nhận thức. Bộ mã hóa ánh xạ hình ảnh vào một lưới nhỏ các vectơ đặc trưng; mỗi vectơ được gắn vào mục gần nhất trong sách mã đã học gồm 1024 mã rời rạc, biến hình ảnh thành một chuỗi các mã thông báo số nguyên. Bộ giải mã sẽ tái tạo lại hình ảnh từ các mã thông báo đó, được đào tạo bằng bộ phân biệt đối xử GAN và làm mất nhận thức để việc tái tạo trông sắc nét thay vì mờ. Bởi vì hình ảnh hiện là các chuỗi mã thông báo rời rạc nên một máy biến áp tự hồi quy có thể mô hình hóa chúng giống như ngôn ngữ, dự đoán từng mã thông báo một. VQGAN nổi tiếng hỗ trợ các công cụ nghệ thuật chuyển văn bản thành hình ảnh thời kỳ đầu khi kết hợp với hướng dẫn CLIP.
Hiểu biết kỹ thuật
Hoạt động cốt lõi là lượng tử hóa vectơ: đầu ra của bộ mã hóa liên tục được thay thế bằng vectơ bảng mã gần nhất của chúng, bằng bộ ước tính độ dốc 'xuyên suốt' để bộ mã hóa vẫn có thể học mặc dù tra cứu không phân biệt được. Việc thêm bộ phân biệt đối xử GAN dựa trên bản vá lên trên bộ mã hóa tự động là điều cho phép VQGAN sử dụng lưới mã thông báo nhỏ hơn nhiều (ví dụ: 16x16) so với VQVAE trong khi vẫn giữ được kết cấu sắc nét, giúp mô hình máy biến áp có thể thực hiện được.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của tổng hợp hình ảnh VQGAN và Codebook
Công thức mã thông báo rời rạc của VQGAN đã trở thành nền tảng cho các mô hình hình ảnh và video dựa trên mã thông báo, từ MaskGIT đến các hệ thống đa phương thức kết hợp mã thông báo hình ảnh và văn bản trong một máy biến áp. Nghiên cứu hiện đang hướng tới các sách mã lớn hơn, vô hướng hữu hạn hoặc không cần tra cứu để tránh sự sụp đổ của sách mã và hướng tới các mô hình thống nhất trong đó cùng một từ vựng bao gồm hình ảnh, âm thanh và ngôn ngữ, cho phép thế hệ nào cũng vậy.
Triển khai trong thế giới thực
Mã hóa ảnh thành lưới mã thông báo sách mã 16x16 để máy biến áp có thể lập mô hình và tái tạo nó
Kết hợp VQGAN với hướng dẫn CLIP để tạo ra tác phẩm nghệ thuật AI 'VQGAN+CLIP' siêu thực đã lan truyền vào năm 2021
Nén hình ảnh thành các mã rời rạc nhỏ gọn để lưu trữ hiệu quả hoặc đào tạo tổng hợp tiếp theo
Đóng vai trò là công cụ mã thông báo hình ảnh bên trong các trình tạo dựa trên mã thông báo lớn hơn như MaskGIT và các máy biến áp đa phương thức
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tổng hợp hình ảnh ngữ nghĩa SPADE
Câu hỏi thường gặp
What is VQGAN and Codebook Image Synthesis?
VQGAN nén hình ảnh vào một lưới các mã thông báo riêng biệt được rút ra từ sách mã đã học, cho phép máy biến áp tạo ra hình ảnh giống như cách các mô hình ngôn ngữ tạo ra văn bản.
VQGAN sử dụng cái gì để thể hiện hình ảnh dưới dạng mã thông báo rời rạc?
VQGAN lượng tử hóa các tính năng của bộ mã hóa thành các mục gần nhất trong sổ mã đã học, biến hình ảnh thành một chuỗi các chỉ số mã rời rạc.
Tại sao VQGAN thêm bộ phân biệt đối xử GAN lên trên VQVAE?
Những tổn thất về mặt cảm nhận và đối nghịch cho phép VQGAN tái tạo lại các hình ảnh sắc nét từ một lưới mã thông báo nhỏ gọn mà riêng VQVAE có xu hướng làm mờ.
Khi hình ảnh là một chuỗi mã thông báo, mô hình nào sẽ tạo ra hình ảnh mới?
Vì hình ảnh trở thành chuỗi mã thông báo rời rạc nên máy biến áp có thể mô hình hóa chúng một cách tự động, giống như tạo văn bản.
Kỹ thuật nào cho phép độ dốc chảy qua bước lượng tử hóa không khả vi?
Lượng tử hóa vectơ là không khả vi, do đó VQGAN sử dụng công cụ ước tính độ dốc xuyên suốt để huấn luyện bộ mã hóa.
VQGAN đã giúp tạo ra xu hướng nghệ thuật AI nổi tiếng nào vào năm 2021?
Việc ghép nối VQGAN với hướng dẫn CLIP đã tạo ra tác phẩm nghệ thuật 'VQGAN+CLIP' được chia sẻ rộng rãi nhằm phổ biến việc tạo hình ảnh dựa trên văn bản.