HƯỚNG DẪN AI trực quan

Máy phát điện quy mô GigaGAN

GigaGAN là một GAN gồm hàng tỷ thông số chứng minh rằng các mạng đối lập tổng quát có thể mở rộng quy mô để tạo văn bản thành hình ảnh, cạnh tranh với các mô hình phổ biến trong khi tạo ra hình ảnh nhanh hơn hàng trăm lần.

Đọc trong 2 phútCập nhật lần cuối

Lặn sâu

GigaGAN, được Adobe và các nhà nghiên cứu giới thiệu vào năm 2023, đã thách thức giả định rằng GAN không thể mở rộng quy mô như các mô hình khuếch tán. Các GAN lớn trước đây như StyleGAN-XL đã gặp khó khăn trong việc đào tạo ổn định trên các bộ dữ liệu khổng lồ và đa dạng. GigaGAN đã giải quyết vấn đề này bằng cách mở rộng bộ tạo và bộ phân biệt đối xử, thêm một loạt các bộ lọc tích chập đã học được chọn cho mỗi mẫu và kết hợp sự chú ý chéo vào các phần nhúng văn bản. Được đào tạo trên hàng tỷ cặp văn bản-hình ảnh, trình tạo 1 tỷ tham số của nó tạo ra hình ảnh 512px trong khoảng 0,13 giây, nhanh hơn nhiều so với quá trình khử nhiễu lặp lại của khuếch tán. Nó cũng hỗ trợ nội suy không gian tiềm ẩn, trộn kiểu và bộ lấy mẫu dựa trên GAN riêng biệt có thể biến đầu vào 128px thành hình ảnh 4K sắc nét.

Hiểu biết kỹ thuật

Bí quyết chính là mô-đun 'lựa chọn hạt nhân thích ứng mẫu': thay vì một bộ bộ lọc tích chập cố định, trình tạo chứa một dãy các bộ lọc và sử dụng tính năng nhúng văn bản để tính toán các trọng số trộn chúng trên mỗi hình ảnh. Kết hợp với đào tạo đa quy mô và một công cụ phân biệt đối xử để đánh giá các bản vá ở nhiều độ phân giải cộng với các tính năng văn bản CLIP phù hợp, điều này giúp ổn định quá trình đào tạo đối nghịch ở quy mô mà GAN ​​trước đây đã sụp đổ.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của máy phát điện quy mô GigaGAN

GigaGAN đã khơi dậy sự quan tâm đến GAN như một giải pháp thay thế tập trung vào tốc độ cho việc truyền bá, đặc biệt là để chỉnh sửa tương tác và thời gian thực trong đó việc tạo một lượt truyền là quan trọng. Mong đợi các hệ thống kết hợp sử dụng trình tạo kiểu GAN để xem trước và khuếch tán ngay lập tức cho quá trình sàng lọc cuối cùng, cùng với bộ nâng cấp GAN được ghép nối với đế khuếch tán. Không gian tiềm ẩn được giải phóng của nó cũng khiến nó trở nên hấp dẫn đối với các công cụ chỉnh sửa có thể điều khiển được, trong đó phép nội suy mượt mà đánh bại việc lấy mẫu chậm.

Triển khai trong thế giới thực

Tạo hình ảnh 512px từ lời nhắc văn bản trong khoảng một phần mười giây để xem trước thiết kế tương tác

Nâng cấp ảnh 128px có độ phân giải thấp lên hình ảnh 4K sắc nét bằng cách sử dụng bộ lấy mẫu siêu phân giải dựa trên GAN

Nội suy mượt mà giữa hai lời nhắc trong không gian tiềm ẩn để tạo hiệu ứng chuyển tiếp, giống như một tách cà phê biến thành ấm trà

Áp dụng trộn kiểu để giữ bố cục của đối tượng trong khi hoán đổi phong cách nghệ thuật hoặc bảng màu trong các công cụ chỉnh sửa kiểu Adobe

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GigaGAN Scaled Generators quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Giải mã mã thông báo song song MaskGIT

Câu hỏi thường gặp

What is GigaGAN Scaled Generators?

GigaGAN là một GAN gồm hàng tỷ thông số chứng minh rằng các mạng đối lập tổng quát có thể mở rộng quy mô để tạo văn bản thành hình ảnh, cạnh tranh với các mô hình phổ biến trong khi tạo ra hình ảnh nhanh hơn hàng trăm lần.

Đóng góp chính của GigaGAN cho mô hình tổng quát là gì?

GigaGAN đã chứng minh rằng GAN, từ lâu đã được cho là khó mở rộng quy mô, có thể đạt tới một tỷ tham số và các mô hình phổ biến đối thủ trong các tác vụ chuyển văn bản thành hình ảnh.

Lợi thế lớn về tốc độ của GigaGAN so với các mô hình khuếch tán là gì?

GAN tạo ra trong một lần truyền, do đó GigaGAN tạo ra hình ảnh 512px trong khoảng 0,13 giây, nhanh hơn nhiều so với quá trình khử nhiễu lặp đi lặp lại của khuếch tán.

'Lựa chọn hạt nhân thích ứng mẫu' của GigaGAN làm gì?

Thay vì các bộ lọc cố định, GigaGAN giữ một ngân hàng bộ lọc và sử dụng văn bản nhúng để cân và trộn chúng theo từng mẫu, tăng cường công suất và độ ổn định.

GigaGAN kết hợp thông tin văn bản vào việc tạo hình ảnh như thế nào?

GigaGAN sử dụng tính năng chú ý chéo đến các phần nhúng văn bản trong trình tạo và căn chỉnh các hình ảnh được tạo bằng các tính năng văn bản CLIP thông qua bộ phân biệt đối xử.

GigaGAN cung cấp khả năng bổ sung nào ngoài việc tạo cơ sở?

GigaGAN bao gồm bộ lấy mẫu siêu phân giải dựa trên GAN có thể biến một đầu vào nhỏ thành hình ảnh 4K sắc nét.