Kiến trúc StyleGAN
StyleGAN là một mạng đối thủ tổng hợp của NVIDIA, tạo ra các khuôn mặt và đối tượng thực tế ấn tượng bằng cách đưa thông tin về kiểu dáng vào mỗi lớp.
Tổng quan
It matters because its design gives unprecedented, disentangled control over coarse and fine image attributes.
Lặn sâu
StyleGAN, được giới thiệu bởi Karras et al. vào năm 2018, đã thiết kế lại trình tạo GAN xoay quanh ý tưởng về 'phong cách'. Thay vì đưa một vectơ ngẫu nhiên thẳng vào mạng, trước tiên, nó ánh xạ mã tiềm ẩn z thông qua MLP 8 lớp vào không gian trung gian W, giúp loại bỏ các yếu tố biến đổi. Sau đó, một tensor hằng số đã học sẽ được tăng tần số lấy mẫu và ở mỗi độ phân giải, vectơ kiểu sẽ điều chỉnh các bản đồ đặc trưng thông qua Chuẩn hóa phiên bản thích ứng (AdaIN), kiểm soát các thuộc tính từ tư thế (lớp thô) đến kết cấu da (lớp mịn). Đầu vào nhiễu trên mỗi lớp sẽ thêm các chi tiết ngẫu nhiên như tàn nhang và sợi tóc lạc lối. StyleGAN2 (2020) đã thay thế AdaIN bằng tính năng giải điều chế trọng lượng để loại bỏ các tạo phẩm 'blob' và StyleGAN3 (2021) đã sửa lỗi răng cưa bám sát kết cấu để làm cho các tính năng chuyển động tự nhiên trong quá trình hoạt ảnh.
Hiểu biết kỹ thuật
Cơ chế chính là điều chế dựa trên phong cách. Mạng ánh xạ biến z thành w và biến đổi affine đã học chuyển đổi w thành tỷ lệ trên mỗi kênh và độ lệch được áp dụng cho các bản đồ tính năng chuẩn hóa ở mỗi độ phân giải. Vì các kiểu hoạt động theo từng lớp nên bạn có thể kết hợp w của một hình ảnh ở các lớp thô với một hình ảnh khác ở các lớp mịn ('trộn kiểu') để hoán đổi tư thế trong khi vẫn giữ được kết cấu. Quá trình giải điều chế của StyleGAN2 tổng hợp các số liệu thống kê này thành các trọng số tích chập, loại bỏ các tạo tác chuẩn hóa.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của kiến trúc StyleGAN
Mặc dù các mô hình phổ biến hiện dẫn đầu việc tạo văn bản thành hình ảnh nói chung, không gian tiềm ẩn có thể chỉnh sửa, có cấu trúc cao (W và W+) của StyleGAN giữ nó làm trung tâm cho việc chỉnh sửa khuôn mặt, thao tác thuộc tính và tổng hợp thời gian thực trong đó GAN duy trì tốc độ nhanh hơn. Mong đợi công việc tiếp tục về đảo ngược GAN (chiếu ảnh thật vào W), các biến thể nhận biết 3D như EG3D hiển thị các chế độ xem nhất quán và các kết hợp kết hợp tiềm ẩn có thể kiểm soát của StyleGAN với các ưu tiên khuếch tán hoặc biến áp để đạt được hiệu quả tốt nhất của cả hai thế giới.
Triển khai trong thế giới thực
Tạo ra vô số khuôn mặt con người không tồn tại, như ảnh thực tế, như được giới thiệu bởi thispersondoesnotexist.com.
Chỉnh sửa khuôn mặt theo ngữ nghĩa: thay đổi độ tuổi, biểu cảm hoặc tư thế một cách mượt mà bằng cách di chuyển dọc theo các hướng trong không gian W.
Tạo dữ liệu đào tạo tổng hợp và hình đại diện khi khan hiếm hình ảnh thực, đảm bảo quyền riêng tư.
Các công cụ nghệ thuật nội suy hoặc 'pha trộn kiểu' giữa các hình ảnh để hòa trộn cấu trúc thô và chi tiết tinh tế.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the StyleGAN Architecture quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Kiến trúc U-Net
Câu hỏi thường gặp
What is StyleGAN Architecture?
StyleGAN là một mạng đối thủ tổng hợp của NVIDIA, tạo ra các khuôn mặt và đối tượng thực tế ấn tượng bằng cách đưa thông tin về kiểu dáng vào mỗi lớp. Điều này quan trọng vì thiết kế của nó mang lại khả năng kiểm soát chưa từng có, dễ dàng đối với các thuộc tính hình ảnh thô và mịn.
Mục đích của mạng bản đồ StyleGAN là gì?
MLP 8 lớp ánh xạ z đến W, một không gian tiềm ẩn trung gian nơi các yếu tố biến đổi được phân tách tốt hơn, cho phép kiểm soát rõ ràng hơn.
Trong StyleGAN ban đầu, kiểu được đưa vào bản đồ đặc trưng như thế nào?
AdaIN chuẩn hóa các bản đồ đặc trưng, sau đó chia tỷ lệ và dịch chuyển chúng bằng cách sử dụng số liệu thống kê bắt nguồn từ kiểu ở mỗi độ phân giải.
Mạng tổng hợp bắt đầu từ đâu thay vì vectơ tiềm ẩn?
StyleGAN bắt đầu từ một đầu vào không đổi đã học và thêm kiểu dáng cũng như tiếng ồn khi lấy mẫu thay vì đưa z trực tiếp vào.
Việc điều chỉnh kiểu ở các lớp thô (độ phân giải thấp) chủ yếu kiểm soát điều gì?
Các lớp thô chi phối cấu trúc quy mô lớn như tư thế và hình dạng tổng thể, trong khi các lớp mịn xử lý kết cấu và chi tiết vi mô.
StyleGAN2 đã khắc phục vấn đề gì so với bản gốc?
StyleGAN2 đã thay thế AdaIN bằng tính năng giải điều chế trọng lượng, loại bỏ các thành phần giả dạng giọt/đốm và cải thiện chất lượng hình ảnh.