HƯỚNG DẪN AI trực quan

Sự phát triển lũy tiến của GAN

Sự phát triển lũy tiến đào tạo GAN bằng cách bắt đầu ở độ phân giải nhỏ và dần dần thêm các lớp để đạt được hình ảnh có độ phân giải cao.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it made stable, megapixel-quality GAN synthesis practical for the first time.

Lặn sâu

Được giới thiệu bởi Karras et al. (NVIDIA) vào năm 2017, tính năng tăng trưởng lũy ​​tiến (ProGAN) đã khắc phục sự bất ổn và chậm chạp trong việc đào tạo GAN trực tiếp ở độ phân giải cao. Cả trình tạo và trình phân biệt đều bắt đầu ở kích thước nhỏ, ở kích thước 4x4 pixel, chỉ học cấu trúc quy mô lớn. Các lớp mới tăng gấp đôi độ phân giải (8x8, 16x16, tối đa 1024x1024) sau đó được thêm đối xứng vào cả hai mạng trong quá trình đào tạo. Điều quan trọng là mỗi lớp mới được làm mờ một cách mượt mà bằng cách sử dụng hỗn hợp alpha tuyến tính để mạng không bị sốc do thay đổi kiến ​​trúc đột ngột. Bằng cách học các tính năng thô trước các chi tiết tinh tế, quá trình đào tạo sẽ ổn định hơn, hội tụ nhanh hơn và tạo ra các khuôn mặt có độ chính xác cao khiến kết quả CelebA-HQ trở nên nổi tiếng. Bài viết cũng giới thiệu độ lệch chuẩn của minibatch và tỷ lệ học tập cân bằng để ổn định hơn nữa việc đào tạo.

Hiểu biết kỹ thuật

Sự mờ dần là thủ thuật trung tâm. Khi khối có độ phân giải cao hơn được thêm vào, đầu ra của nó sẽ được trộn với phiên bản được lấy mẫu lại của độ phân giải trước đó bằng cách sử dụng trọng số alpha tăng dần từ 0 đến 1. Điều này cho phép trọng số của các lớp mới ấm lên dần dần thay vì làm gián đoạn những gì mạng đã học được. Một quá trình đối xứng xảy ra trong bộ phân biệt đối xử. Độ lệch chuẩn của Minibatch bổ sung một tính năng tóm tắt biến thể theo lô, ngăn cản trình tạo bị hỏng do đầu ra bị giới hạn.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của sự phát triển tiến bộ của GAN

Sự phát triển lũy tiến là nền tảng mà StyleGAN xây dựng, nhưng StyleGAN2 sau đó đã cho thấy rằng một kiến ​​trúc cố định với các kết nối bị bỏ qua và các khối dư có thể phù hợp với chất lượng của nó nếu không có lịch trình theo giai đoạn, vì vậy việc phát triển rõ ràng không được ưa chuộng. Di sản sâu sắc hơn vẫn tồn tại: thế hệ từ thô đến mịn giờ đây xuất hiện trong khuếch tán đa quy mô, các đường ống siêu phân giải xếp tầng và các công cụ nâng cấp không gian tiềm ẩn. Hiểu được sự phát triển lũy tiến vẫn có giá trị để hiểu lý do tại sao việc học tập theo thứ bậc, tần suất thấp đến cao lại giúp ổn định quá trình đào tạo sáng tạo.

Triển khai trong thế giới thực

Tạo ra hình ảnh khuôn mặt CelebA-HQ có độ phân giải cao thể hiện sự tổng hợp GAN 1024x1024.

Tạo các mẫu chất lượng cao của các lĩnh vực khác như phòng ngủ (LSUN) và các đồ vật trên quy mô lớn.

Đóng vai trò là điểm khởi đầu về kiến ​​trúc mà StyleGAN mở rộng để tạo khuôn mặt có thể điều khiển được.

Giảng dạy nguyên tắc đào tạo từ thô đến tinh tế được sử dụng lại trong các quy trình tạo ra nhiều quy mô và xếp tầng.

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Progressive Growing of GANs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is Progressive Growing of GANs?

Sự phát triển lũy tiến đào tạo GAN bằng cách bắt đầu ở độ phân giải nhỏ và dần dần thêm các lớp để đạt được hình ảnh có độ phân giải cao. Điều này quan trọng vì lần đầu tiên nó đã tạo ra sự tổng hợp GAN ổn định, chất lượng megapixel.

Làm thế nào để một GAN phát triển dần dần bắt đầu đào tạo?

Quá trình đào tạo bắt đầu ở 4x4, trong đó mạng tìm hiểu cấu trúc thô trước khi thêm các lớp có độ phân giải cao hơn.

Lợi ích chính của việc tăng dần độ phân giải là gì?

Học các tính năng thô trước tiên giúp ổn định quá trình đào tạo và tăng tốc độ hội tụ so với việc tấn công độ phân giải đầy đủ ngay từ đầu.

Khi một lớp mới có độ phân giải cao hơn được thêm vào, nó được giới thiệu như thế nào?

Tính năng tăng dần tuyến tính kết hợp đầu ra của lớp mới với đầu ra có độ phân giải thấp hơn được lấy mẫu lại để mạng thích ứng dần dần.

Tại sao các lớp được thêm vào cả trình tạo và trình phân biệt đối xử?

Cả hai mạng đều phát triển song song để bộ phân biệt có thể tiếp tục đánh giá hình ảnh ở độ phân giải hiện tại của bộ tạo.

Mục đích của lớp độ lệch chuẩn minibatch được giới thiệu trong ProGAN là gì?

Nó bổ sung một số liệu thống kê về sự thay đổi hàng loạt, khuyến khích máy phát điện tạo ra các đầu ra đa dạng thay vì sụp đổ.