Dịch từ hình ảnh sang hình ảnh Pix2Pix
Pix2Pix là một GAN có điều kiện học cách dịch một loại hình ảnh này sang một loại hình ảnh khác, chẳng hạn như biến bản phác thảo thành ảnh hoặc bản đồ thành chế độ xem vệ tinh.
Tổng quan
It established a general recipe for paired image-to-image translation tasks.
Lặn sâu
Được Isola và các đồng nghiệp giới thiệu vào năm 2017, Pix2Pix coi bản dịch là thế hệ có điều kiện: chính hình ảnh đầu vào là điều kiện. Trình tạo của nó là U-Net, một bộ mã hóa-giải mã với các kết nối bỏ qua mang chi tiết cấp thấp như các cạnh trực tiếp từ đầu vào đến đầu ra. Bộ phân biệt đối xử là một PatchGAN đánh giá tính hiện thực trong các mảng nhỏ cục bộ chứ không phải toàn bộ hình ảnh, giúp làm sắc nét các kết cấu. Quá trình đào tạo kết hợp tổn thất đối nghịch với mất L1 (chênh lệch pixel) để kết quả đầu ra vừa thực tế vừa trung thực với mục tiêu. Điều đáng chú ý là Pix2Pix cần dữ liệu đào tạo được ghép nối, nghĩa là các ví dụ đầu vào-đầu ra phù hợp, truyền cảm hứng cho những phần tiếp theo như CycleGAN học hỏi từ các bộ sưu tập chưa ghép đôi.
Hiểu biết kỹ thuật
Các kết nối bỏ qua U-Net rất quan trọng: trong nhiều tác vụ dịch thuật, cấu trúc chia sẻ đầu vào và đầu ra (cạnh, bố cục), do đó, việc chuyển thẳng các tính năng có độ phân giải cao sẽ tránh buộc tất cả chi tiết phải vượt qua một nút thắt cổ chai hẹp. Thuật ngữ L1 ghi lại độ chính xác tần số thấp (hình dạng và màu sắc tổng thể) trong khi bộ phân biệt PatchGAN xử lý hiện thực tần số cao (kết cấu sắc nét). Phân chia trách nhiệm theo cách này là lý do tại sao kết quả đầu ra của Pix2Pix trông vừa chính xác vừa sắc nét thay vì bị mờ.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của dịch thuật từ hình ảnh sang hình ảnh Pix2Pix
Pix2Pix đã chứng minh rằng một kiến trúc có thể xử lý nhiều vấn đề dịch thuật và ý tưởng đó vẫn tồn tại. Dòng này chạy qua phương pháp học tập không ghép đôi của CycleGAN, những phiên bản kế thừa có độ phân giải cao hơn như pix2pixHD cũng như các phương pháp tiếp cận ControlNet và dựa trên khuếch tán ngày nay dựa trên các điều kiện về các cạnh, độ sâu hoặc bản đồ phân đoạn. Khi các mô hình đạt được ưu tiên mạnh hơn, các yêu cầu về dữ liệu được ghép nối sẽ được nới lỏng và các bản dịch trở nên có độ trung thực cao hơn và dễ kiểm soát hơn, nhưng Pix2Pix vẫn là một đường cơ sở rõ ràng, nhẹ nhàng cho các tác vụ được ghép nối.
Triển khai trong thế giới thực
Chuyển đổi các bản phác thảo cạnh vẽ tay thành các vật thể quang học như túi xách hoặc giày
Biến bản đồ nhãn ngữ nghĩa thành cảnh đường phố thực tế để thiết kế và mô phỏng
Tự động tô màu ảnh đen trắng
Dịch các ô bản đồ trên không thành hình ảnh vệ tinh và ngược lại
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Pix2Pix Image-to-Image Translation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Bản dịch không ghép đôi CycleGAN
Câu hỏi thường gặp
What is Pix2Pix Image-to-Image Translation?
Pix2Pix là một GAN có điều kiện học cách dịch một loại hình ảnh này sang một loại hình ảnh khác, chẳng hạn như biến bản phác thảo thành ảnh hoặc bản đồ thành chế độ xem vệ tinh. Nó thiết lập một công thức chung cho các nhiệm vụ dịch từ hình ảnh sang hình ảnh được ghép nối.
Pix2Pix yêu cầu loại dữ liệu đào tạo nào?
Pix2Pix cần các cặp khớp nhau (ví dụ: bản phác thảo và ảnh tương ứng của nó), đó là lý do tại sao CycleGAN sau đó được tạo cho dữ liệu chưa ghép nối.
Pix2Pix sử dụng kiến trúc trình tạo nào?
Pix2Pix sử dụng bộ mã hóa-giải mã U-Net có kết nối bỏ qua chuyển chi tiết cấp thấp trực tiếp từ đầu vào đến đầu ra.
Trình phân biệt đối xử PatchGAN trong Pix2Pix đánh giá điều gì?
PatchGAN đánh giá chủ nghĩa hiện thực theo từng bản vá, khuyến khích các kết cấu sắc nét hơn, nhất quán cục bộ hơn.
Tại sao Pix2Pix lại thêm khoản lỗ L1 cùng với khoản lỗ đối nghịch?
Thuật ngữ L1 thực thi độ chính xác tần số thấp (hình dạng và màu sắc), trong khi PatchGAN xử lý chi tiết tần số cao sắc nét.
Tại sao kết nối bỏ qua U-Net lại đặc biệt hữu ích cho các tác vụ dịch thuật?
Đầu vào và đầu ra thường chia sẻ bố cục và các cạnh, vì vậy hãy bỏ qua các kết nối mang chi tiết đó đi ngang thay vì ép nó qua nút thắt cổ chai.