Mất tri giác và LPIPS
Mất cảm giác đo lường mức độ giống nhau của hai hình ảnh đối với con người bằng cách so sánh các đặc điểm của mạng lưới thần kinh sâu thay vì các pixel thô.
Tổng quan
It matters because pixel-by-pixel comparison wrongly punishes tiny shifts and blurs detail, while perceptual loss rewards sharp, realistic results.
Lặn sâu
Những mất mát truyền thống như L2 (lỗi bình phương trung bình) so sánh hình ảnh theo từng pixel, do đó, sự thay đổi một pixel hoặc kết cấu hơi khác trông giống như một lỗi lớn ngay cả khi con người hầu như không nhận thấy. Thay vào đó, mất cảm giác chạy cả hai hình ảnh thông qua mạng được huấn luyện trước (thường là VGG) và so sánh kích hoạt từ các lớp trung gian. Vì những tính năng đó mã hóa các cạnh, kết cấu và các bộ phận đối tượng thay vì giá trị pixel chính xác nên mức độ mất dữ liệu sẽ phù hợp hơn với phán đoán của con người, khuyến khích kết quả đầu ra sắc nét, trung thực về mặt ngữ nghĩa. LPIPS (Tính tương tự của bản vá hình ảnh nhận thức đã học), được giới thiệu bởi Zhang và cộng sự. vào năm 2018, chính thức hóa điều này: nó trích xuất các đặc điểm sâu sắc, bình thường hóa chúng và áp dụng các trọng số đã học được hiệu chỉnh theo hàng nghìn đánh giá về sự giống nhau của con người, tạo ra một điểm khoảng cách duy nhất trong đó thấp hơn có nghĩa là giống nhau hơn về mặt nhận thức.
Hiểu biết kỹ thuật
LPIPS chuyển cả hai hình ảnh qua một đường trục cố định (VGG, AlexNet hoặc SqueezeNet), chuẩn hóa đơn vị kích hoạt kênh ở một số lớp, sau đó lấy chênh lệch bình phương ở mỗi vị trí không gian. Một tập hợp nhỏ các trọng số đã học trên mỗi kênh sẽ chia tỷ lệ những khác biệt đó trước khi chúng được tính trung bình theo không gian và tính tổng giữa các lớp. Các trọng số đó đã được huấn luyện trên tập dữ liệu BAPPS về các phán đoán bắt buộc có hai lựa chọn thay thế của con người, do đó, số liệu này phản ánh những gì mọi người thực sự cảm nhận được hơn là khoảng cách tính năng thô.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của mất mát cảm nhận và LPIPS
Các số liệu về nhận thức đang chuyển từ nền tảng CNN sang các tính năng từ các mô hình tự giám sát và chuyển đổi tầm nhìn như DINO và CLIP, những mô hình này nắm bắt được ngữ nghĩa phong phú hơn. Mong đợi sự tích hợp chặt chẽ hơn với đào tạo mô hình khuếch tán và đánh giá văn bản thành hình ảnh, cộng với điểm số cảm nhận được điều chỉnh để đảm bảo tính nhất quán về thời gian của video. Các nhà nghiên cứu cũng đang thăm dò các điểm mù của LPIPS: nó có thể bị đánh lừa một cách bất lợi và có tương quan yếu với chất lượng ở độ chính xác rất cao, thúc đẩy các số liệu mới hơn phù hợp với con người như DISTS và các phương pháp tiếp cận tổng thể.
Triển khai trong thế giới thực
Đào tạo các mạng siêu phân giải (ví dụ: SRGAN) để ảnh được nâng cấp trông sắc nét và có kết cấu thay vì mờ.
Đánh giá khả năng nén hình ảnh và codec bằng cách cho điểm mức độ gần gũi của hình ảnh được giải mã với hình ảnh gốc.
Hướng dẫn chuyển kiểu, trong đó nội dung được khớp thông qua các tính năng VGG sâu thay vì pixel chính xác.
Đo điểm chuẩn GAN và trình tạo hình ảnh khuếch tán bằng cách báo cáo khoảng cách LPIPS giữa hình ảnh được tạo và hình ảnh thực.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Perceptual Loss and LPIPS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mất tiêu điểm để phát hiện mất cân bằng
Câu hỏi thường gặp
What is Perceptual Loss and LPIPS?
Mất cảm giác đo lường mức độ giống nhau của hai hình ảnh đối với con người bằng cách so sánh các đặc điểm của mạng lưới thần kinh sâu thay vì các pixel thô. Điều này quan trọng vì việc so sánh từng pixel sẽ xử lý sai những thay đổi nhỏ và làm mờ chi tiết, trong khi sự mất mát về cảm nhận sẽ mang lại kết quả sắc nét, chân thực.
Tại sao mất L2 dựa trên pixel thường đánh giá sai độ tương tự của hình ảnh so với mất cảm nhận?
L2 so sánh trực tiếp các pixel, do đó, những thay đổi nhỏ về không gian hoặc sự khác biệt về kết cấu sẽ được coi là lỗi lớn ngay cả khi hình ảnh trông đẹp đối với một người.
LPIPS chủ yếu so sánh điều gì giữa hai hình ảnh?
LPIPS trích xuất các kích hoạt tính năng sâu từ một đường trục cố định và đo khoảng cách của chúng, điều này phù hợp hơn với nhận thức của con người so với pixel.
Trọng số trên mỗi kênh trong LPIPS được xác định như thế nào?
Các trọng số đã được học để khớp với một tập dữ liệu lớn (BAPPS) về các quyết định tương tự giữa hai lựa chọn thay thế-bắt buộc của con người.
Mạng đường trục nào thường liên quan nhất đến việc mất đi nhận thức (tính năng) cổ điển?
Bản đồ tính năng trung gian của VGG đã trở thành tiêu chuẩn cho tình trạng mất nhận thức trong các tác vụ như độ phân giải siêu cao và chuyển kiểu.
Nhiệm vụ nào được hưởng lợi trực tiếp nhất từ việc sử dụng mất mát cảm nhận thay vì L2 thuần túy?
Mạng siêu phân giải được huấn luyện với hiện tượng mất nhận thức sẽ tạo ra kết cấu sắc nét hơn, chân thực hơn, trong khi L2 có xu hướng tạo ra mức trung bình mờ.