การสูญเสียการรับรู้และ LPIPS
การสูญเสียการรับรู้จะวัดว่าภาพสองภาพมีความคล้ายคลึงกันในมนุษย์อย่างไรโดยการเปรียบเทียบคุณลักษณะโครงข่ายประสาทเทียมระดับลึกแทนที่จะเป็นพิกเซลดิบ
ภาพรวม
It matters because pixel-by-pixel comparison wrongly punishes tiny shifts and blurs detail, while perceptual loss rewards sharp, realistic results.
เจาะลึก
การสูญเสียแบบดั้งเดิม เช่น L2 (ค่าคลาดเคลื่อนกำลังสองเฉลี่ย) จะเปรียบเทียบภาพแบบพิกเซลต่อพิกเซล ดังนั้นการเปลี่ยนแปลงหนึ่งพิกเซลหรือพื้นผิวที่แตกต่างกันเล็กน้อยจึงดูเหมือนเป็นข้อผิดพลาดครั้งใหญ่ แม้ว่ามนุษย์แทบจะไม่สังเกตเห็นก็ตาม การสูญเสียการรับรู้จะเรียกใช้ทั้งสองอิมเมจผ่านเครือข่ายที่ได้รับการฝึกล่วงหน้า (มักจะเป็น VGG) และเปรียบเทียบการเปิดใช้งานจากเลเยอร์ระดับกลาง เนื่องจากคุณสมบัติเหล่านั้นเข้ารหัสขอบ พื้นผิว และส่วนของวัตถุมากกว่าค่าพิกเซลที่แน่นอน การสูญเสียจึงสอดคล้องกับวิจารณญาณของมนุษย์ได้ดีขึ้น ช่วยให้ได้ผลลัพธ์ที่คมชัดและตรงตามความหมาย LPIPS (Learned Perceptual Image Patchคล้ายคลึงกัน) นำเสนอโดย Zhang และคณะ ในปี 2018 ได้กำหนดสิ่งนี้อย่างเป็นทางการ โดยแยกคุณลักษณะเชิงลึก ทำให้เป็นมาตรฐาน และใช้ตุ้มน้ำหนักที่เรียนรู้ซึ่งเทียบเคียงกับการตัดสินความคล้ายคลึงกันของมนุษย์นับพันครั้ง โดยสร้างคะแนนระยะทางเดียวโดยที่ต่ำกว่าหมายถึงมีความเหมือนกันมากกว่าในการรับรู้
ข้อมูลเชิงลึกทางเทคนิค
LPIPS ส่งภาพทั้งสองผ่านแบ็คโบนคงที่ (VGG, AlexNet หรือ SqueezeNet) ยูนิตจะปรับการเปิดใช้งานช่องสัญญาณให้เป็นมาตรฐานในหลายเลเยอร์ จากนั้นนำผลต่างกำลังสองที่ตำแหน่งเชิงพื้นที่แต่ละตำแหน่ง น้ำหนักต่อช่องที่เรียนรู้ชุดเล็กๆ จะปรับขนาดความแตกต่างเหล่านั้นก่อนที่จะหาค่าเฉลี่ยเชิงพื้นที่และรวมข้ามเลเยอร์ น้ำหนักเหล่านั้นได้รับการฝึกอบรมในชุดข้อมูล BAPPS ของการตัดสินแบบบังคับทางเลือกสองทางของมนุษย์ ดังนั้นหน่วยเมตริกจึงสะท้อนถึงสิ่งที่ผู้คนรับรู้จริง ๆ แทนที่จะเป็นระยะทางดิบ
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการสูญเสียการรับรู้และ LPIPS
ตัวชี้วัดการรับรู้กำลังเปลี่ยนจากแกนหลักของ CNN ไปสู่คุณสมบัติจากโมเดลที่ควบคุมตนเองและตัวแปลงการมองเห็น เช่น DINO และ CLIP ซึ่งจับความหมายที่สมบูรณ์ยิ่งขึ้น คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับการฝึกอบรมโมเดลการแพร่กระจายและการประเมินข้อความเป็นรูปภาพ รวมถึงคะแนนการรับรู้ที่ปรับแต่งเพื่อความสอดคล้องชั่วคราวของวิดีโอ นักวิจัยยังกำลังตรวจสอบจุดบอดของ LPIPS อีกด้วย กล่าวคือ มันสามารถถูกหลอกได้ในทางตรงข้ามและมีความสัมพันธ์กับคุณภาพที่มีความเที่ยงตรงสูงมาก กระตุ้นให้เกิดตัวชี้วัดใหม่ที่สอดคล้องกับมนุษย์ เช่น DISTS และแนวทางการรวมกลุ่ม
การใช้งานจริงในโลกแห่งความเป็นจริง
การฝึกอบรมเครือข่ายความละเอียดสูงพิเศษ (เช่น SRGAN) เพื่อให้ภาพที่ขยายขนาดดูคมชัดและมีพื้นผิวมากกว่าที่จะเบลอ
การประเมินการบีบอัดภาพและตัวแปลงสัญญาณโดยการให้คะแนนว่าภาพที่ถอดรหัสปิดไปจากต้นฉบับอย่างไร
การถ่ายโอนรูปแบบการนำทาง โดยที่เนื้อหาจะถูกจับคู่ผ่านฟีเจอร์ VGG แบบลึก แทนที่จะเป็นพิกเซลที่ตรงทั้งหมด
การเปรียบเทียบ GAN และเครื่องสร้างภาพการแพร่กระจายโดยการรายงานระยะห่าง LPIPS ระหว่างภาพที่สร้างขึ้นและภาพจริง
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Perceptual Loss and LPIPS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสูญเสียโฟกัสสำหรับการตรวจจับที่ไม่สมดุล
คำถามที่พบบ่อย
What is Perceptual Loss and LPIPS?
การสูญเสียการรับรู้จะวัดว่าภาพสองภาพมีความคล้ายคลึงกันในมนุษย์อย่างไรโดยการเปรียบเทียบคุณลักษณะโครงข่ายประสาทเทียมระดับลึกแทนที่จะเป็นพิกเซลดิบ สิ่งสำคัญคือเนื่องจากการเปรียบเทียบแบบพิกเซลต่อพิกเซลจะลงโทษการเปลี่ยนแปลงเล็กๆ น้อยๆ และทำให้รายละเอียดพร่ามัว ในขณะที่การสูญเสียการรับรู้จะให้ผลลัพธ์ที่คมชัดและสมจริง
เหตุใดการสูญเสีย L2 แบบพิกเซลจึงมักตัดสินความคล้ายคลึงของภาพผิดเมื่อเปรียบเทียบกับการสูญเสียการรับรู้
L2 เปรียบเทียบพิกเซลโดยตรง ดังนั้นการเปลี่ยนแปลงเชิงพื้นที่เล็กน้อยหรือความแตกต่างของพื้นผิวจึงถือเป็นข้อผิดพลาดขนาดใหญ่ แม้ว่าภาพจะดูดีในสายตาบุคคลก็ตาม
LPIPS เปรียบเทียบอะไรระหว่างสองภาพเป็นหลัก
LPIPS แยกการเปิดใช้งานคุณสมบัติเชิงลึกจากแกนหลักที่ตายตัว และวัดระยะห่างซึ่งสอดคล้องกับการรับรู้ของมนุษย์ได้ดีกว่าพิกเซล
น้ำหนักต่อช่องใน LPIPS ถูกกำหนดอย่างไร
เรียนรู้ตุ้มน้ำหนักเพื่อให้ตรงกับชุดข้อมูลขนาดใหญ่ (BAPPS) ของการตัดสินใจที่คล้ายคลึงกันแบบสองทางเลือกของมนุษย์
เครือข่ายแกนหลักใดมักเกี่ยวข้องกับการสูญเสียการรับรู้ (ฟีเจอร์) แบบคลาสสิกมากที่สุด
แผนผังคุณลักษณะระดับกลางของ VGG กลายเป็นมาตรฐานสำหรับการสูญเสียการรับรู้ในงานต่างๆ เช่น ความละเอียดสูงพิเศษ และการถ่ายโอนสไตล์
งานใดที่ได้ประโยชน์โดยตรงจากการใช้การสูญเสียการรับรู้แทน L2 ล้วนๆ
เครือข่ายความละเอียดสูงพิเศษที่ได้รับการฝึกฝนโดยสูญเสียการรับรู้จะสร้างพื้นผิวที่คมชัดและสมจริงยิ่งขึ้น ในขณะที่ L2 มีแนวโน้มที่จะสร้างค่าเฉลี่ยที่พร่ามัว