คู่มือ AI แบบเห็นภาพ

วัสเซอร์สไตน์ GAN

Wasserstein GAN (WGAN) คือการออกแบบใหม่ของวัตถุประสงค์การฝึกอบรม GAN ที่ใช้ระยะทาง Wasserstein แทนการสูญเสียต่ำสุด-สูงสุดแบบเดิม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It makes notoriously unstable GAN training far more reliable and gives a loss value that actually correlates with image quality.

เจาะลึก

GAN ดั้งเดิมฝึกสองเครือข่ายในการชักเย่อ: เครื่องกำเนิดไฟฟ้าสร้างภาพปลอมและผู้เลือกปฏิบัติพยายามตรวจจับพวกเขา สิ่งนี้มักจะพังทลายลงหรือหยุดชะงักเพราะการสูญเสียของผู้เลือกปฏิบัติไม่ได้บอกว่าไม่มีประโยชน์อะไรเกี่ยวกับความก้าวหน้า WGAN ซึ่งเปิดตัวโดย Arjovsky, Chintala และ Bottou ในปี 2560 แทนที่ผู้เลือกปฏิบัติด้วย 'นักวิจารณ์' ที่ให้คะแนนว่าภาพดูสมจริงแค่ไหนในระดับที่ต่อเนื่องกัน แทนที่จะแยกประเภทภาพจริงกับภาพปลอม เป้าหมายการฝึกอบรมจะกลายเป็นระยะห่างของ Wasserstein (ผู้ขับเคลื่อนดิน) ระหว่างการกระจายข้อมูลจริงและที่สร้างขึ้น ระยะนี้ให้การไล่ระดับสีที่นุ่มนวลและมีความหมายมากขึ้น แม้ว่าการกระจายทั้งสองแทบจะไม่ทับซ้อนกัน ซึ่งช่วยลดการล่มสลายของโหมดได้อย่างมาก และทำให้เส้นโค้งการสูญเสียเป็นสัญญาณคุณภาพที่แท้จริง

ข้อมูลเชิงลึกทางเทคนิค

ระยะห่างของ Wasserstein จะวัด 'งาน' ขั้นต่ำโดยสังหรณ์ใจเพื่อเปลี่ยนกองดินหนึ่งกอง (การกระจายปลอม) ให้เป็นอีกกองหนึ่ง (ของจริง) การคำนวณนั้นขึ้นอยู่กับความเป็นคู่ของ Kantorovich-Rubinstein ซึ่งกำหนดให้นักวิจารณ์ต้องเป็น 1-Lipschitz (การไล่ระดับสีที่มีขอบเขต) WGAN ดั้งเดิมบังคับใช้สิ่งนี้อย่างหยาบๆ โดยการตัดน้ำหนักให้เหลือเพียงเล็กน้อย ต่อมา WGAN-GP ได้แทนที่การคลิปด้วยการปรับการไล่ระดับสีซึ่งจะค่อยๆ ดันบรรทัดฐานการไล่ระดับสีของนักวิจารณ์ไปที่ 1 และทำให้การฝึกมีความเสถียรมากขึ้น

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ Wasserstein GAN

ข้อมูลเชิงลึกหลักของ WGAN ที่ว่าการเลือกระยะการกระจายจะกำหนดคุณภาพการไล่ระดับสี ยังคงสะท้อนผ่านการสร้างแบบจำลองเชิงกำเนิด ในขณะที่แบบจำลองการแพร่กระจายมีอิทธิพลเหนือการสังเคราะห์ภาพ แนวคิดการขนส่งที่เหมาะสมที่สุดจาก WGAN ก็ปรากฏขึ้นอีกครั้งในการจับคู่การไหล วิธี Schrodinger-bridge และการกลั่นแบบจำลองการแพร่กระจายลงในเครื่องกำเนิดไฟฟ้าไม่กี่ขั้นตอนที่รวดเร็ว คาดหวังวัตถุประสงค์สไตล์ Wasserstein เพื่อแจ้งแนวทางแบบผสมผสาน โดยที่การฝึกอบรมที่มั่นคงและตัวชี้วัดการสูญเสียที่มีความหมายมีความสำคัญ โดยเฉพาะอย่างยิ่งในโดเมนทางวิทยาศาสตร์และข้อมูลต่ำ

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างใบหน้าและพื้นผิวที่เหมือนจริงโดยที่ Vanilla GAN ยุบลงเป็นเอาต์พุตซ้ำสองสามครั้ง

การสร้างภาพทางการแพทย์สังเคราะห์ เช่น MRI หรือแผ่นแปะเนื้อเยื่อวิทยา เพื่อเพิ่มชุดข้อมูลที่หายาก

การสร้างแบบจำลองเหตุการณ์การชนกันของอนุภาคในการจำลองฟิสิกส์พลังงานสูงซึ่งการฝึกอบรมที่มีเสถียรภาพถือเป็นสิ่งสำคัญ

ทำหน้าที่เป็นเกณฑ์มาตรฐานพื้นฐานในการวิจัย ML เนื่องจากการสูญเสียจะติดตามคุณภาพตัวอย่างมากกว่าการฝึกอบรม

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Wasserstein GAN quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ESRGAN และ GAN สุดยอดความละเอียด

คำถามที่พบบ่อย

What is Wasserstein GAN?

Wasserstein GAN (WGAN) คือการออกแบบใหม่ของวัตถุประสงค์การฝึกอบรม GAN ที่ใช้ระยะทาง Wasserstein แทนการสูญเสียต่ำสุด-สูงสุดแบบเดิม ทำให้การฝึกอบรม GAN ที่ไม่เสถียรอย่างฉาวโฉ่มีความน่าเชื่อถือมากขึ้น และให้ค่าการสูญเสียที่สัมพันธ์กับคุณภาพของภาพจริงๆ

WGAN ใช้ตัวชี้วัดระยะทางใดเพื่อเปรียบเทียบการแจกแจงจริงและการแจกแจงที่สร้างขึ้น

WGAN แทนที่วัตถุประสงค์ดั้งเดิมของ Jensen-Shannon ด้วยระยะ Wasserstein ซึ่งให้การไล่ระดับสีที่นุ่มนวลยิ่งขึ้นแม้ว่าการกระจายแทบจะไม่ทับซ้อนกันก็ตาม

ใน WGAN เครือข่ายที่เป็นผู้เลือกปฏิบัติถูกเปลี่ยนชื่อเป็น อะไร และเพราะเหตุใด

นักวิจารณ์ให้คะแนนภาพในระดับต่อเนื่อง แทนที่จะแยกประเภทภาพจริงกับภาพปลอม นั่นคือสิ่งที่ทำให้วัตถุประสงค์ของ Wasserstein ได้ผล

เหตุใดนักวิจารณ์ WGAN จึงต้องถูกจำกัดให้เป็น 1-Lipschitz

ความเป็นคู่ที่ทำให้ WGAN ประมาณระยะทางของวัสเซอร์สไตน์นั้นมีไว้สำหรับฟังก์ชัน 1-ลิปชิตซ์เท่านั้น ดังนั้นการไล่ระดับสีของนักวิจารณ์จึงต้องมีขอบเขต

WGAN ดั้งเดิมบังคับใช้ข้อจำกัดของ Lipschitz อย่างไร

กระดาษ WGAN ฉบับแรกใช้การตัดน้ำหนักอย่างหยาบ ต่อมา WGAN-GP ได้แทนที่ด้วยการปรับการไล่ระดับสีที่นุ่มนวลขึ้น

WGAN ลดปัญหาอะไรลงอย่างเห็นได้ชัดเมื่อเทียบกับ vanilla GAN

โหมดขอบการไล่ระดับสีที่นุ่มนวลขึ้นของ WGAN จะพังทลายลงและทำให้เกิดการสูญเสียที่สัมพันธ์กับคุณภาพของตัวอย่างอย่างแท้จริง