CycleGAN การแปลแบบไม่จับคู่
CycleGAN เรียนรู้ที่จะแปลรูปภาพระหว่างโดเมนภาพสองโดเมน (เช่น ม้าเป็นม้าลาย หรือภาพถ่ายเป็นภาพวาด) โดยไม่จำเป็นต้องจับคู่ตัวอย่างก่อนและหลังที่ตรงกัน
ภาพรวม
มันสําคัญเพราะการเก็บข้อมูลฝึกสอนแบบคู่มักเป็นไปไม่ได้ และ CycleGAN ปลดล็อกการถ่ายโอนแบบสไตล์สําหรับชุดข้อมูลจริงที่ยุ่งเหยิง
เจาะลึก
CycleGAN เปิดตัวในปี 2560 โดย Zhu, Park, Isola และ Efros โดยจัดการกับการแปลรูปภาพเป็นรูปภาพแบบไม่จับคู่ วิธีการก่อนหน้านี้ส่วนใหญ่ (เช่น pix2pix) จำเป็นต้องใช้คู่ที่ตรงกัน นั่นคือ ฉากเดียวกันกับภาพถ่ายและภาพร่าง CycleGAN ลบข้อกำหนดดังกล่าวโดยใช้ตัวสร้างสองตัว (G แปลงโดเมน A เป็น B, F แปลง B กลับเป็น A) และตัวแบ่งแยกสองตัวที่ตัดสินความสมจริงในแต่ละโดเมน ความก้าวหน้าประการหนึ่งคือการสูญเสียความสม่ำเสมอของวงจร: หากคุณแปลภาพถ่ายม้าเป็นม้าลายแล้วแปลกลับ คุณควรกู้คืนม้าตัวเดิม ข้อจำกัดนี้จะหยุดตัวสร้างจากการประดิษฐ์เอาต์พุตตามอำเภอใจ และบังคับใช้การแมปที่มีความหมายและรักษาเนื้อหา โดยมีชื่อเสียงโด่งดังในการเปลี่ยนทิวทัศน์ในฤดูร้อนให้เป็นฤดูหนาว ภาพวาดของ Monet เป็นภาพถ่าย และแอปเปิ้ลเป็นส้ม ทั้งหมดนี้เรียนรู้จากกองรูปภาพสองกองที่ไม่เกี่ยวข้องกัน
ข้อมูลเชิงลึกทางเทคนิค
CycleGAN รวมการสูญเสียฝ่ายตรงข้ามเข้ากับการสูญเสียความสม่ำเสมอของวงจร โปรแกรมสร้างแต่ละเครื่องต้องเผชิญกับการเลือกปฏิบัติของ PatchGAN ที่จัดประเภทแพทช์ภาพที่ทับซ้อนกันว่าเป็นของจริงหรือของปลอม แทนที่จะตัดสินทั้งภาพ การสูญเสียของวงจรบังคับใช้ F(G(x)) ประมาณ x และ G(F(y)) ประมาณ y โดยใช้ค่าปรับการสร้าง L1 ใหม่ การสูญเสียข้อมูลระบุตัวตนที่เป็นตัวเลือกจะรักษาสีไว้เมื่อรูปภาพเป็นของโดเมนเป้าหมายแล้ว เครื่องกำเนิดไฟฟ้าทั้งสองเครื่องฝึกพร้อมกัน โดยเรียนรู้การแมปผกผันที่ทำให้โครงสร้างไม่เสียหาย
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการแปลแบบไม่มีคู่ของ CycleGAN
แนวคิดหลักของ CycleGAN คือความสม่ำเสมอของวงจร ยังคงอยู่ในงานแปลแบบ unpaired สมัยใหม่ รวมถึงวิธีการแบบแพร่กระจายที่สลับแบ็คโบน GAN เพื่อลดสัญญาณรบกวนโมเดลด้วยเอาต์พุตที่คมชัดและหลากหลายมากขึ้น ขณะนี้นักวิจัยใช้การแปลแบบไม่มีคู่กับการถ่ายภาพทางการแพทย์ (การสังเคราะห์รังสีสแกน) การปรับโดเมนสำหรับการถ่ายโอนการจำลองการขับขี่ด้วยตนเองสู่จริง และการเพิ่มข้อมูล คาดว่าจะมีการควบคุมที่เข้มงวดยิ่งขึ้นสำหรับสิ่งที่เปลี่ยนแปลงเทียบกับสิ่งที่ยังคงอยู่ รวมถึงแนวทางแบบไฮบริดที่ผสมผสานข้อจำกัดของวงจรเข้ากับการแก้ไขการแพร่กระจายที่มีเงื่อนไขด้วยข้อความ
การใช้งานจริงในโลกแห่งความเป็นจริง
เปลี่ยนภาพถ่ายให้เป็นสไตล์การวาดภาพของ Monet, Van Gogh หรือ Cezanne โดยไม่ต้องมีตัวอย่างการวาดภาพคู่กัน
แปลงภาพถ่ายทิวทัศน์ฤดูร้อนให้เป็นฉากฤดูหนาว (และในทางกลับกัน) เพื่อสร้างเนื้อหาภาพยนตร์และเกม
การแปลการสแกน MRI เป็นภาพที่เหมือน CT ในการวิจัยทางการแพทย์ ซึ่งไม่สามารถจับคู่การสแกนผู้ป่วยได้
การปรับฟุตเทจจำลองการขับขี่แบบสังเคราะห์เพื่อให้ดูสมจริงสำหรับการฝึกการรับรู้ของยานพาหนะอัตโนมัติ
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CycleGAN Unpaired Translation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Pix2Pix การแปลภาพเป็นภาพ
คำถามที่พบบ่อย
CycleGAN Unpaired Translation คืออะไร?
CycleGAN เรียนรู้ที่จะแปลรูปภาพระหว่างโดเมนภาพสองโดเมน (เช่น ม้าเป็นม้าลาย หรือภาพถ่ายเป็นภาพวาด) โดยไม่จำเป็นต้องจับคู่ตัวอย่างก่อนและหลังที่ตรงกัน เป็นเรื่องสำคัญเนื่องจากการรวบรวมข้อมูลการฝึกแบบจับคู่มักเป็นไปไม่ได้ และ CycleGAN จะปลดล็อกการถ่ายโอนรูปแบบสำหรับชุดข้อมูลในโลกแห่งความเป็นจริงที่ยุ่งเหยิง
CycleGAN แก้ปัญหาสำคัญอะไรซึ่งวิธีการก่อนหน้านี้อย่าง pix2pix ไม่สามารถทำได้
การสนับสนุนหลักของ CycleGAN คือการแปลแบบไม่มีคู่ โดยการเรียนรู้การแมประหว่างโดเมนจากคอลเลกชันรูปภาพสองชุดที่ไม่เกี่ยวข้องกัน แทนที่จะเป็นคู่ที่ตรงกัน
การสูญเสียความสม่ำเสมอของวงจรบังคับใช้อะไร?
ความสม่ำเสมอของวงจรหมายความว่า F(G(x)) ควรเท่ากับ x: ม้าที่กลายเป็นม้าลายและด้านหลังควรมีลักษณะเหมือนม้าตัวแรก
CycleGAN มาตรฐานใช้เครื่องปั่นไฟจำนวนกี่เครื่อง
CycleGAN ใช้ตัวสร้างสองตัว ตัวหนึ่งสำหรับแต่ละทิศทางการแปล (A ถึง B และ B ถึง A) บวกกับตัวแยกแยะสองตัว
โดยทั่วไปแล้ว CycleGAN ใช้เครื่องแยกแยะประเภทใด
CycleGAN ใช้ตัวแยกแยะ PatchGAN ซึ่งจะตัดสินแพตช์ที่ทับซ้อนกันว่าเป็นของจริงหรือของปลอม ซึ่งส่งเสริมความสมจริงในท้องถิ่น
เหตุใดบางครั้งการสูญเสียข้อมูลประจำตัวจึงถูกเพิ่มเข้าไปใน CycleGAN
การสูญเสียข้อมูลประจำตัวจะลงโทษการเปลี่ยนแปลงที่ไม่จำเป็นเมื่อรูปภาพอยู่ในโดเมนเป้าหมายแล้ว ซึ่งช่วยรักษาสีและโทนสี