สถาปัตยกรรม StyleGAN
StyleGAN เป็นเครือข่ายปฏิปักษ์ที่สร้างจาก NVIDIA ที่สร้างใบหน้าและวัตถุที่สมจริงอย่างน่าทึ่งโดยการฉีดข้อมูลสไตล์ในทุกเลเยอร์
ภาพรวม
It matters because its design gives unprecedented, disentangled control over coarse and fine image attributes.
เจาะลึก
StyleGAN แนะนำโดย Karras และคณะ ในปี 2018 ได้ออกแบบตัวสร้าง GAN ใหม่ตามแนวคิดเรื่อง 'สไตล์' แทนที่จะป้อนเวกเตอร์แบบสุ่มเข้าไปในเครือข่ายโดยตรง ก่อนอื่นจะแมปโค้ดแฝง z ผ่าน MLP 8 เลเยอร์ลงในพื้นที่ตรงกลาง W ซึ่งจะแยกปัจจัยของการแปรผันออก จากนั้นเทนเซอร์คงที่ที่เรียนรู้จะถูกอัปสุ่มตัวอย่างอย่างต่อเนื่อง และในแต่ละความละเอียด เวกเตอร์สไตล์จะปรับเปลี่ยนแผนผังฟีเจอร์ผ่าน Adaptive Instance Normalization (AdaIN) ซึ่งควบคุมคุณลักษณะตั้งแต่ท่าทาง (ชั้นหยาบ) ไปจนถึงพื้นผิว (ชั้นละเอียด) อินพุตสัญญาณรบกวนต่อชั้นจะเพิ่มรายละเอียดแบบสุ่ม เช่น กระและเส้นขนที่หลงเหลือ StyleGAN2 (2020) แทนที่ AdaIN ด้วย demodulation น้ำหนักเพื่อลบสิ่งประดิษฐ์ 'blob' และ StyleGAN3 (2021) แก้ไขนามแฝงการยึดพื้นผิวเพื่อให้ฟีเจอร์เคลื่อนไหวอย่างเป็นธรรมชาติระหว่างแอนิเมชั่น
ข้อมูลเชิงลึกทางเทคนิค
กลไกสำคัญคือการมอดูเลตตามสไตล์ เครือข่ายการทำแผนที่จะเปลี่ยน z ให้เป็น w และการเรียนรู้การแปลงความสัมพันธ์ที่เรียนรู้จะแปลง w เป็นสเกลต่อช่องสัญญาณและอคติที่ใช้กับฟีเจอร์แมปที่ทำให้เป็นมาตรฐานในแต่ละความละเอียด เนื่องจากสไตล์ทำหน้าที่ทีละชั้น คุณสามารถผสม w ของรูปภาพหนึ่งรูปภาพในเลเยอร์หยาบกับอีกรูปภาพในเลเยอร์ละเอียด ('การผสมสไตล์') เพื่อสลับท่าทางโดยยังคงรักษาพื้นผิวไว้ การดีโมดูเลชั่นของ StyleGAN2 จะพับสถิติเหล่านี้ลงในน้ำหนักการบิด โดยกำจัดสิ่งที่ทำให้เป็นมาตรฐาน
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของสถาปัตยกรรม StyleGAN
แม้ว่าโมเดลการแพร่กระจายจะนำไปสู่การสร้างข้อความเป็นรูปภาพโดยทั่วไป แต่พื้นที่แฝงที่มีโครงสร้างสูงและแก้ไขได้ (W และ W+) ของ StyleGAN ทำให้เป็นศูนย์กลางในการแก้ไขใบหน้า การจัดการคุณลักษณะ และการสังเคราะห์แบบเรียลไทม์โดยที่ GAN ยังคงทำงานได้เร็วขึ้น คาดหวังการทำงานอย่างต่อเนื่องเกี่ยวกับการผกผันของ GAN (การฉายภาพจริงลงใน W) รูปแบบการรับรู้ 3 มิติ เช่น EG3D ที่ให้มุมมองที่สอดคล้องกัน และลูกผสมที่จับคู่ค่าแฝงที่ควบคุมได้ของ StyleGAN กับการแพร่หรือตัวเปลี่ยนหม้อแปลง เพื่อสิ่งที่ดีที่สุดของทั้งสองโลก
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างใบหน้ามนุษย์ที่ไม่มีอยู่จริงเหมือนจริงเหมือนจริงอย่างไม่มีที่สิ้นสุด ตามที่จัดแสดงโดย thispersondoesnotexist.com
การแก้ไขใบหน้าตามความหมาย: เปลี่ยนอายุ การแสดงออก หรือท่าทางได้อย่างราบรื่นโดยการเคลื่อนที่ไปตามทิศทางในพื้นที่ W
การสร้างข้อมูลการฝึกอบรมสังเคราะห์และอวาตาร์เมื่อรูปภาพจริงที่ไม่ละเมิดความเป็นส่วนตัวมีน้อย
เครื่องมือทางศิลปะที่สอดแทรกหรือ 'ผสมผสานสไตล์' ระหว่างรูปภาพเพื่อผสมผสานโครงสร้างหยาบและรายละเอียดที่ละเอียด
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the StyleGAN Architecture quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
สถาปัตยกรรมยูเน็ต
คำถามที่พบบ่อย
What is StyleGAN Architecture?
StyleGAN เป็นเครือข่ายปฏิปักษ์ที่สร้างจาก NVIDIA ที่สร้างใบหน้าและวัตถุที่สมจริงอย่างน่าทึ่งโดยการฉีดข้อมูลสไตล์ในทุกเลเยอร์ สิ่งสำคัญคือเนื่องจากการออกแบบให้การควบคุมคุณลักษณะของภาพที่หยาบและละเอียดอย่างที่ไม่เคยมีมาก่อนและไม่พันกัน
จุดประสงค์ของเครือข่ายการทำแผนที่ของ StyleGAN คืออะไร?
MLP 8 เลเยอร์จับคู่ z กับ W ซึ่งเป็นพื้นที่แฝงระดับกลางที่ปัจจัยของการเปลี่ยนแปลงจะถูกแยกออกจากกันได้ดีขึ้น ช่วยให้สามารถควบคุมได้ชัดเจนยิ่งขึ้น
ใน StyleGAN ดั้งเดิม สไตล์ถูกแทรกเข้าไปในแผนผังฟีเจอร์อย่างไร
AdaIN ทำให้แผนที่คุณลักษณะเป็นมาตรฐาน จากนั้นปรับขนาดและเลื่อนโดยใช้สถิติที่ได้มาจากสไตล์ในแต่ละความละเอียด
เครือข่ายการสังเคราะห์เริ่มต้นจากอะไรแทนที่จะเป็นเวกเตอร์แฝง
StyleGAN เริ่มต้นจากการเรียนรู้อินพุตคงที่ และแทรกสไตล์และสัญญาณรบกวนในขณะที่เพิ่มตัวอย่าง แทนที่จะป้อน z โดยตรง
การปรับสไตล์ที่เลเยอร์หยาบ (ความละเอียดต่ำ) จะควบคุมอะไรเป็นหลัก
ชั้นหยาบจะควบคุมโครงสร้างขนาดใหญ่ เช่น ท่าทางและรูปร่างโดยรวม ในขณะที่ชั้นที่ละเอียดจะจัดการกับพื้นผิวและรายละเอียดเล็กๆ น้อยๆ
StyleGAN2 แก้ไขปัญหาอะไรเมื่อเทียบกับต้นฉบับ
StyleGAN2 แทนที่ AdaIN ด้วย demodulation น้ำหนัก ลบสิ่งแปลกปลอมแบบหยด/หยด และปรับปรุงคุณภาพของภาพ