DragGAN การแก้ไขเชิงโต้ตอบ
DragGAN ให้คุณแก้ไขรูปภาพด้วยการลากจุด: จับจุดแล้วลากไปยังเป้าหมาย จากนั้นรูปภาพจะบิดเบี้ยวอย่างสมจริง เปลี่ยนท่าทาง รูปร่าง หรือการแสดงออก
ภาพรวม
It matters because it makes precise, intuitive image manipulation possible without sliders, masks, or text prompts.
เจาะลึก
DragGAN จาก Pan, Tewari, Leimkuhler และเพื่อนร่วมงานที่ Max Planck และหุ้นส่วน (SIGGRAPH 2023) ได้แนะนำการแก้ไขรูปภาพที่สร้างโดย GAN แบบโต้ตอบตามจุด ผู้ใช้วางจุด 'จัดการ' หนึ่งจุดขึ้นไปบนรูปภาพและจุด 'เป้าหมาย' ที่สอดคล้องกันในตำแหน่งที่พวกเขาควรย้าย จากนั้น DragGAN จะดันโค้ดแฝงซ้ำๆ เพื่อให้เนื้อหาภายใต้ที่จับแต่ละอันเลื่อนไปยังเป้าหมาย ในขณะที่ส่วนที่เหลือของรูปภาพยังคงสอดคล้องกัน คุณสามารถยืดขาของสัตว์ให้ยาวขึ้น ทำให้ผู้อื่นยิ้ม หมุนรถ หรือเปลี่ยนรูปทรงของทิวทัศน์ได้โดยการลาก สิ่งสำคัญที่สุดคือ การแก้ไขจะเคารพความหลากหลายของภาพที่เรียนรู้ ดังนั้นผลลัพธ์จึงคงความสมจริงแทนที่จะทำให้พิกเซลเลอะเทอะ มาสก์เสริมจะจำกัดขอบเขตที่ได้รับอนุญาตให้เคลื่อนที่ ทำให้มีการควบคุมแบบท้องถิ่นอย่างละเอียด
ข้อมูลเชิงลึกทางเทคนิค
DragGAN ทำงานในพื้นที่แฝงและฟีเจอร์ของ GAN ที่ได้รับการฝึกล่วงหน้า ใช้สองขั้นตอนสลับกัน: การควบคุมการเคลื่อนไหว ซึ่งจะเลื่อนโค้ดแฝงเพื่อให้ฟีเจอร์ต่างๆ ใกล้แฮนเดิลแต่ละอันเคลื่อนไปยังทิศทางเป้าหมาย และการติดตามจุด ซึ่งจะย้ายตำแหน่งแฮนเดิลเพื่อติดตามฟีเจอร์ที่ยึดไว้โดยใช้การค้นหาเพื่อนบ้านที่ใกล้ที่สุดในฟีเจอร์แมป การทำซ้ำขั้นตอนเหล่านี้จะทำให้ภาพเคลื่อนไปตามท่อร่วม GAN ทำให้เกิดการเปลี่ยนรูปได้อย่างราบรื่นและสมจริง
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของ DragGAN Interactive Editing
DragGAN จุดประกายการติดตามผลอย่างรวดเร็วโดยนำการควบคุมแบบลากมาสู่โมเดลการแพร่กระจาย (เช่น DragDiffusion และ FreeDrag) ซึ่งจัดการภาพถ่ายจริงและเนื้อหาที่กำหนดเองได้ดีกว่า GAN เพียงอย่างเดียว คาดว่าการแก้ไขแบบลากจะกลายเป็นเครื่องมือมาตรฐานในซอฟต์แวร์สร้างสรรค์ รวมกับการควบคุมข้อความและขอบเขต และขยายไปยังวิดีโอและ 3D เพื่อให้ผู้ใช้สามารถวางวัตถุข้ามเฟรมหรือปรับรูปร่างตาข่ายแบบโต้ตอบได้ ทั้งหมดนี้ยังคงรักษาความสมจริงของภาพไว้
การใช้งานจริงในโลกแห่งความเป็นจริง
การปรับสีหน้าของบุคคล ทิศทางการจ้องมอง หรือทรงผมโดยการลากจุดบนใบหน้า
การเปลี่ยนท่าทางและการวางแนวของสัตว์หรือยานพาหนะ เช่น การหมุนรถหรือการเปลี่ยนตำแหน่งหัวสิงโต
การปรับรูปถ่ายผลิตภัณฑ์ใหม่ (การขยายความยาว การขยาย หรือการจัดวางวัตถุ) สำหรับการจำลองการออกแบบ
ปรับแต่งภาพทิวทัศน์หรือแฟชั่นอย่างละเอียดโดยการลากรูปทรง เช่น การเปลี่ยนรูปทรงภูเขาหรือความพอดีของเสื้อผ้า
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DragGAN Interactive Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ปรับแต่งวิดีโอด้วยการตัดต่อภาพเดียว
คำถามที่พบบ่อย
What is DragGAN Interactive Editing?
DragGAN ให้คุณแก้ไขรูปภาพด้วยการลากจุด: จับจุดแล้วลากไปยังเป้าหมาย จากนั้นรูปภาพจะบิดเบี้ยวอย่างสมจริง เปลี่ยนท่าทาง รูปร่าง หรือการแสดงออก สิ่งสำคัญคือทำให้การจัดการรูปภาพมีความแม่นยำและใช้งานง่ายโดยไม่ต้องใช้แถบเลื่อน มาสก์ หรือข้อความแจ้ง
ผู้ใช้แก้ไขรูปภาพใน DragGAN ได้อย่างไร
DragGAN แก้ไขงานโดยวางจุดจับแล้วลากไปยังตำแหน่งเป้าหมาย โดยเปลี่ยนรูปตามนั้น
ขั้นตอนหลักสองขั้นตอนที่สลับกันของ DragGAN คืออะไร
DragGAN สลับการควบคุมดูแลการเคลื่อนไหว (การเคลื่อนย้ายคุณสมบัติไปยังเป้าหมาย) และการติดตามจุด (ตำแหน่งที่จับใหม่) วนซ้ำจนกว่าจะเสร็จสิ้น
เหตุใดการแก้ไข DragGAN จึงดูสมจริงแทนที่จะเปื้อน?
เนื่องจากการยักย้ายเกิดขึ้นในพื้นที่แฝงของ GAN ที่ได้รับการฝึกล่วงหน้า เอาต์พุตจึงยังคงอยู่ในรูปภาพที่สมจริงมากมาย
มาสก์เสริมในการควบคุม DragGAN คืออะไร?
มาสก์ช่วยให้ผู้ใช้จำกัดการแก้ไขเฉพาะภูมิภาคที่เลือก เพื่อให้รูปภาพที่เหลือคงเดิม
DragGAN ได้รับการนำเสนออย่างโดดเด่นที่สถานที่ใดในปี 2023
DragGAN ได้รับการเผยแพร่ที่ SIGGRAPH 2023 ซึ่งเป็นการประชุมคอมพิวเตอร์กราฟิกชั้นนำ