คู่มือ AI แบบเห็นภาพ

Pix2Pix การแปลภาพเป็นภาพ

Pix2Pix เป็น GAN แบบมีเงื่อนไขที่เรียนรู้ที่จะแปลรูปภาพประเภทหนึ่งไปเป็นอีกประเภทหนึ่ง เช่น เปลี่ยนภาพร่างเป็นภาพถ่าย หรือแผนที่เป็นมุมมองดาวเทียม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันได้วางสูตรทั่วไปสําหรับงานแปลภาพเป็นคู่

เจาะลึก

Pix2Pix เปิดตัวโดย Isola และเพื่อนร่วมงานในปี 2560 โดยถือว่าการแปลเป็นการสร้างแบบมีเงื่อนไข โดยตัวภาพที่นำเข้าจะเป็นเงื่อนไข ตัวกำเนิดของมันคือ U-Net ซึ่งเป็นตัวเข้ารหัส-ตัวถอดรหัสที่มีการเชื่อมต่อแบบข้ามซึ่งมีรายละเอียดระดับต่ำเช่นขอบโดยตรงจากอินพุตไปยังเอาต์พุต ตัวแยกแยะคือ PatchGAN ที่ตัดสินความสมจริงในแพทช์ท้องถิ่นขนาดเล็ก แทนที่จะเป็นภาพรวมทั้งหมด ซึ่งจะทำให้พื้นผิวคมชัดขึ้น การฝึกอบรมผสมผสานการสูญเสียฝ่ายตรงข้ามเข้ากับการสูญเสีย L1 (ความแตกต่างของพิกเซล) ดังนั้นเอาต์พุตจึงมีความสมจริงและซื่อสัตย์ต่อเป้าหมาย สิ่งที่จับได้ก็คือ Pix2Pix ต้องการข้อมูลการฝึกอบรมที่จับคู่กัน ซึ่งหมายถึงตัวอย่างอินพุตและเอาท์พุตที่ตรงกัน ซึ่งเป็นแรงบันดาลใจให้ติดตามผลเช่น CycleGAN ที่เรียนรู้จากคอลเลกชันที่ไม่มีการจับคู่

ข้อมูลเชิงลึกทางเทคนิค

การเชื่อมต่อข้าม U-Net มีความสำคัญ: ในงานแปลหลายๆ งาน โครงสร้างการแบ่งอินพุตและเอาท์พุต (ขอบ เค้าโครง) ดังนั้นการส่งคุณสมบัติที่มีความละเอียดสูงตรงๆ จะช่วยหลีกเลี่ยงการบังคับรายละเอียดทั้งหมดผ่านคอขวดที่แคบ คำ L1 จับความถูกต้องของความถี่ต่ำ (รูปร่างและสีโดยรวม) ในขณะที่ตัวแยกแยะ PatchGAN จัดการกับความสมจริงความถี่สูง (พื้นผิวที่คมชัด) การแบ่งความรับผิดชอบด้วยวิธีนี้ทำให้เอาต์พุต Pix2Pix ดูทั้งแม่นยำและคมชัด แทนที่จะเบลอ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแปลภาพเป็นภาพ Pix2Pix

Pix2Pix พิสูจน์ให้เห็นว่าสถาปัตยกรรมตัวเดียวสามารถจัดการกับปัญหาการแปลได้มากมาย และแนวคิดนั้นก็ยังคงอยู่ สายเลือดดำเนินผ่านการเรียนรู้แบบไม่มีคู่ของ CycleGAN ผู้สืบทอดที่มีความละเอียดสูงกว่า เช่น pix2pixHD และแนวทางการแพร่กระจายและ ControlNet ในปัจจุบันที่มีเงื่อนไขตามขอบ ความลึก หรือแผนที่การแบ่งส่วน เมื่อโมเดลมีลำดับความสำคัญที่แข็งแกร่งขึ้น ข้อกำหนดในการจับคู่ข้อมูลก็จะคลายตัวลง และการแปลจะมีความแม่นยำมากขึ้นและสามารถควบคุมได้มากขึ้น แต่ Pix2Pix ยังคงเป็นพื้นฐานที่ชัดเจนและมีน้ำหนักเบาสำหรับงานที่จับคู่กัน

การใช้งานจริงในโลกแห่งความเป็นจริง

การแปลงภาพร่างขอบที่วาดด้วยมือให้เป็นวัตถุเสมือนจริง เช่น กระเป๋าถือหรือรองเท้า

เปลี่ยนแผนที่ป้ายความหมายให้เป็นฉากถนนที่สมจริงสำหรับการออกแบบและการจำลอง

ปรับสีภาพถ่ายขาวดำโดยอัตโนมัติ

การแปลชิ้นส่วนแผนที่ทางอากาศเป็นภาพถ่ายดาวเทียมและด้านหลัง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Pix2Pix Image-to-Image Translation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

CycleGAN การแปลแบบไม่จับคู่

คำถามที่พบบ่อย

การแปลภาพเป็นภาพของ Pix2Pix คืออะไร?

Pix2Pix เป็น GAN แบบมีเงื่อนไขที่เรียนรู้ที่จะแปลรูปภาพประเภทหนึ่งไปเป็นอีกประเภทหนึ่ง เช่น เปลี่ยนภาพร่างเป็นภาพถ่าย หรือแผนที่เป็นมุมมองดาวเทียม ได้กำหนดสูตรทั่วไปสำหรับงานแปลแบบภาพต่อภาพแบบจับคู่กัน

Pix2Pix ต้องการข้อมูลการฝึกอบรมประเภทใด

Pix2Pix ต้องการคู่ที่ตรงกัน (เช่น ภาพร่างและภาพถ่ายที่เกี่ยวข้อง) ซึ่งเป็นเหตุผลว่าทำไม CycleGAN จึงถูกสร้างขึ้นในภายหลังสำหรับข้อมูลที่ไม่ได้จับคู่

Pix2Pix ใช้สถาปัตยกรรมตัวสร้างแบบใด

Pix2Pix ใช้ตัวเข้ารหัส-ตัวถอดรหัส U-Net ซึ่งการเชื่อมต่อแบบข้ามจะส่งรายละเอียดระดับต่ำโดยตรงจากอินพุตไปยังเอาต์พุต

ตัวแยกแยะ PatchGAN ใน Pix2Pix ประเมินอะไร

PatchGAN ตัดสินแพตช์ความสมจริงทีละแพตช์ ซึ่งส่งเสริมให้พื้นผิวมีความคมชัดและสอดคล้องกันในท้องถิ่นมากขึ้น

เหตุใด Pix2Pix จึงเพิ่มการสูญเสีย L1 ควบคู่ไปกับการสูญเสียฝ่ายตรงข้าม?

คำศัพท์ L1 บังคับใช้ความถูกต้องของความถี่ต่ำ (รูปร่างและสี) ในขณะที่ PatchGAN จัดการกับรายละเอียดความถี่สูงที่คมชัด

เหตุใดการเชื่อมต่อข้าม U-Net จึงมีประโยชน์อย่างยิ่งสำหรับงานแปล

อินพุตและเอาท์พุตมักจะใช้เค้าโครงและขอบร่วมกัน ดังนั้นการเชื่อมต่อแบบข้ามจึงมีรายละเอียดนั้นข้ามแทนที่จะบีบผ่านคอขวด