คู่มือ AI แบบเห็นภาพ

InstructPix2Pix การแก้ไขคำสั่ง

InstructPix2Pix ให้คุณแก้ไขรูปภาพโดยพิมพ์คำสั่งธรรมดา เช่น 'ทำให้เป็นฤดูหนาว' หรือ 'เปลี่ยนแมวให้เป็นสุนัข' โดยไม่ต้องใช้หน้ากากหรือเครื่องมือเลือก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It taught a diffusion model to follow editing instructions directly.

เจาะลึก

InstructPix2Pix (Brooks et al., 2023) เป็นโมเดลการแพร่กระจายที่ได้รับการปรับแต่งอย่างละเอียดเพื่อนำภาพอินพุตบวกคำสั่งข้อความ และส่งออกภาพที่แก้ไขแล้วในการส่งต่อเพียงครั้งเดียว เคล็ดลับอันชาญฉลาดของมันคือข้อมูลการฝึกอบรม: ผู้เขียนใช้ GPT-3 เพื่อสร้างคู่คำบรรยายก่อนและหลัง จากนั้นใช้ Prompt-to-Prompt พร้อม Stable Diffusion เพื่อสังเคราะห์การจับคู่ก่อน/หลังคู่รูปภาพ นั่นทำให้พวกเขามีชุดข้อมูลขนาดใหญ่ (รูปภาพต้นฉบับ คำแนะนำ ภาพที่แก้ไข) ที่ต้องฝึกฝนเพิ่มขึ้นเป็นสามเท่า โดยไม่ต้องติดป้ายกำกับด้วยตนเอง เนื่องจากคำแนะนำอธิบายถึงการเปลี่ยนแปลงมากกว่าฉากทั้งหมด โมเดลจึงเก็บส่วนที่ไม่ได้กล่าวถึงของภาพไว้ ใช้ระดับการนำทางสองระดับ ระดับหนึ่งสำหรับความใกล้เคียงของคำแนะนำ และอีกระดับสำหรับความซื่อสัตย์ในการยึดติดกับภาพต้นฉบับ ทำให้ผู้ใช้สามารถแลกเปลี่ยนความแข็งแกร่งในการแก้ไขกับความเที่ยงตรงได้

ข้อมูลเชิงลึกทางเทคนิค

เงื่อนไขของโมเดลทั้งบนอิมเมจต้นฉบับและคำสั่ง โดยใช้คำแนะนำแบบไม่มีตัวแยกประเภทตลอดสองแกน สเกลหนึ่งจะชั่งน้ำหนักคำสั่งข้อความ ส่วนอีกสเกลจะชั่งน้ำหนักรูปภาพอินพุต การเพิ่มขนาดภาพจะช่วยรักษาต้นฉบับให้มากขึ้น ในขณะที่การเพิ่มขนาดข้อความจะทำให้การแก้ไขมีความเข้มงวดมากขึ้น คำแนะนำแบบคู่นี้คือสิ่งที่ช่วยให้คำสั่งทั่วไปคำสั่งเดียวสามารถเปลี่ยนแง่มุมหนึ่งได้อย่างน่าเชื่อถือ ในขณะที่ปล่อยให้ส่วนที่เหลือของรูปภาพสามารถจดจำได้

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแก้ไขคำสั่ง InstructPix2Pix

การแก้ไขตามคำสั่งกำลังกลายเป็นอินเทอร์เฟซเริ่มต้นสำหรับเครื่องมือรูปภาพ ซึ่งปัจจุบันรวมอยู่ในแอปกระแสหลักและผู้สืบทอดเช่น MagicBrush และเครื่องมือแก้ไขแบบหลายรอบที่เกิดขึ้นใหม่ คาดหวังการรักษารายละเอียดที่ดียิ่งขึ้น การจัดการคำสั่งเชิงพื้นที่ที่เชื่อถือได้ เช่น 'เลื่อนหลอดไฟไปทางซ้าย' และการขยายวิดีโออย่างราบรื่น โดยที่คำสั่งเดียวแก้ไขทั้งคลิป การเชื่อมโยงโมเดลเหล่านี้กับตัวแทนภาษาสามารถช่วยให้คุณอธิบายเซสชั่นการแก้ไขแบบเต็มด้วยการสนทนาได้

การใช้งานจริงในโลกแห่งความเป็นจริง

บล็อกเกอร์ประเภท 'เพิ่มใบไม้ในฤดูใบไม้ร่วง' เพื่อปรับภาพทิวทัศน์ในช่วงฤดูร้อนสำหรับโพสต์ตามฤดูกาล

ผู้ขายอีคอมเมิร์ซแนะนำให้ 'เปลี่ยนสีเสื้อเป็นสีกรมท่า' เพื่อสร้างรูปแบบสีของผลิตภัณฑ์ตั้งแต่ช็อตเดียว

ครูแก้ไขภาพถ่ายประวัติศาสตร์ด้วย 'เพิ่มสีสันให้กับภาพนี้' เพื่อทำให้ภาพที่เก็บถาวรขาวดำดูสดใสสำหรับบทเรียน

ผู้สร้างมีมสั่ง 'สวมแว่นกันแดดให้สุนัข' โดยไม่ต้องปิดบังหน้าสุนัขด้วยตนเอง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InstructPix2Pix Instruction Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

DragGAN การแก้ไขเชิงโต้ตอบ

คำถามที่พบบ่อย

What is InstructPix2Pix Instruction Editing?

InstructPix2Pix ให้คุณแก้ไขรูปภาพโดยพิมพ์คำสั่งธรรมดา เช่น 'ทำให้เป็นฤดูหนาว' หรือ 'เปลี่ยนแมวให้เป็นสุนัข' โดยไม่ต้องใช้หน้ากากหรือเครื่องมือเลือก โดยจะสอนโมเดลการแพร่กระจายให้ปฏิบัติตามคำแนะนำในการแก้ไขโดยตรง

คุณจะบอก InstructPix2Pix ได้อย่างไรว่าจะเปลี่ยนแปลงอะไร

คุณเพียงแค่พิมพ์คำสั่งเช่น 'make it winter'; ไม่จำเป็นต้องสวมหน้ากากหรือเลือกภูมิภาค

ข้อมูลการฝึกอบรมของ InstructPix2Pix ถูกสร้างขึ้นมาอย่างไร

ผู้เขียนได้รวมคู่คำบรรยายที่สร้างโดย GPT-3 เข้ากับการสังเคราะห์ภาพพร้อมท์ถึงพร้อมท์เพื่อสร้างคำบรรยายอัตโนมัติ

สเกลนำทางทั้งสองของ InstructPix2Pix ควบคุมอะไร

สเกลหนึ่งจะกำหนดว่าการแก้ไขจะเป็นไปตามคำสั่งมากน้อยเพียงใด ส่วนอีกอันจะควบคุมจำนวนอิมเมจต้นฉบับที่ถูกเก็บรักษาไว้

เหตุใดตัวแบบจึงมักจะปล่อยส่วนที่ไม่ได้กล่าวถึงของรูปภาพไว้ตามลำพัง

คำสั่งกำหนดเป้าหมายการเปลี่ยนแปลงเฉพาะ ดังนั้นโมเดลจะรักษาขอบเขตที่คำสั่งไม่ได้กล่าวถึง

InstructPix2Pix ต้องใช้การส่งต่อกี่ครั้งจึงจะแก้ไขได้

มันเป็นโมเดลการแพร่กระจายแบบมีเงื่อนไขเดียวที่นำรูปภาพและคำสั่งมารวมกันและส่งออกการแก้ไข