คู่มือ AI แบบเห็นภาพ

การแก้ไขแบบเน้นความสนใจแบบทันทีทันใด

พร้อมท์ถึงพร้อมท์แก้ไขรูปภาพที่สร้างขึ้นโดยปรับแต่งข้อความพร้อมท์ในขณะที่นำแผนผังความสนใจภายในของโมเดลกลับมาใช้ใหม่ ดังนั้นการเปลี่ยนคำเดียวจะสลับองค์ประกอบนั้นในขณะที่ยังคงรักษาส่วนที่เหลือของฉากไว้เหมือนเดิม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันคือการแก้ไขผ่านคํา ไม่ใช่แค่พิกเซล

เจาะลึก

Prompt-to-Prompt (Hertz et al., 2022) เป็นเทคนิคที่ไม่ต้องใช้การฝึกอบรมสำหรับการแก้ไขโดยใช้ข้อความในโมเดลการแพร่กระจาย ข้อมูลเชิงลึกที่สำคัญคือแผนที่การสนใจข้ามซึ่งบอกแบบจำลองว่าแต่ละคำควรมีอิทธิพลต่อขอบเขตของภาพอย่างไร เข้ารหัสเค้าโครงเชิงพื้นที่ของฉาก เมื่อคุณสร้างภาพใหม่ด้วยพรอมต์ที่ปรับเปลี่ยนเล็กน้อย วิธีการนี้จะแทรกแผนที่ความสนใจของพรอมต์ดั้งเดิมลงในการเรียกใช้ใหม่ การแทนที่คำ เช่น 'จักรยาน' ด้วย 'รถจักรยานยนต์' จะสลับวัตถุนั้นโดยยังคงรักษาองค์ประกอบและพื้นหลังไว้ การเพิ่มคำจะดึงความสนใจเฉพาะโทเค็นที่ไม่เปลี่ยนแปลง ดังนั้นแอตทริบิวต์ใหม่จะปรากฏขึ้นโดยไม่ต้องสับเปลี่ยนทุกอย่าง คุณยังสามารถปรับความสนใจของโทเค็นเพื่อเพิ่มหรือลดผลกระทบของโทเค็นได้ เนื่องจากไม่จำเป็นต้องปรับแต่งหรือมาสก์ จึงกลายเป็นองค์ประกอบพื้นฐานสำหรับวิธีการแก้ไขในภายหลัง รวมถึงการสร้างข้อมูลของ InstructPix2Pix

ข้อมูลเชิงลึกทางเทคนิค

ในระหว่างการลดสัญญาณรบกวน การคำนวณแบบข้ามความสนใจสำหรับแต่ละโทเค็น แผนที่เชิงพื้นที่ของตำแหน่งที่โทเค็นอยู่ในรูปภาพ Prompt-to-Prompt คัดลอกแผนที่เหล่านี้จากรุ่นดั้งเดิมไปยังแผนที่ที่แก้ไขแล้วสำหรับโทเค็นที่แชร์ สำหรับการสลับคำจะจับคู่ความสนใจระหว่างโทเค็นที่เกี่ยวข้อง สำหรับคำเพิ่มเติม มันจะรักษาแผนที่เก่าและปล่อยให้โทเค็นใหม่สร้างความสนใจใหม่เท่านั้น การถ่วงน้ำหนักใหม่เพียงแค่ปรับขนาดความสนใจของโทเค็น ทำให้อิทธิพลทางการมองเห็นรุนแรงขึ้นหรือปิดเสียงลง

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแก้ไขแบบเน้นความสนใจแบบทันทีทันใด

การจัดการความสนใจแบบข้ามความสนใจในขณะนี้เป็นรากฐานของเครื่องมือสร้างรุ่นที่ควบคุมได้ทั้งหมด และแนวคิดดังกล่าวขยายไปสู่การควบคุมความสนใจในสถาปัตยกรรมรุ่นใหม่และการแพร่กระจายวิดีโอเพื่อการแก้ไขที่สอดคล้องกันชั่วคราว คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับการแก้ไขภาพจริงผ่านการกลับด้าน การจัดการการเปลี่ยนแปลงโครงสร้างขนาดใหญ่ที่มีประสิทธิภาพมากขึ้น และการใช้งานร่วมกับโมเดลคำสั่ง เพื่อให้เทคนิคการดึงดูดความสนใจทำงานอย่างมองไม่เห็นภายใต้อินเทอร์เฟซภาษาธรรมชาติที่เรียบง่าย

การใช้งานจริงในโลกแห่งความเป็นจริง

นักออกแบบเปลี่ยน 'รถสีแดงบนถนน' เป็น 'รถสีน้ำเงินบนถนน' และคงเค้าโครงฉากเดิมไว้

นักวาดภาพประกอบปรับน้ำหนักของคำว่า 'เต็มไปด้วยหิมะ' เพื่อทำให้ภูมิทัศน์ดูหนาวเย็นมากขึ้นเรื่อยๆ ในรูปแบบต่างๆ

นักเล่าเรื่องเปลี่ยน 'สิงโต' เป็น 'เสือ' เพื่อรักษาท่าทางและพื้นหลังที่เหมือนกันสำหรับเอกสารตัวละคร

นักวิจัยใช้มันเพื่อสร้างภาพก่อน/หลังที่จับคู่กันเป็นข้อมูลการฝึกอบรมสำหรับโปรแกรมแก้ไขที่ปฏิบัติตามคำสั่ง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt-to-Prompt Cross-Attention Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

การแก้ไขความสนใจข้ามแบบ Prompt-to-Prompt คืออะไร?

พร้อมท์ถึงพร้อมท์แก้ไขรูปภาพที่สร้างขึ้นโดยปรับแต่งข้อความพร้อมท์ในขณะที่นำแผนผังความสนใจภายในของโมเดลกลับมาใช้ใหม่ ดังนั้นการเปลี่ยนคำเดียวจะสลับองค์ประกอบนั้นในขณะที่ยังคงรักษาส่วนที่เหลือของฉากไว้เหมือนเดิม เป็นการแก้ไขด้วยคำพูด ไม่ใช่พิกเซล

ข้อมูลภายในใดบ้างที่ Prompt-to-Prompt นำมาใช้ซ้ำเพื่อรักษาฉาก

แผนที่ที่มีความสนใจข้ามกันจะเข้ารหัสโดยที่แต่ละคำมีอิทธิพลต่อภาพ ดังนั้นการนำคำเหล่านั้นกลับมาใช้ใหม่จะรักษาเค้าโครงให้สอดคล้องกันระหว่างการแก้ไข

Prompt-to-Prompt จำเป็นต้องมีการปรับแต่งโมเดลอย่างละเอียดหรือไม่

โดยจะบิดเบือนความสนใจ ณ เวลาอนุมาน และไม่ต้องการการฝึกอบรมเพิ่มเติม

การปรับน้ำหนักความสนใจของโทเค็นทำให้สำเร็จอะไร?

การปรับขนาดค่าความสนใจของโทเค็นจะเข้มข้นขึ้นหรือปิดเสียงว่าแนวคิดนั้นปรากฏชัดเจนเพียงใด

เหตุใด Prompt-to-Prompt จึงถือเป็นเทคนิคพื้นฐาน

การจัดการความสนใจโดยปราศจากการฝึกอบรมกลายเป็นองค์ประกอบสำคัญที่นำกลับมาใช้ใหม่ในการวิจัยด้านการแก้ไขที่ตามมา