คู่มือ AI แบบเห็นภาพ

การถอดรหัสโทเค็น MaskGIT แบบขนาน

MaskGIT สร้างภาพโดยการทำนายโทเค็นจำนวนมากในคราวเดียวและเติมโทเค็นที่มีความมั่นใจมากที่สุดก่อน แทนที่การสร้างจากซ้ายไปขวาอย่างช้าๆ ด้วยขั้นตอนคู่ขนานที่รวดเร็วเพียงไม่กี่ขั้นตอน

อ่าน 2 นาทีอัปเดตล่าสุด

เจาะลึก

MaskGIT (Masked Generative Image Transformer) จาก Google ในปี 2022 คิดใหม่เกี่ยวกับวิธีการถอดรหัสโมเดลรูปภาพที่ใช้โทเค็น หม้อแปลงรุ่นก่อนๆ เช่น VQGAN ได้สร้างโทเค็นแบบถดถอยอัตโนมัติ ทีละโทเค็นตามลำดับแรสเตอร์ ซึ่งช้าและไม่เป็นธรรมชาติสำหรับภาพ 2D MaskGIT แทนที่จะฝึกโดยมีวัตถุประสงค์การสร้างแบบจำลองที่ปกปิดเช่น BERT: ชุดย่อยสุ่มของโทเค็นรูปภาพจะถูกซ่อนไว้ และโมเดลเรียนรู้ที่จะทำนายสิ่งเหล่านั้นทั้งหมดพร้อมกันโดยใช้ความสนใจแบบสองทิศทาง ณ เวลาสร้าง มันเริ่มต้นจากตารางที่ปิดบังอย่างสมบูรณ์ และถอดรหัสด้วยจำนวนการวนซ้ำคงที่ (มักจะ 8 ถึง 12) แต่ละขั้นตอนจะคาดการณ์โทเค็นที่ปกปิดทุกรายการ เก็บการคาดการณ์ที่มีความมั่นใจสูงสุด และมาสก์ส่วนที่เหลืออีกครั้งในรอบถัดไป ซึ่งจะสร้างภาพคุณภาพสูงโดยมีขนาดขั้นตอนน้อยกว่าการถอดรหัสอัตโนมัติ

ข้อมูลเชิงลึกทางเทคนิค

องค์ประกอบที่สำคัญคือกำหนดการมาสก์ที่อิงตามความเชื่อมั่น กำหนดการโคไซน์จะกำหนดจำนวนโทเค็นที่จะเปิดเผยการวนซ้ำแต่ละครั้ง โดยเริ่มต้นอย่างช้าๆ และเร่งความเร็ว เนื่องจากความสนใจเป็นแบบสองทิศทาง ทุกโทเค็นจึงมองเห็นภาพบางส่วนทั้งหมด ดังนั้น การทำการคาดการณ์ที่มั่นใจที่สุดก่อนจึงให้ขั้นตอนต่อมากำหนดเงื่อนไขในบริบทที่ชัดเจน เหมือนกับการแก้ส่วนง่าย ๆ ของปริศนาที่อยู่ข้างหน้าส่วนที่คลุมเครือ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการถอดรหัสโทเค็นแบบขนาน MaskGIT

MaskGIT's parallel iterative decoding inspired a wave of non-autoregressive generators, including MUSE for text-to-image and masked approaches for video. รูปแบบการทำนายโทเค็นแบบขนานและการปรับแต่งในไม่กี่ขั้นตอน อยู่ระหว่าง one-shot GAN และการแพร่กระจายหลายขั้นตอน ซึ่งนำเสนอการแลกเปลี่ยนความเร็วคุณภาพที่ปรับแต่งได้ คาดว่าการถอดรหัสโทเค็นที่สวมหน้ากากจะยังคงปรากฏในตัวสร้างหลายรูปแบบที่รวดเร็วและระบบการแก้ไขที่การเติมสีในภาพวาดและการเติมแบบมีเงื่อนไขเข้ากันได้อย่างเป็นธรรมชาติ

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างภาพเต็มในขั้นตอนคู่ขนานประมาณ 8 ถึง 12 ขั้นตอน แทนที่จะใช้การคาดการณ์โทเค็นแบบถดถอยอัตโนมัติหลายร้อยรายการ

วาดภาพบริเวณที่ปกปิดของภาพถ่ายโดยทำนายเฉพาะโทเค็นที่ซ่อนอยู่พร้อมกับบริบทโดยรอบอีกครั้ง

การสังเคราะห์ภาพแบบมีเงื่อนไขระดับบน ImageNet ที่มีคุณภาพสามารถแข่งขันกับรุ่นที่ช้ากว่ามาก

ทำหน้าที่เป็นแกนหลักในการถอดรหัสสำหรับระบบข้อความเป็นรูปภาพ เช่น MUSE ของ Google ที่ต้องการการสร้างที่รวดเร็ว

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การถอดรหัสแบบขนานโครงกระดูกของความคิด

คำถามที่พบบ่อย

What is MaskGIT Parallel Token Decoding?

MaskGIT สร้างภาพโดยการทำนายโทเค็นจำนวนมากในคราวเดียวและเติมโทเค็นที่มีความมั่นใจมากที่สุดก่อน แทนที่การสร้างจากซ้ายไปขวาอย่างช้าๆ ด้วยขั้นตอนคู่ขนานที่รวดเร็วเพียงไม่กี่ขั้นตอน

MaskGIT ถอดรหัสโทเค็นรูปภาพแตกต่างจากหม้อแปลงของ VQGAN อย่างไร

MaskGIT ทำนายโทเค็นที่สวมหน้ากากทั้งหมดพร้อมกันโดยมีความสนใจแบบสองทิศทาง ซึ่งแตกต่างจากการถอดรหัสอัตโนมัติแบบถอยอัตโนมัติจากซ้ายไปขวาที่ช้าของ VQGAN

MaskGIT ยืมวัตถุประสงค์การฝึกอบรมอะไรมาจากโมเดลภาษา

MaskGIT ซ่อนเซ็ตย่อยของโทเค็นแบบสุ่มและเรียนรู้ที่จะทำนายพวกมัน ซึ่งเป็นวัตถุประสงค์ในการสร้างแบบจำลองที่ปกปิดซึ่งคล้ายกับ BERT

ในระหว่างการสร้าง MaskGIT จะใช้โทเค็นใดในการวนซ้ำแต่ละครั้ง

แต่ละขั้นตอนจะรักษาการคาดการณ์ที่มั่นใจที่สุดและมาสก์ส่วนที่เหลืออีกครั้ง ดังนั้นขั้นตอนต่อมาจะยึดตามบริบทที่เชื่อถือได้

โดยทั่วไปแล้ว MaskGIT จำเป็นต้องทำซ้ำประมาณกี่ครั้งเพื่อสร้างภาพ

MaskGIT ถอดรหัสด้วยจำนวนขั้นตอนคงที่เล็กน้อย ซึ่งมักจะอยู่ที่ 8 ถึง 12 ซึ่งน้อยกว่าแนวทางการถดถอยอัตโนมัติหรือการแพร่กระจายอย่างมาก

ตารางใดควบคุมจำนวนโทเค็นที่ MaskGIT เปิดเผยแต่ละขั้นตอน

กำหนดการโคไซน์เผยให้เห็นโทเค็นไม่กี่รายการตั้งแต่เนิ่นๆ และหลังจากนั้น ทำให้คุณภาพและความเร็วสมดุลกันในการวนซ้ำ