คู่มือ AI แบบเห็นภาพ

Muse Masked การสร้างภาพกำเนิด

Muse เป็นโมเดลการแปลงข้อความเป็นรูปภาพจาก Google ที่สร้างรูปภาพโดยการเติมโทเค็นรูปภาพที่มาสก์ทั้งหมดในคราวเดียว ทำให้เร็วกว่าการแพร่กระจายแบบทีละขั้นตอนมาก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

เจาะลึก

Muse ทำงานในพื้นที่โทเค็นที่ไม่ต่อเนื่องของรูปภาพ VQGAN ที่ได้รับการฝึกล่วงหน้าจะเปลี่ยนรูปภาพให้เป็นตารางของโทเค็นจำนวนเต็ม เช่น คำศัพท์เกี่ยวกับการสร้างบล็อคภาพ ในระหว่างการฝึก โทเค็นเหล่านี้ส่วนใหญ่จะถูกปกปิด และ Transformer เรียนรู้ที่จะคาดเดากลับ โดยมีเงื่อนไขในการฝังข้อความจากโมเดลภาษาขนาดใหญ่ที่แช่แข็ง (T5-XXL) ในช่วงเวลาแห่งการสร้าง Muse เริ่มต้นจากตารางที่ปกปิดทั้งหมดและถอดรหัสในรอบคู่ขนาน โดยทำนายโทเค็นจำนวนมากต่อขั้นตอน และปิดบังโทเค็นที่มีความมั่นใจน้อยที่สุดอีกครั้ง การออกแบบสองขั้นตอนจะสร้างตารางโทเค็นความละเอียดต่ำก่อน จากนั้นโมเดลที่มีความละเอียดสูงสุดจะเติมตารางที่มีความละเอียดสูงกว่า เนื่องจากโทเค็นหลายสิบรายการแก้ไขพร้อมกัน โมเดลพารามิเตอร์ 900M และ 3B จึงสร้างภาพ 256 หรือ 512 พิกเซลในการส่งต่อเพียงไม่กี่ครั้งเท่านั้น

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับหลักคือการถอดรหัสแบบคู่ขนานกับการรีมาสก์ตามความมั่นใจ ซึ่งมักเรียกว่าการสุ่มตัวอย่างแบบ MaskGIT แทนที่จะทำนายโทเค็นทีละรายการ (autoregressive) หรือ denoising หลายร้อยครั้ง (การแพร่กระจาย) Muse จะทำนายโทเค็นที่ถูกปกปิดทั้งหมด เก็บโทเค็นที่มีความมั่นใจมากที่สุด และมาสก์ส่วนที่เหลืออีกครั้งในรอบถัดไป การใช้ตัวเข้ารหัสข้อความ T5-XXL แบบแช่แข็งช่วยให้เข้าใจภาษาได้ดีฟรี และการใช้งานโทเค็นแบบแยกช่วยให้โมเดลมีเหตุผลเกี่ยวกับรูปภาพที่คล้ายกับคำมากขึ้น

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ Muse Masked Generative Imaging

การถอดรหัสแบบขนานที่สวมหน้ากากชี้ไปยังตัวสร้างที่มีทั้งคุณภาพสูงและรวดเร็วอย่างแท้จริง ซึ่งจำเป็นสำหรับการแก้ไขเชิงโต้ตอบและการใช้งานบนอุปกรณ์ คาดว่าแนวคิดการคาดการณ์โทเค็นจะผสานเข้ากับวิธีการแพร่ภาพวิดีโอแบบกระจายและแบบถอยหลังอัตโนมัติ และเพิ่มประสิทธิภาพให้กับการลงสี การลงสีภายนอก และการตัดต่อแบบไร้หน้ากากในทันที เมื่อโทเค็นแบบแยกได้รับการปรับปรุง การสร้างภาพแบบมาสก์อาจขยายไปสู่วิดีโอและ 3 มิติได้อย่างชัดเจน โดยที่การถอดรหัสแบบขนานสามารถลดต้นทุนในการสร้างเฟรมหรือมุมมองจำนวนมากได้อย่างมาก

การใช้งานจริงในโลกแห่งความเป็นจริง

คอนเซ็ปต์อาร์ตและมูดบอร์ดที่รวดเร็วซึ่งศิลปินต้องการรูปภาพที่หลากหลายในเวลาไม่กี่วินาที แทนที่จะเป็นนาที

การลงสีแบบ Zero-shot เช่น การลบวัตถุออก และให้แบบจำลองเติมเต็มพื้นที่ที่ปิดบังให้สอดคล้องกับสภาพแวดล้อม

การทาสีภายนอกเพื่อขยายรูปภาพให้เกินขอบเขตดั้งเดิมสำหรับแบนเนอร์หรืออัตราส่วนภาพต่างๆ

การแก้ไขโดยไม่สวมหน้ากาก เช่น การเปลี่ยนสีของสุนัข หรือท้องฟ้าเป็นพระอาทิตย์ตกโดยการแก้ไขข้อความแจ้งและถอดรหัสโทเค็นที่ได้รับผลกระทบอีกครั้ง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ตัวเข้ารหัสอัตโนมัติที่สวมหน้ากาก

คำถามที่พบบ่อย

What is Muse Masked Generative Imaging?

Muse เป็นโมเดลการแปลงข้อความเป็นรูปภาพจาก Google ที่สร้างรูปภาพโดยการเติมโทเค็นรูปภาพที่มาสก์ทั้งหมดในคราวเดียว ทำให้เร็วกว่าการแพร่กระจายแบบทีละขั้นตอนมาก สิ่งสำคัญคือเพราะมันแสดงให้เห็นว่าคุณจะได้ภาพคุณภาพสูงและอยู่ในแนวเดียวกันโดยไม่ต้องลดสัญญาณรบกวนซ้ำๆ ที่ผู้สร้างส่วนใหญ่พึ่งพา

Muse ทำนายอะไรระหว่างการสร้างแทนที่จะลดจุดรบกวนพิกเซล

Muse ทำงานในพื้นที่โทเค็นที่ไม่ต่อเนื่อง โดยคาดการณ์โทเค็นรูปภาพที่ถูกมาสก์ที่สร้างโดยโทเค็นไนเซอร์ VQGAN แทนที่จะทำงานบนพิกเซลโดยตรง

เหตุใดโดยทั่วไป Muse จึงเร็วกว่ารุ่นการแพร่กระจายมาตรฐาน

Muse เติมโทเค็นที่สวมหน้ากากจำนวนมากพร้อมกันและต้องการการถอดรหัสเพียงไม่กี่รอบเท่านั้น ซึ่งแตกต่างจากขั้นตอนการ denoising ตามลำดับหลายขั้นตอนของการแพร่กระจาย

Muse เข้าใจข้อความแจ้งจากที่ใด

การสร้างเงื่อนไข Muse บนข้อความที่ฝังจากโมเดลภาษา T5-XXL ที่ได้รับการฝึกล่วงหน้าแบบแช่แข็ง ทำให้มีความเข้าใจภาษาที่แข็งแกร่ง

บทบาทของการรีมาสก์ตามความมั่นใจใน Muse คืออะไร?

หลังจากการทำนายแบบคู่ขนานแต่ละครั้ง Muse จะรักษาโทเค็นที่มีความมั่นใจมากที่สุดและปิดบังโทเค็นที่มีความมั่นใจน้อยที่สุดอีกครั้งเพื่อปรับแต่งในรอบต่อเนื่อง

Muse จัดการกับการสร้างภาพที่มีความละเอียดสูงกว่าได้อย่างไร?

Muse จะสร้างตารางโทเค็นความละเอียดต่ำก่อน จากนั้นโมเดลความละเอียดสูงตัวที่สองจะสร้างตารางโทเค็นที่มีความละเอียดสูงกว่า