คู่มือ AI แบบเห็นภาพ

การสังเคราะห์ภาพ VQGAN และ Codebook

VQGAN บีบอัดรูปภาพลงในตารางของโทเค็นแยกจากหนังสือโค้ดที่เรียนรู้ โดยปล่อยให้ Transformer สร้างรูปภาพในลักษณะเดียวกับที่โมเดลภาษาสร้างข้อความ

อ่าน 2 นาทีอัปเดตล่าสุด

เจาะลึก

VQGAN ซึ่งเปิดตัวในรายงานปี 2021 เรื่อง 'Taming Transformers for High-Resolution Image Sสังเคราะห์' ได้รวมเอาตัวเข้ารหัสอัตโนมัติแบบเวกเตอร์ควอนตัม (VQVAE) เข้ากับการฝึกอบรมฝ่ายตรงข้ามและการรับรู้ ตัวเข้ารหัสจับคู่รูปภาพกับตารางเล็กๆ ของเวกเตอร์คุณลักษณะ เวกเตอร์แต่ละตัวจะถูกจัดชิดเข้ากับรายการที่ใกล้ที่สุดในสมุดรหัสที่เรียนรู้ เช่น รหัสแยก 1,024 รหัส โดยเปลี่ยนรูปภาพให้เป็นลำดับของโทเค็นจำนวนเต็ม ตัวถอดรหัสจะสร้างภาพขึ้นมาใหม่จากโทเค็นเหล่านั้น ซึ่งได้รับการฝึกฝนโดยใช้ตัวแยกแยะ GAN และการสูญเสียการรับรู้ ดังนั้น การสร้างใหม่จึงดูคมชัดมากกว่าที่จะพร่ามัว เนื่องจากขณะนี้รูปภาพเป็นลำดับโทเค็นที่แยกจากกัน หม้อแปลงแบบออโต้รีเกรสซีฟจึงสามารถสร้างแบบจำลองเหล่านั้นได้เหมือนกับภาษา โดยทำนายโทเค็นทีละรายการ VQGAN ขับเคลื่อนเครื่องมือศิลปะการแปลงข้อความเป็นรูปภาพในยุคแรกๆ ที่มีชื่อเสียงเมื่อจับคู่กับคำแนะนำของ CLIP

ข้อมูลเชิงลึกทางเทคนิค

การดำเนินการหลักคือการหาปริมาณเวกเตอร์: เอาต์พุตของตัวเข้ารหัสแบบต่อเนื่องจะถูกแทนที่ด้วยเวกเตอร์ codebook ที่ใกล้ที่สุด พร้อมด้วยตัวประมาณค่าการไล่ระดับสีแบบ 'ตรง' เพื่อให้ตัวเข้ารหัสยังสามารถเรียนรู้ได้แม้จะมีการค้นหาที่ไม่มีความแตกต่างก็ตาม การเพิ่มตัวแยก GAN แบบอิงแพตช์ที่ด้านบนของตัวเข้ารหัสอัตโนมัติคือสิ่งที่ทำให้ VQGAN ใช้ตารางโทเค็นที่เล็กกว่ามาก (เช่น 16x16) กว่า VQVAE ในขณะที่ยังคงรักษาพื้นผิวให้คมชัด ทำให้การสร้างแบบจำลองหม้อแปลงทำได้ง่าย

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ VQGAN และการสังเคราะห์ภาพ Codebook

สูตรโทเค็นแยกของ VQGAN กลายเป็นรากฐานสำหรับโมเดลรูปภาพและวิดีโอที่ใช้โทเค็น ตั้งแต่ MaskGIT ไปจนถึงระบบหลายรูปแบบที่ผสมโทเค็นรูปภาพและข้อความในหม้อแปลงตัวเดียว ขณะนี้การวิจัยได้ผลักดันไปสู่ ​​Codebook ที่ใหญ่ขึ้น มีสเกลาร์จำกัด หรือไม่มีการค้นหา ซึ่งหลีกเลี่ยงการล่มสลายของ Codebook และไปสู่โมเดลที่เป็นหนึ่งเดียว ซึ่งคำศัพท์เดียวกันครอบคลุมทั้งรูปภาพ เสียง และภาษา ทำให้สามารถใช้งานรุ่นใดก็ได้

การใช้งานจริงในโลกแห่งความเป็นจริง

การเข้ารหัสภาพถ่ายลงในตารางโทเค็นสมุดโค้ดขนาด 16x16 เพื่อให้หม้อแปลงสามารถสร้างแบบจำลองและสร้างใหม่ได้

จับคู่ VQGAN กับคำแนะนำของ CLIP เพื่อสร้างงานศิลปะ AI 'VQGAN+CLIP' แบบเหนือจริงที่แพร่ระบาดในปี 2021

การบีบอัดรูปภาพเป็นโค้ดแยกขนาดกะทัดรัดเพื่อการจัดเก็บข้อมูลที่มีประสิทธิภาพหรือการฝึกอบรมการสร้างดาวน์สตรีม

ทำหน้าที่เป็นอิมเมจโทเค็นไนเซอร์ภายในตัวสร้างที่ใช้โทเค็นขนาดใหญ่ เช่น MaskGIT และหม้อแปลงหลายรูปแบบ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

SPADE การสังเคราะห์ภาพความหมาย

คำถามที่พบบ่อย

What is VQGAN and Codebook Image Synthesis?

VQGAN บีบอัดรูปภาพลงในตารางของโทเค็นแยกจากหนังสือโค้ดที่เรียนรู้ โดยปล่อยให้ Transformer สร้างรูปภาพในลักษณะเดียวกับที่โมเดลภาษาสร้างข้อความ

VQGAN ใช้อะไรเพื่อแสดงรูปภาพเป็นโทเค็นแบบแยก

VQGAN กำหนดปริมาณคุณสมบัติตัวเข้ารหัสให้กับรายการที่ใกล้ที่สุดใน Codebook ที่เรียนรู้ โดยเปลี่ยนรูปภาพให้เป็นลำดับดัชนีโค้ดที่ไม่ต่อเนื่อง

เหตุใด VQGAN จึงเพิ่มตัวแบ่งแยก GAN ไว้ด้านบนของ VQVAE

การสูญเสียฝ่ายตรงข้ามและการรับรู้ทำให้ VQGAN สร้างภาพที่คมชัดขึ้นมาใหม่จากตารางโทเค็นขนาดกะทัดรัด ซึ่ง VQVAE เพียงอย่างเดียวมีแนวโน้มที่จะเบลอ

เมื่อรูปภาพเป็นลำดับของโทเค็น โมเดลใดที่สร้างรูปภาพใหม่

เนื่องจากรูปภาพกลายเป็นลำดับโทเค็นที่แยกจากกัน หม้อแปลงไฟฟ้าจึงสามารถสร้างแบบจำลองตามลำดับถดถอยอัตโนมัติได้ เช่นเดียวกับการสร้างข้อความ

เทคนิคใดที่ช่วยให้การไล่ระดับสีไหลผ่านขั้นตอนการหาปริมาณที่ไม่สามารถหาความแตกต่างได้

การหาปริมาณเวกเตอร์ไม่สามารถหาความแตกต่างได้ ดังนั้น VQGAN จึงใช้ตัวประมาณค่าการไล่ระดับสีแบบตรงเพื่อฝึกตัวเข้ารหัส

VQGAN ช่วยสร้างเทรนด์ศิลปะ AI อันโด่งดังอะไรในปี 2021

การจับคู่ VQGAN กับคำแนะนำของ CLIP ทำให้เกิดงานศิลปะ 'VQGAN+CLIP' ที่ได้รับการแชร์อย่างกว้างขวาง ซึ่งเป็นที่นิยมในการสร้างภาพที่ขับเคลื่อนด้วยข้อความ