คู่มือ AI แบบเห็นภาพ

VQ-VAE และค่าแฝงแบบไม่ต่อเนื่อง

VQ-VAE บีบอัดรูปภาพ เสียง หรือวิดีโอลงในตารางเล็กๆ ของโค้ดแยกที่ดึงมาจาก Codebook ที่เรียนรู้ แทนที่จะเป็นตัวเลขต่อเนื่อง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.

เจาะลึก

VQ-VAE (Vector Quantized Variational Autoencoder) เปิดตัวโดย van den Oord และเพื่อนร่วมงานที่ DeepMind ในปี 2017 คือโปรแกรมเข้ารหัสอัตโนมัติที่มีพื้นที่แฝงไม่ต่อเนื่อง ตัวเข้ารหัสจะเปลี่ยนรูปภาพให้เป็นตารางของเวกเตอร์ต่อเนื่อง จากนั้นเวกเตอร์แต่ละตัวจะถูกจัดชิดเข้ากับรายการที่ใกล้ที่สุดในสมุดโค้ดที่เรียนรู้เกี่ยวกับการฝัง (การหาปริมาณเวกเตอร์) ตัวถอดรหัสจะสร้างภาพขึ้นใหม่จากโค้ดเชิงปริมาณเหล่านั้น เนื่องจากขณะนี้ค่าแฝงเป็นคำศัพท์ที่มีจำกัดของดัชนี โมเดลที่แยกจากกันจึงสามารถเรียนรู้การกระจายตัวของดัชนีและสร้างเนื้อหาใหม่ได้ สูตรสองขั้นตอนนี้ขับเคลื่อน DALL-E 1, Jukebox สำหรับการดนตรี และ VQGAN ซึ่งเพิ่มการสูญเสียการรับรู้และความขัดแย้งสำหรับการสร้างใหม่ให้คมชัดยิ่งขึ้น VQ-VAE-2 ซ้อนกันหลายความละเอียดเพื่อสร้างภาพที่มีความเที่ยงตรงสูง

ข้อมูลเชิงลึกทางเทคนิค

ขั้นตอนการหาปริมาณ (การค้นหา argmin ใกล้บ้านเคียงที่สุด) ไม่สามารถหาความแตกต่างได้ ดังนั้น VQ-VAE จึงใช้ตัวประมาณค่าแบบตรง: การไล่ระดับสีจะถูกคัดลอกโดยตรงจากอินพุตตัวถอดรหัสกลับไปยังเอาต์พุตตัวเข้ารหัสราวกับว่าการหาปริมาณเป็นเอกลักษณ์ การฝึกอบรมรวมการสูญเสียการสร้างใหม่ การสูญเสียสมุดโค้ดที่ดึงการฝังไปยังเอาต์พุตของตัวเข้ารหัส และการสูญเสียความมุ่งมั่นที่ทำให้ตัวเข้ารหัสผูกพันกับรหัสที่เลือก ความล้มเหลวทั่วไปคือการล่มสลายของ Codebook ซึ่งมีการใช้โค้ดเพียงไม่กี่โค้ดเท่านั้น

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ VQ-VAE และ Discrete Latents

Discrete Latents เป็นศูนย์กลางในการผลักดันไปสู่โมเดลหลายรูปแบบที่รวมเป็นหนึ่งซึ่งแปลงภาพ เสียง และวิดีโอให้เป็นคำศัพท์เดียวกันกับข้อความ การปรับปรุงต่างๆ เช่น การหาปริมาณสเกลาร์ที่เหลือและจำกัด หนังสือรหัสที่ใหญ่ขึ้น และการปรับสมดุลการใช้งานที่ดีขึ้น กำลังลดการล่มสลายและเพิ่มความเที่ยงตรง เนื่องจากแบบจำลองมีเป้าหมายที่จะทำความเข้าใจและสร้างในรูปแบบต่างๆ โทเคนไนเซอร์ที่มีประสิทธิภาพซึ่งสร้างขึ้นจากแนวคิด VQ-VAE จะยังคงเป็นองค์ประกอบพื้นฐาน โดยมีการแข่งขันกันมากขึ้น และผสมผสานกับแนวทางการแพร่กระจายที่แฝงอยู่อย่างต่อเนื่อง

การใช้งานจริงในโลกแห่งความเป็นจริง

DALL-E 1 ใช้โทเค็นไนเซอร์ VQ-VAE แบบแยก ดังนั้น Transformer จึงสามารถสร้างรูปภาพเป็นลำดับของดัชนีสมุดโค้ดได้

VQGAN รวม VQ-VAE เข้ากับการสูญเสียฝ่ายตรงข้ามและการรับรู้เพื่อสร้างโทเค็นภาพที่คมชัดและมีความละเอียดสูงสำหรับการสร้างงานศิลปะ

ตู้เพลงของ OpenAI ใช้ VQ-VAE กับเสียง Raw โดยบีบอัดเพลงเป็นโค้ดแยกสำหรับการสร้างแบบจำลองเชิงกำเนิด

VQ-VAE-2 ซ้อนค่าแฝงแบบไม่ต่อเนื่องแบบลำดับชั้นเพื่อสังเคราะห์รูปภาพที่หลากหลายและมีความแม่นยำสูงซึ่งเทียบได้กับ GAN ในยุคนั้น

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQ-VAE and Discrete Latents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การผสมแฝงและการแก้ไขภาพ

คำถามที่พบบ่อย

What is VQ-VAE and Discrete Latents?

VQ-VAE บีบอัดรูปภาพ เสียง หรือวิดีโอลงในตารางเล็กๆ ของโค้ดแยกที่ดึงมาจาก Codebook ที่เรียนรู้ แทนที่จะเป็นตัวเลขต่อเนื่อง คอขวดที่ไม่ต่อเนื่องนี้ช่วยให้โมเดลลำดับอันทรงพลังเช่น Transformers ปฏิบัติต่อสื่อเสมือนเป็น 'โทเค็น' เช่นเดียวกับคำพูด

อะไรทำให้พื้นที่แฝงของ VQ-VAE แตกต่างจาก VAE มาตรฐาน

VQ-VAE แทนที่ค่าแฝงต่อเนื่องด้วยโค้ดแยกที่ดึงมาจากสมุดโค้ดที่เรียนรู้ผ่านการหาปริมาณเวกเตอร์

VQ-VAE ผ่านการไล่ระดับสีผ่านขั้นตอนการหาปริมาณที่ไม่สามารถหาความแตกต่างได้อย่างไร

ตัวประมาณค่าแบบผ่านตรงจะคัดลอกเกรเดียนต์อินพุตของตัวถอดรหัสไปยังเอาต์พุตของตัวเข้ารหัสโดยตรง โดยถือว่าการหาปริมาณเป็นข้อมูลประจำตัวสำหรับการย้อนกลับ

'codebook ล่มสลาย' คืออะไร?

การล่มสลายของ Codebook เกิดขึ้นเมื่อโมเดลอาศัยโค้ดเพียงไม่กี่โค้ด ทำให้เปลือง Codebook ส่วนใหญ่และส่งผลกระทบต่อความหลากหลาย

เหตุใดค่าแฝงแบบแยกจึงมีประโยชน์สำหรับการสร้างแบบจำลองเชิงกำเนิดด้วย Transformers

ดัชนีแยกจะสร้างคำศัพท์ที่มีจำกัด ดังนั้นโมเดลลำดับ เช่น Transformers จึงสามารถเรียนรู้และสุ่มตัวอย่างการแจกแจงของพวกมันได้เหมือนกับคำต่างๆ

VQGAN เพิ่มอะไรนอกเหนือจากสูตร VQ-VAE พื้นฐาน

VQGAN เสริม VQ-VAE ด้วยการเลือกปฏิบัติและการสูญเสียการรับรู้ ทำให้ได้โทเค็นที่สร้างขึ้นใหม่ที่มีรายละเอียดคมชัดยิ่งขึ้น