คู่มือ AI แบบเห็นภาพ

การสร้างภาพอัตโนมัติแบบถดถอย

การสร้างภาพแบบถดถอยอัตโนมัติจะสร้างภาพทีละภาพ โดยคาดการณ์แต่ละโทเค็นจากทุกสิ่งที่สร้างขึ้นก่อนหน้านั้น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because the same next-token machinery powering language models can produce coherent, controllable images.

เจาะลึก

การสร้างภาพแบบถดถอยอัตโนมัติจะถือว่าภาพเป็นลำดับและคาดการณ์องค์ประกอบนั้นตามองค์ประกอบ โดยที่องค์ประกอบใหม่แต่ละองค์ประกอบจะถูกกำหนดเงื่อนไขจากองค์ประกอบก่อนหน้าทั้งหมด งานในช่วงแรกๆ เช่น PixelRNN และ PixelCNN คาดการณ์รูปภาพดิบทีละพิกเซล โดยสแกนทีละแถว ซึ่งช้าแต่สะอาดตามหลักทฤษฎี ระบบสมัยใหม่แทนที่จะบีบอัดรูปภาพลงในตารางของโทเค็นแยกกันโดยใช้ตัวเข้ารหัสสไตล์ VQ-VAE จากนั้น Transformer จะทำนายโทเค็นเหล่านั้นจากซ้ายไปขวา DALL-E 1 ของ OpenAI และ Parti ของ Google ทำตามสูตรนี้ โดยสร้างโทเค็นรูปภาพที่กำหนดเงื่อนไขตามข้อความแจ้งก่อนที่จะถอดรหัสกลับเป็นพิกเซล ข้อได้เปรียบที่สำคัญคือการสร้างแบบจำลองความน่าจะเป็นที่แน่นอนและสถาปัตยกรรมแบบรวมที่แชร์กับภาษา ต้นทุนเป็นไปตามลำดับและการสุ่มตัวอย่างช้า

ข้อมูลเชิงลึกทางเทคนิค

แบบจำลองจะแยกตัวประกอบความน่าจะเป็นร่วมของโทเค็นทั้งหมดเป็นผลคูณของเงื่อนไข: p(x) = ผลคูณของ p(x_i ให้ x_1...x_{i-1}) Transformer ที่มีความสนใจเชิงสาเหตุ (ปกปิด) บังคับให้แต่ละตำแหน่งเห็นเฉพาะโทเค็นก่อนหน้าเท่านั้น ในระหว่างการฝึกอบรม ระบบจะคาดการณ์โทเค็นทุกรายการพร้อมกันโดยใช้การบังคับของครู แต่ในการอนุมาน จะต้องสุ่มตัวอย่างโทเค็นทีละรายการ โดยป้อนกลับเข้าไปอีกครั้ง หนังสือโค้ดที่เรียนรู้จะแมปโทเค็นกลับไปที่แพตช์รูปภาพ ซึ่งตัวถอดรหัสจะอัปตัวอย่างเป็นพิกเซลสุดท้าย

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการสร้างภาพแบบถดถอยอัตโนมัติ

ความเร็วคือสมรภูมิกลาง เทคนิคต่างๆ เช่น การถอดรหัสโทเค็นแบบขนานและแบบสวมหน้ากาก (MaskGIT, Muse) จะสร้างโทเค็นจำนวนมากในคราวเดียว และการถอดรหัสแบบเก็งกำไรที่ยืมมาจากแบบจำลองภาษากำลังถูกปรับให้เข้ากับรูปภาพ นักวิจัยยังรวมโทเค็นข้อความและรูปภาพไว้ในแบ็คโบนแบบ autoregressive เพียงตัวเดียว เพื่อให้โมเดลหนึ่งตัวสามารถอ่านและวาดได้ ดังที่เห็นในระบบหลายรูปแบบ คาดว่าแนวคิดการถดถอยอัตโนมัติและการแพร่กระจายจะผสมผสานกันอย่างต่อเนื่อง ด้วยโมเดลไฮบริดที่จับความสามารถในการควบคุมของโทเค็นและคุณภาพของการแพร่กระจาย

การใช้งานจริงในโลกแห่งความเป็นจริง

DALL-E 1 สร้างภาพโดยการทำนายตารางของโทเค็นภาพที่แยกจากคำบรรยายแบบข้อความโดยอัตโนมัติ

Parti ของ Google ปรับขนาดตัวแปลงข้อความเป็นรูปภาพแบบถดถอยอัตโนมัติเป็นพารามิเตอร์ 2 หมื่นล้านพารามิเตอร์สำหรับฉากที่มีรายละเอียดและสมจริงในทันที

PixelCNN และ PixelRNN สาธิตการสร้างแบบพิกเซลต่อพิกเซลแบบ Raw และยังคงใช้เป็นพื้นฐานในการสอนสำหรับโมเดลที่อิงตามความน่าจะเป็น

MaskGIT และ Muse ใช้การถอดรหัสโทเค็นแบบสวมหน้ากากแบบขนานเพื่อเร่งการสังเคราะห์ภาพโดยใช้โทเค็น ขณะเดียวกันก็รักษาการฝึกแบบการถดถอยอัตโนมัติ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Autoregressive Image Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Autoregressive Image Generation?

การสร้างภาพแบบถดถอยอัตโนมัติจะสร้างภาพทีละภาพ โดยคาดการณ์แต่ละโทเค็นจากทุกสิ่งที่สร้างขึ้นก่อนหน้านั้น สิ่งสำคัญคือเนื่องจากเครื่องจักรโทเค็นถัดไปที่ขับเคลื่อนโมเดลภาษาสามารถสร้างภาพที่สอดคล้องและควบคุมได้

'การถดถอยอัตโนมัติ' หมายถึงอะไรในบริบทของการสร้างภาพ

โมเดลแบบถดถอยอัตโนมัติจะแยกตัวประกอบของรูปภาพเป็นลำดับ โดยคาดการณ์แต่ละโทเค็นหรือพิกเซลตามองค์ประกอบทั้งหมดที่สร้างขึ้นก่อนหน้านั้น

โดยทั่วไปแล้ว โมเดลรูปภาพแบบถอยหลังอัตโนมัติสมัยใหม่อย่าง DALL-E 1 จะแสดงรูปภาพก่อนที่จะคาดการณ์ได้อย่างไร

ระบบสมัยใหม่บีบอัดรูปภาพเป็นโทเค็นแยกกัน (มักจะผ่านตัวเข้ารหัสแบบ VQ-VAE) จากนั้นทำนายลำดับโทเค็นนั้นด้วย Transformer

โมเดลแรกๆ ใดที่สร้างภาพดิบครั้งละหนึ่งพิกเซล

PixelRNN และ PixelCNN เป็นผู้บุกเบิกโมเดล autoregressive ที่สแกนและคาดการณ์ภาพทีละพิกเซล

กลไกใดที่ทำให้แน่ใจได้ว่า Transformer จะเข้าร่วมกับโทเค็นก่อนหน้านี้เท่านั้นในระหว่างการสร้างแบบ autoregressive

การมาสก์เชิงสาเหตุจะบล็อกแต่ละตำแหน่งจากการเข้าร่วมไปยังโทเค็นในอนาคต โดยบังคับใช้การแยกตัวประกอบจากซ้ายไปขวา

ข้อเสียเปรียบหลักในทางปฏิบัติของการสุ่มตัวอย่างภาพอัตโนมัติคืออะไร?

เนื่องจากแต่ละโทเค็นขึ้นอยู่กับโทเค็นก่อนหน้า การอนุมานจึงต้องเรียกใช้โทเค็นทีละโทเค็น ซึ่งทำให้การสร้างค่อนข้างช้า