คู่มือ AI แบบเห็นภาพ

Parti Pathways การถ่ายภาพแบบถดถอยอัตโนมัติ

Parti (Pathways Autoregressive Text-to-Image) สร้างรูปภาพตามวิธีที่โมเดลภาษาเขียนประโยค: โทเค็นรูปภาพทีละภาพ โดยทำนายภาพถัดไปจากทั้งหมดที่เคยมีมา

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.

เจาะลึก

Parti ถือว่าการสร้างภาพเป็นปัญหาการแปลตามลำดับ เหมือนกับการแปลด้วยคอมพิวเตอร์ โทเค็นเซอร์ ViT-VQGAN จะเข้ารหัสรูปภาพเป็นลำดับแรกของโทเค็นแยกที่ดึงมาจากสมุดโค้ดที่เรียนรู้ ตัวเข้ารหัส Transformer จะอ่านข้อความแจ้ง จากนั้นตัวถอดรหัส Transformer จะสร้างโทเค็นรูปภาพแบบถดถอยอัตโนมัติ โดยแต่ละตัวมีเงื่อนไขบนข้อความและบนโทเค็นที่ปล่อยออกมาก่อนหน้านี้ หลังจากสร้างโทเค็นทั้งหมดแล้ว ตัวถอดรหัสของโทเค็นเซอร์จะสร้างพิกเซลขึ้นมาใหม่ Google ปรับขนาด Parti จาก 350 ล้านพารามิเตอร์เป็น 20 พันล้านพารามิเตอร์ และคุณภาพของภาพและการจัดแนวข้อความได้รับการปรับปรุงอย่างต่อเนื่องตามขนาด รุ่น 20B จัดการกับข้อความที่ยาวและมีองค์ประกอบ การแสดงข้อความที่อ่านง่าย และรายละเอียดเล็กๆ น้อยๆ ที่น่าเคารพ Parti ยังได้เปิดตัวเกณฑ์มาตรฐาน PartiPrompts ซึ่งเป็นชุดการแจ้งเตือนที่ท้าทายกว่า 1,600 รายการซึ่งครอบคลุมหลายประเภทและระดับความยาก

ข้อมูลเชิงลึกทางเทคนิค

คุณลักษณะการกำหนดคือการถดถอยอัตโนมัติอย่างแท้จริงเหนือโทเค็นภาพแยก: โมเดลจะแยกตัวประกอบรูปภาพเป็นผลคูณของความน่าจะเป็นของโทเค็นถัดไปแบบมีเงื่อนไข ซึ่งเหมือนกันในจิตวิญญาณของการสร้างข้อความสไตล์ GPT วิธีนี้รวมวิสัยทัศน์และภาษาไว้ภายใต้สูตรการฝึกอบรมเดียว และช่วยให้สืบทอดเทคนิคการสร้างแบบจำลองลำดับมานานหลายทศวรรษ ค่าใช้จ่ายเป็นการถอดรหัสตามลำดับ เนื่องจากต้องสร้างโทเค็นตามลำดับ ซึ่งทำให้การสร้างช้ากว่าวิธีแบบขนาน แต่จะปรับขนาดได้อย่างคาดเดาได้และได้รับประโยชน์โดยตรงจากโมเดลที่ใหญ่กว่า

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ Parti Pathways การถ่ายภาพแบบถดถอยอัตโนมัติ

การถ่ายภาพแบบ Autoregressive กำลังเพลิดเพลินกับการฟื้นฟู เนื่องจากแกนหลักเดียวกันสามารถสร้างแบบจำลองข้อความ รูปภาพ เสียง และวิดีโอเป็นสตรีมโทเค็นเดียว ทำให้เกิดแบบจำลองหลายรูปแบบที่รวมเป็นหนึ่งเดียวอย่างแท้จริง การวิจัยกำลังจัดการกับจุดอ่อนหลัก การสุ่มตัวอย่างตามลำดับที่ช้า พร้อมการถอดรหัสแบบเก็งกำไร การทำนายโทเค็นแบบขนาน และโทเค็นที่ดีขึ้น คาดหวังแกนประมวลผลอัตโนมัติภายในตัวช่วยทั่วไปที่แทรกการอ่าน การใช้เหตุผล และการสร้างภาพ และเพื่อดูกฎการปรับขนาดจะผลักดันความแม่นยำขององค์ประกอบและการแสดงข้อความในภาพที่เชื่อถือได้ให้ดียิ่งขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

การแสดงฉากหลายวัตถุที่ซับซ้อนจากคำอธิบายที่ยาว เช่น การจัดเรียงสัตว์ วัตถุ และพื้นหลังโดยเฉพาะ

การสร้างรูปภาพที่มีคำหรือสัญลักษณ์ที่อ่านง่าย โดยที่การเรียงลำดับอัตโนมัติช่วยให้สะกดข้อความได้อย่างถูกต้อง

การเปรียบเทียบและทดสอบระบบข้อความเป็นรูปภาพโดยใช้ชุด PartiPrompts ในหมวดหมู่ต่างๆ เช่น ความรู้ระดับโลกและแนวคิดเชิงนามธรรม

การสร้างภาพประกอบที่มีรายละเอียดสำหรับการแจ้งเตือนที่ต้องการการนับที่แม่นยำและความสัมพันธ์เชิงพื้นที่ระหว่างองค์ประกอบต่างๆ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parti Pathways Autoregressive Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างภาพอัตโนมัติแบบถดถอย

คำถามที่พบบ่อย

What is Parti Pathways Autoregressive Imaging?

Parti (Pathways Autoregressive Text-to-Image) สร้างรูปภาพตามวิธีที่โมเดลภาษาเขียนประโยค: โทเค็นรูปภาพทีละภาพ โดยทำนายภาพถัดไปจากทั้งหมดที่เคยมีมา สิ่งสำคัญคือเพราะมันแสดงให้เห็นว่าเพียงการปรับขนาดโมเดลลำดับก็สามารถสร้างภาพที่มีรายละเอียดน่าทึ่งและน่าเชื่อถือได้ทันที

Parti สร้างภาพได้อย่างไร?

Parti เป็นแบบ autoregressive: สร้างโทเค็นรูปภาพตามลำดับ โดยแต่ละโทเค็นมีเงื่อนไขในข้อความและบนโทเค็นที่สร้างก่อนหน้านี้

Parti ใช้การจัดเฟรมโดยรวมสำหรับงานข้อความเป็นรูปภาพอย่างไร

Parti ปฏิบัติต่อการสร้างเจนเนอเรชั่นเหมือนกับการแปลด้วยเครื่อง โดยตัวเข้ารหัสจะอ่านข้อความ และเครื่องถอดรหัสจะปล่อยโทเค็นรูปภาพ ซึ่งเป็นการตั้งค่าแบบลำดับต่อลำดับแบบคลาสสิก

การปรับขนาด Parti ให้สูงถึง 20 พันล้านพารามิเตอร์แสดงให้เห็นอะไร

เมื่อ Parti เพิ่มขึ้นจากพารามิเตอร์ 350M เป็น 20B ทั้งความเที่ยงตรงและความซื่อสัตย์ในทันทีก็ได้รับการปรับปรุง รวมถึงข้อความแจ้งการจัดองค์ประกอบที่ดีขึ้นและข้อความที่อ่านง่าย

อะไรแปลงรูปภาพเป็นโทเค็นแยกสำหรับ Parti

Parti ใช้ ViT-VQGAN เพื่อเข้ารหัสรูปภาพเป็นลำดับของโทเค็นแยกกัน จากนั้นตัวถอดรหัส Transformer จะเรียนรู้ที่จะคาดเดา

ข้อเสียเปรียบหลักของการถอดรหัสอัตโนมัติของ Parti คืออะไร

เนื่องจากแต่ละโทเค็นขึ้นอยู่กับโทเค็นก่อนหน้า การสร้างจึงเป็นลำดับและช้ากว่าวิธีแบบขนาน แม้ว่าจะมีขนาดที่คาดเดาได้ก็ตาม