ภาพที่ 2 และการกระจายที่ปรับรางวัลแล้ว
Imagen 2 คือโมเดลข้อความเป็นรูปภาพที่ใช้การแพร่กระจายตามภาพเหมือนจริงของ Google ซึ่งได้รับการปรับแต่งด้วยการปรับรางวัลเพื่อให้ผลลัพธ์ตรงกับสิ่งที่ผู้คนต้องการจริงๆ มากขึ้น
ภาพรวม
It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.
เจาะลึก
Imagen 2 สร้างจากสูตร Imagen ดั้งเดิม: โมเดลภาษาแช่แข็งขนาดใหญ่จะเข้ารหัสข้อความแจ้ง และโมเดลการแพร่กระจายที่เรียงซ้อนจะเปลี่ยนสัญญาณรบกวนแบบสุ่มให้เป็นภาพที่มีรายละเอียด ในขณะที่ยังคงรักษาข้อความนั้นไว้ การเพิ่มพาดหัวคือการปรับรางวัล โดยที่คะแนนโมเดลรางวัลที่เรียนรู้จะสร้างภาพที่มีคุณภาพ เช่น การจัดตำแหน่งที่รวดเร็ว สุนทรียภาพ และความสมจริง และโมเดลการแพร่กระจายได้รับการปรับแต่งอย่างละเอียดเพื่อให้ได้ผลลัพธ์ที่ได้คะแนนสูงขึ้น สิ่งนี้สะท้อนการเรียนรู้แบบเสริมแรงจากผลตอบรับของมนุษย์ที่ใช้ในแบบจำลองภาษา Imagen 2 ปรับปรุงความสมจริงของภาพ การสะกดข้อความในภาพที่เชื่อถือได้มากขึ้น การรองรับการแจ้งเตือนหลายภาษา และการจัดการวัตถุที่ยุ่งยาก เช่น มือและใบหน้าได้ดียิ่งขึ้น นอกจากนี้ยังเพิ่มการลงสีและการลงสีภายนอก และ Google จับคู่กับเครื่องมือใส่ลายน้ำ SynthID เพื่อทำเครื่องหมายรูปภาพที่สร้างโดย AI อย่างมองไม่เห็น มันขับเคลื่อนฟีเจอร์ต่างๆ ในผลิตภัณฑ์ Google และประสบการณ์ ImageFX
ข้อมูลเชิงลึกทางเทคนิค
การแพร่กระจายเรียนรู้ที่จะย้อนกลับกระบวนการที่ทำให้เกิดสัญญาณรบกวน โดยค่อยๆ ลดสัญญาณรบกวนในสนามสุ่มให้เป็นภาพที่นำโดยการฝังข้อความ การปรับรางวัลอยู่ด้านบน: โมเดลการให้รางวัลที่ได้รับการฝึกตามความชอบของมนุษย์ จะให้สัญญาณที่ดันโมเดลการแพร่กระจายไปสู่ผลลัพธ์ที่ผู้คนให้คะแนนสูงขึ้น คล้ายกับ RLHF สำหรับข้อความ เมื่อรวมกับคำแนะนำที่ไม่ต้องใช้ตัวแยกประเภท ซึ่งรักษาสมดุลระหว่างความซื่อสัตย์กับความหลากหลาย ช่วยให้ Imagen 2 ปรับให้เหมาะสมโดยตรงสำหรับคุณภาพการรับรู้และการจัดแนว แทนที่จะจับคู่เฉพาะการกระจายการฝึกเท่านั้น
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของ Imagen 2 และการกระจายที่ปรับตามรางวัล
การแพร่กระจายที่ปรับรางวัลแล้วกำลังกลายเป็นเส้นทางเริ่มต้นสู่การสร้างความเที่ยงตรงสูงและควบคุมได้ และสัญญาณการให้รางวัลจะขยายกว้างขึ้นเพื่อครอบคลุมความปลอดภัย ข้อเท็จจริง และความยุติธรรมควบคู่ไปกับความสวยงาม คาดหวังการควบคุมการแก้ไขที่เข้มงวดยิ่งขึ้น การสุ่มตัวอย่างที่รวดเร็วยิ่งขึ้นผ่านการกลั่น และแหล่งที่มามาตรฐานผ่านการใส่ลายน้ำ เช่น SynthID เนื่องจากโมเดลการตั้งค่ามีความละเอียดอ่อนและต่อผู้ใช้มากขึ้น โปรแกรมสร้างภาพจะปรับแต่งสไตล์และเนื้อหาให้เหมาะกับรสนิยมของแต่ละบุคคลมากขึ้น ในขณะที่ยังคงติดตามได้ในขณะที่สร้างโดย AI
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างภาพทางการตลาดและผลิตภัณฑ์ด้วยข้อความในภาพที่ถูกต้อง เช่น สโลแกนหรือป้ายกำกับสั้นๆ
การลงสีเพื่อลบหรือเปลี่ยนวัตถุภายในภาพถ่ายที่มีอยู่ได้อย่างราบรื่น
การทาสีภายนอกเพื่อขยายฉากสำหรับเลย์เอาต์ แบนเนอร์ หรืออัตราส่วนภาพต่างๆ
การสร้างเนื้อหาโฆษณาหลายภาษาโดยที่ข้อความแจ้งและข้อความที่แสดงผลปรากฏในหลายภาษา โดยมีลายน้ำด้วย SynthID เพื่อระบุแหล่งที่มา
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imagen 2 and Reward-Tuned Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การแพร่กระจายวิดีโอที่เสถียร
คำถามที่พบบ่อย
What is Imagen 2 and Reward-Tuned Diffusion?
Imagen 2 คือโมเดลข้อความเป็นรูปภาพที่ใช้การแพร่กระจายตามภาพเหมือนจริงของ Google ซึ่งได้รับการปรับแต่งด้วยการปรับรางวัลเพื่อให้ผลลัพธ์ตรงกับสิ่งที่ผู้คนต้องการจริงๆ มากขึ้น เป็นเรื่องสำคัญเนื่องจากจับคู่คุณภาพของภาพที่แข็งแกร่งและการแสดงข้อความที่แม่นยำกับเทคนิคการจัดตำแหน่งที่ยืมมาจากวิธีการฝึกอบรมแชทบอท
Imagen 2 ใช้เทคนิคการสร้างแกนหลักแบบใด
Imagen 2 เป็นแบบจำลองการแพร่กระจาย: เรียนรู้ที่จะย้อนกลับกระบวนการรบกวน โดยเปลี่ยนสัญญาณรบกวนแบบสุ่มให้เป็นภาพที่มีรายละเอียดตามข้อความ
การปรับรางวัลเพิ่มอะไรให้กับ Imagen 2
การปรับรางวัล ปรับแต่งโมเดลอย่างละเอียดโดยใช้โมเดลรางวัลที่ได้รับการฝึกตามความชอบของมนุษย์ โดยดันไปสู่รูปภาพที่มีคะแนนสูงกว่าและอยู่ในแนวที่ดีกว่า
เทคนิคใดจากการฝึกอบรมโมเดลภาษาที่การปรับรางวัลของ Imagen 2 มีลักษณะคล้ายคลึงกัน
การปรับรางวัลมีแนวคิดเหมือนกับ RLHF: โมเดลรางวัลที่ได้รับการฝึกอบรมตามความชอบจะแนะนำการปรับแต่งอย่างละเอียดเพื่อให้ได้ผลลัพธ์ที่มนุษย์ชื่นชอบ
Imagen 2 เข้าใจข้อความแจ้งอย่างไร
Imagen 2 เป็นไปตามสูตรของ Imagen ในการใช้โมเดลภาษาแช่แข็งขนาดใหญ่เพื่อเข้ารหัสพรอมต์เป็นการฝัง Rich Text
SynthID ใช้ทำอะไรกับอิมเมจ Imagen 2
SynthID เพิ่มลายน้ำที่มองไม่เห็น ดังนั้นรูปภาพที่สร้างโดย AI จึงสามารถระบุแหล่งที่มาได้ แม้ว่าจะแก้ไขแล้วก็ตาม