คู่มือ AI แบบเห็นภาพ

GLIGEN การสร้างสายดิน

GLIGEN (Grounded-Language-to-Image Generation) ช่วยให้คุณควบคุมได้อย่างแม่นยำว่าวัตถุจะปรากฏที่ใดในรูปภาพที่สร้างขึ้นโดยการป้อนกล่องและป้ายกำกับขอบเขตของโมเดลควบคู่ไปกับข้อความแจ้ง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It turns vague text-to-image into precise, layout-controllable synthesis.

เจาะลึก

โมเดลข้อความเป็นรูปภาพมาตรฐานมีปัญหากับการควบคุมเชิงพื้นที่: ถามหา 'แมวทางซ้ายของสุนัข' และคุณมักจะจัดตำแหน่งผิด GLIGEN ซึ่งเปิดตัวในปี 2023 แก้ไขปัญหานี้โดยการเพิ่มอินพุตกราวด์ เช่น กล่องขอบเขตที่จับคู่กับเอนทิตีข้อความหรือรูปภาพ จุดสำคัญ หรือรูปภาพอ้างอิง สิ่งสำคัญที่สุดคือ มันจะหยุดน้ำหนักของโมเดลการแพร่กระจายแบบเดิมที่ได้รับการฝึกไว้ล่วงหน้า และอัดฉีดเลเยอร์การดูแลตนเองที่มีรั้วรอบขอบชิดที่สามารถฝึกได้ใหม่ ซึ่งจะดูดซับโทเค็นกราวด์ ซึ่งหมายความว่าจะสร้างบนโมเดลอย่าง Stable Diffusion โดยไม่ทำลายความรู้ที่เรียนมา และเกตเริ่มต้นใกล้ศูนย์ ดังนั้นพฤติกรรมของโมเดลพื้นฐานจึงได้รับการเก็บรักษาไว้ตั้งแต่เนิ่นๆ ในการฝึก ผลลัพธ์ที่ได้คือการสร้างโลกที่เปิดกว้าง: คุณสามารถวางวัตถุที่อธิบายโดยพลการในตำแหน่งที่ระบุได้ และจะสรุปแนวคิดและเค้าโครงที่ไม่เห็นในระหว่างการฝึกภาคพื้นดิน

ข้อมูลเชิงลึกทางเทคนิค

GLIGEN แสดงถึงแต่ละเอนทิตีกราวด์เป็นโทเค็นที่รวมข้อความหรือรูปภาพที่ฝังไว้กับข้อมูลเชิงพื้นที่ เช่น พิกัดสี่พิกัดของกล่องขอบเขตที่เข้ารหัสผ่านคุณสมบัติฟูริเยร์ โทเค็นการต่อสายดินเหล่านี้เข้าสู่ U-Net การแพร่กระจายแบบเยือกแข็งผ่านเลเยอร์การเอาใจใส่ตนเองแบบมีรั้วรอบขอบชิดที่เพิ่งแทรกไว้ซึ่งอยู่ระหว่างบล็อกการเอาใจใส่ตนเองและบล็อกการสนใจข้ามที่มีอยู่ ประตูที่เรียนรู้ได้ซึ่งกำหนดค่าเริ่มต้นเป็นศูนย์ จะควบคุมว่าการต่อสายดินส่งผลต่อการสร้างมากน้อยเพียงใด ดังนั้นการเพิ่มการควบคุมจะลดระดับลงอย่างสวยงามและการฝึกฝนจะมีเสถียรภาพ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ GLIGEN Grounded Generation

การสร้างแบบมีสายดินและควบคุมโครงร่างได้กำลังกลายเป็นมาตรฐานในเครื่องมือการผลิต คาดว่าการปรับสภาพเชิงพื้นที่สไตล์ GLIGEN จะผสานเข้ากับวิธีการควบคุมอื่นๆ เช่น ControlNet และการแจ้งเตือนตามภูมิภาค และขยายไปสู่วิดีโอและ 3D ซึ่งการวางตำแหน่งวัตถุในช่วงเวลาและพื้นที่มีความสำคัญมากยิ่งขึ้น เนื่องจากโมเดลใช้อินเทอร์เฟซที่ปฏิบัติตามคำแนะนำ การควบคุมเค้าโครงแบบลากและวางและกราฟฉากที่ระบุภาษาจะทำให้สามารถเข้าถึงองค์ประกอบที่แม่นยำได้โดยไม่ต้องอาศัยเทคนิคทางวิศวกรรมในทันที

การใช้งานจริงในโลกแห่งความเป็นจริง

การวางโลโก้หรือผลิตภัณฑ์ในพื้นที่ที่แน่นอนของโฆษณาที่สร้างขึ้นโดยใช้กรอบขอบเขต

การเขียนฉากที่ซับซ้อนโดยระบุตำแหน่งที่ตัวละครหรือวัตถุแต่ละตัวควรนั่งก่อนเรนเดอร์

การสร้างข้อมูลการฝึกอบรมสำหรับการตรวจจับวัตถุด้วยตำแหน่งกล่องความจริงที่ทราบ

การวาดภาพวัตถุที่อธิบายไว้ในพื้นที่ที่ผู้ใช้วาดของภาพถ่ายที่มีอยู่

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GLIGEN Grounded Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างข้อความเป็น 3D

คำถามที่พบบ่อย

What is GLIGEN Grounded Generation?

GLIGEN (Grounded-Language-to-Image Generation) ช่วยให้คุณควบคุมได้อย่างแม่นยำว่าวัตถุจะปรากฏที่ใดในรูปภาพที่สร้างขึ้นโดยการป้อนกล่องและป้ายกำกับขอบเขตของโมเดลควบคู่ไปกับข้อความแจ้ง เปลี่ยนข้อความเป็นภาพที่คลุมเครือเป็นการสังเคราะห์ที่แม่นยำและควบคุมเค้าโครงได้

GLIGEN แก้ปัญหาอะไรเป็นหลัก?

GLIGEN เพิ่มอินพุตกราวด์ เช่น กล่องขอบเขต เพื่อให้คุณสามารถควบคุมได้อย่างแม่นยำว่าวัตถุถูกวางไว้ที่ใด ซึ่งข้อความธรรมดาจะจัดการได้ไม่ดี

GLIGEN จะรักษาความรู้เกี่ยวกับแบบจำลองการแพร่กระจายที่ได้รับการฝึกไว้ล่วงหน้าอย่างไร

GLIGEN หยุดการทำงานของโมเดลพื้นฐานและอัดฉีดเลเยอร์การดูแลตนเองแบบมีรั้วรอบขอบชิดใหม่ ดังนั้นความรู้ดั้งเดิมที่เรียนรู้จึงยังคงสภาพเดิม

อินพุตกราวด์ทั่วไปที่ GLIGEN ยอมรับคืออะไร

GLIGEN รองรับการต่อสายดินผ่านกล่องขอบที่มีเอนทิตีข้อความ/รูปภาพ จุดสำคัญ และรูปภาพอ้างอิง

เหตุใดเกตในเลเยอร์ความสนใจใหม่ของ GLIGEN จึงเริ่มต้นเป็นศูนย์

เกตที่กำหนดค่าเริ่มต้นเป็นศูนย์หมายความว่าการต่อสายดินไม่มีผลกระทบตั้งแต่แรก โดยคงรุ่นดั้งเดิมไว้และรักษาความเสถียรในการฝึกในขณะที่การควบคุมเพิ่มขึ้น

การสร้างโลกที่เปิดกว้างหมายถึงอะไรใน GLIGEN

GLIGEN นำเสนอสิ่งที่นอกเหนือจากชุดการฝึกภาคพื้นดิน โดยการวางวัตถุที่บรรยายใหม่ๆ ไว้ในตำแหน่งที่ระบุ