คู่มือ AI แบบเห็นภาพ

คอนโทรลเน็ต

ControlNet เป็นส่วนเสริมที่ให้การควบคุมโครงสร้างที่แม่นยำแก่โมเดลการสร้างภาพ ช่วยให้คุณสามารถควบคุมเอาต์พุตด้วยขอบ ท่าทาง แผนที่ความลึก หรือการเขียนลวก ๆ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It turns text-to-image from a slot machine into a controllable design tool.

เจาะลึก

ControlNet เปิดตัวโดย Lvmin Zhang และเพื่อนร่วมงานในปี 2023 โดยยึดติดกับโมเดลการแพร่กระจายที่ได้รับการฝึกล่วงหน้า เช่น Stable Diffusion โดยไม่ต้องฝึกใหม่ทั้งหมด โดยจะโคลนบล็อกตัวเข้ารหัสของการแพร่กระจาย U-Net ลงในสำเนาที่ฝึกได้ จากนั้นจึงเชื่อมต่อสำเนานั้นกลับไปยังต้นฉบับที่แช่แข็งผ่านเลเยอร์ Convolution ที่กำหนดค่าเริ่มต้นเป็นศูนย์ (convs เป็นศูนย์) Convs เป็นศูนย์เหล่านี้เริ่มต้นโดยไม่มีผลกระทบ ดังนั้นการฝึกจึงเริ่มต้นจากพฤติกรรมของโมเดลดั้งเดิมและค่อยๆ เรียนรู้ที่จะเพิ่มการปรับสภาพ การปรับสภาพคือแผนที่เชิงพื้นที่: รูปภาพ Canny Edge, โครงกระดูก OpenPose, แผนที่เชิงลึก, มาสก์การแบ่งส่วน หรือภาพร่างคร่าวๆ ผลลัพธ์ก็คือรูปภาพที่สร้างขึ้นจะเป็นไปตามโครงสร้างของแผนผังควบคุม ในขณะที่ข้อความแจ้งจะกำหนดสไตล์และเนื้อหา ทำให้ศิลปินมีเลย์เอาต์ที่เชื่อถือได้และทำซ้ำได้

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับที่กำหนดคือการโน้มน้าวเป็นศูนย์ เนื่องจากเลเยอร์ที่เชื่อมต่อถูกเตรียมใช้งานให้มีน้ำหนักเป็นศูนย์ สาขา ControlNet ในตอนแรกจึงไม่เพิ่มอะไรเลย ดังนั้นแบบจำลองจึงเหมือนกับต้นฉบับเมื่อเริ่มต้นการฝึก วิธีนี้จะป้องกันเสียงรบกวนที่เป็นอันตรายซึ่งเลเยอร์ใหม่อาจแทรกเข้าไป และทำให้การปรับแต่งมีความเสถียรแม้ในชุดข้อมูลขนาดเล็ก การไล่ระดับสีไหลเข้าสู่ Conv. เป็นศูนย์ และค่อยๆ เปิดเส้นทางการปรับสภาพ และเรียนรู้การควบคุมโครงสร้างอย่างปลอดภัย

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ ControlNet

การปรับสภาพแบบ ControlNet กำลังกลายเป็นโครงสร้างพื้นฐานมาตรฐานในเครื่องมือสร้างสรรค์ โดยมีการซ้อนหลายเงื่อนไข (รวมท่าทางบวกความลึกบวกขอบ) และอะแดปเตอร์ที่เบากว่า เช่น T2I-Adapter และ IP-Adapter คาดหวังการผสานรวมที่เข้มงวดมากขึ้นในการกระจายวิดีโอเพื่อการควบคุมการเคลื่อนไหวที่สม่ำเสมอ การแก้ไขเชิงโต้ตอบแบบเรียลไทม์ และโมเดลแบบรวมที่ยอมรับการควบคุมหลายประเภทในคราวเดียว ซึ่งจะทำให้เส้นแบ่งระหว่างการร่างภาพและการเรนเดอร์ขั้นสุดท้ายไม่ชัดเจน

การใช้งานจริงในโลกแห่งความเป็นจริง

ล็อคท่าทางที่แน่นอนของตัวละครด้วยโครงกระดูก OpenPose ในขณะที่เปลี่ยนเสื้อผ้าและพื้นหลังผ่านข้อความแจ้ง

การใช้แผนที่ Canny Edge เพื่อจัดรูปแบบภาพถ่ายอาคารใหม่โดยยังคงรักษาเส้นสายทางสถาปัตยกรรมที่แม่นยำ

เปลี่ยนข้อความที่วาดด้วยมือคร่าวๆ ให้เป็นภาพประกอบที่สวยงามสำหรับคอนเซ็ปต์อาร์ตและสตอรี่บอร์ด

การใช้แผนที่เชิงลึกเพื่อให้ฉากที่สร้างขึ้นเป็นไปตามเค้าโครง 3 มิติสำหรับการเรนเดอร์ผลิตภัณฑ์และการจำลองการออกแบบภายใน

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ControlNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is ControlNet?

ControlNet เป็นส่วนเสริมที่ให้การควบคุมโครงสร้างที่แม่นยำแก่โมเดลการสร้างภาพ ช่วยให้คุณสามารถควบคุมเอาต์พุตด้วยขอบ ท่าทาง แผนที่ความลึก หรือการเขียนลวก ๆ มันเปลี่ยนข้อความเป็นรูปภาพจากสล็อตแมชชีนเป็นเครื่องมือออกแบบที่ควบคุมได้

ControlNet แก้ปัญหาอะไรในการสร้างภาพเป็นหลัก

ControlNet ช่วยให้ผู้ใช้กำหนดทิศทางเอาต์พุตด้วยเงื่อนไขเชิงพื้นที่ เช่น ขอบ ตำแหน่ง หรือความลึก ทำให้สามารถควบคุมการสร้างได้แทนที่จะสุ่ม

บทบาทของเลเยอร์ 'zero-convolution' ใน ControlNet คืออะไร

การโน้มน้าวใจที่เริ่มต้นเป็นศูนย์ไม่ช่วยอะไรเลยในตอนแรก ดังนั้นโมเดลจึงตรงกับต้นฉบับและเรียนรู้การปรับสภาพอย่างค่อยเป็นค่อยไปและเสถียร

ข้อใดต่อไปนี้เป็นอินพุตการปรับสภาพของ ControlNet ที่ถูกต้อง

ControlNet ใช้แผนที่เชิงพื้นที่ เช่น โครงกระดูกโพสท่า แผนที่เชิงลึก ขอบ Canny และมาสก์การแบ่งส่วนเป็นแนวทางเชิงโครงสร้าง

ControlNet เกี่ยวข้องกับโมเดลการแพร่กระจายพื้นฐาน เช่น Stable Diffusion อย่างไร

ControlNet โคลนและฝึกฝนสำเนาของตัวเข้ารหัสโดยที่ U-Net ดั้งเดิมถูกแช่แข็ง โดยรักษาความรู้ที่เรียนรู้ไว้

ในเวิร์กโฟลว์ ControlNet โดยทั่วไปแล้วอะไรจะกำหนดสไตล์และเนื้อหาในขณะที่แผนผังควบคุมจะกำหนดโครงสร้าง

ข้อความแจ้งจะควบคุมสไตล์และหัวเรื่อง ในขณะที่แผนผังควบคุมบังคับใช้เค้าโครงเชิงพื้นที่