คู่มือ AI แบบเห็นภาพ

Stable Diffusion

Stable Diffusion คือโมเดลการแปลงข้อความเป็นรูปภาพแบบโอเพ่นซอร์ส ซึ่งเปิดตัวโดย Stability AI ในปี 2022 ที่สร้างภาพโดยค่อยๆ ขจัดสัญญาณรบกวนออกจากจุดเริ่มต้นแบบสุ่ม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

เจาะลึก

โมเดลการแพร่กระจายเรียนรู้ที่จะย้อนกลับกระบวนการรบกวน ในระหว่างการฝึก รูปภาพจริงจะมีสัญญาณรบกวนแบบสุ่มเพิ่มทีละขั้นตอนจนกระทั่งกลายเป็นภาพนิ่ง แบบจำลองเรียนรู้ที่จะทำนายและลบสัญญาณรบกวนนั้น ในการสร้างมันเริ่มต้นจากสัญญาณรบกวนบริสุทธิ์และ denoise ซ้ำๆ จนกระทั่งภาพที่สอดคล้องกันปรากฏขึ้น ตามคำแนะนำของข้อความของคุณ เคล็ดลับประสิทธิภาพที่สำคัญของ Stable Diffusion คือส่วนที่ 'แฝง': แทนที่จะทำงานกับพิกเซลเต็มความละเอียด มันจะบีบอัดรูปภาพลงในพื้นที่แฝงที่เล็กลงโดยใช้ตัวเข้ารหัสอัตโนมัติแบบแปรผัน รันการลดสัญญาณรบกวนแบบช้าๆ จากนั้นถอดรหัสกลับเป็นพิกเซล นี่คือเหตุผลว่าทำไมจึงสามารถทำงานบน GPU สำหรับเล่นเกมทั่วไป แทนที่จะเป็นศูนย์ข้อมูล ตัวเข้ารหัสข้อความ (CLIP ในเวอร์ชันแรกๆ) จะแปลงข้อความแจ้งของคุณเป็นคำแนะนำ และ U-Net จะทำหน้าที่ลดสัญญาณรบกวน น้ำหนักแบบเปิดทำให้มี ControlNet, การปรับแต่ง LoRA และเครื่องมือสร้างสรรค์จำนวนนับไม่ถ้วน

ข้อมูลเชิงลึกทางเทคนิค

การแพร่กระจายที่เสถียรคือแบบจำลองการแพร่กระจายแฝง โปรแกรมเข้ารหัสอัตโนมัติจะย่อขนาดรูปภาพขนาด 512x512 ลงในตารางแฝงที่มีขนาดกะทัดรัด ช่วยลดการประมวลผลลงอย่างมาก U-Net ได้รับการฝึกอบรมให้คาดการณ์สัญญาณรบกวนที่เพิ่มขึ้นในแต่ละช่วงเวลา โดยมีเงื่อนไขกับข้อความที่ฝังผ่านความสนใจแบบข้าม คำแนะนำแบบไม่มีตัวแยกประเภทช่วยให้คุณกำหนดได้ว่ารูปภาพเป็นไปตามข้อความแจ้งมากน้อยเพียงใด โดยการผสมผสานการคาดเดาแบบมีเงื่อนไขและไม่มีเงื่อนไข ในการอนุมาน ตัวเก็บตัวอย่าง (เช่น DDIM หรือออยเลอร์) จะดำเนินการตามจำนวนขั้นตอนการลดสัญญาณรบกวนที่เลือก โดยทั่วไปขั้นตอนที่มากขึ้นหมายถึงผลลัพธ์ที่สะอาดขึ้นโดยแลกกับความเร็ว

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแพร่กระจายที่มีเสถียรภาพ

ระบบนิเวศแบบเปิดมีการเร่งความเร็วอย่างต่อเนื่อง: สถาปัตยกรรมรุ่นใหม่ (รวมถึงการแพร่กระจายที่ใช้หม้อแปลงไฟฟ้า และเครื่องเก็บตัวอย่างแบบไม่กี่ขั้นตอนหรือแบบกลั่นที่เร็วขึ้น) ลดการผลิตจากหลายสิบขั้นตอนเหลือเพียงหนึ่งหรือสองขั้นตอน ทำให้สามารถสร้างสรรค์ผลงานได้เกือบจะเรียลไทม์ คาดหวังการแสดงข้อความที่แข็งแกร่งขึ้น การยึดเกาะที่รวดเร็วยิ่งขึ้น และการแก้ไขภาพที่ราบรื่น รวมถึงส่วนขยายวิดีโอและ 3D Open Weight จะช่วยกระตุ้นการปรับแต่งเฉพาะทางต่อไป แต่ยังทำให้การถกเถียงกันเรื่องความยินยอมของข้อมูลการฝึกอบรม ดีพเฟค และลายน้ำเพิ่มมากขึ้น ดังนั้นเครื่องมือการตรวจจับและแหล่งที่มาจะเติบโตไปพร้อมกับโมเดลต่างๆ

การใช้งานจริงในโลกแห่งความเป็นจริง

ศิลปินและมือสมัครเล่นสร้างคอนเซ็ปต์อาร์ตและภาพประกอบในเครื่องด้วย GPU ของตนเองพร้อมการปรับแต่ง LoRA แบบกำหนดเอง

การใช้ ControlNet เพื่อจำกัดการสร้างด้วยโครงกระดูกท่าทาง แผนที่ความลึก หรือภาพร่างขอบเพื่อการจัดองค์ประกอบที่แม่นยำ

การลงสีและการลงสีภายนอกเพื่อแก้ไขรูปภาพ ลบวัตถุ หรือขยายฉากให้เกินขอบเขตดั้งเดิม

สตูดิโอเกมอินดี้และนักออกแบบที่ผลิตพื้นผิว มูดบอร์ด และรูปแบบเนื้อหาต่างๆ อย่างรวดเร็วและราคาถูก

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแพร่กระจายวิดีโอที่เสถียร

คำถามที่พบบ่อย

What is Stable Diffusion?

Stable Diffusion คือโมเดลการแปลงข้อความเป็นรูปภาพแบบโอเพ่นซอร์ส ซึ่งเปิดตัวโดย Stability AI ในปี 2022 ที่สร้างภาพโดยค่อยๆ ขจัดสัญญาณรบกวนออกจากจุดเริ่มต้นแบบสุ่ม เนื่องจากเปิดกว้างและใช้งานได้บน GPU สำหรับผู้บริโภค จึงจุดประกายชุมชนขนาดใหญ่ที่มีเครื่องมือ การปรับแต่ง และแอปต่างๆ

ในระดับสูง แบบจำลองการแพร่กระจายจะสร้างภาพได้อย่างไร

แบบจำลองการแพร่กระจายเรียนรู้ที่จะย้อนกลับกระบวนการที่มีสัญญาณรบกวน โดยเริ่มจากสัญญาณรบกวน พวกมันจะปฏิเสธซ้ำๆ จนกระทั่งได้ภาพที่สอดคล้องกันปรากฏขึ้น

อะไรทำให้ Stable Diffusion มีประสิทธิภาพเพียงพอที่จะทำงานบน GPU ทั่วไป

Stable Diffusion เป็นรูปแบบการแพร่กระจายแฝง: ตัวเข้ารหัสอัตโนมัติจะบีบอัดภาพเพื่อให้การลดสัญญาณรบกวนหนักทำงานในพื้นที่แฝงที่เล็กลง

ข้อความแจ้งของคุณส่งผลต่อรูปภาพที่สร้างขึ้นอย่างไร

ตัวเข้ารหัสข้อความจะแปลงพรอมต์เป็นการฝังที่กำหนดเงื่อนไข U-Net ผ่านการให้ความสนใจแบบข้าม และควบคุมผลลัพธ์

คำแนะนำแบบไม่มีตัวแยกประเภทช่วยให้คุณควบคุมอะไรได้บ้าง

คำแนะนำแบบไม่มีตัวแยกประเภทผสมการคาดการณ์แบบมีเงื่อนไขและแบบไม่มีเงื่อนไข ช่วยให้คุณสามารถเปลี่ยนการยึดมั่นในทันทีขึ้นหรือลงได้

เหตุใด Stable Diffusion จึงจุดประกายระบบนิเวศขนาดใหญ่ของเครื่องมือ เช่น ControlNet และ LoRA

Open Weight ช่วยให้ชุมชนปรับแต่งและขยายโมเดลได้ โดยผลิตส่วนเสริม เช่น ControlNet และอะแดปเตอร์ LoRA น้ำหนักเบา