คู่มือพื้นฐาน

แบบจำลองการแพร่กระจาย

โมเดลการแพร่กระจายจะสร้างภาพโดยการเรียนรู้ที่จะย้อนกลับกระบวนการรบกวน โดยเปลี่ยนภาพคงที่แบบสุ่มให้เป็นภาพที่มีรายละเอียดทีละขั้นตอน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

เจาะลึก

แบบจำลองการแพร่กระจายได้รับการฝึกฝนในสองทิศทาง ในกระบวนการส่งต่อ ภาพที่สะอาดจะค่อยๆ เสียหายโดยการเพิ่มสัญญาณรบกวนแบบสุ่มจำนวนเล็กน้อยจนกระทั่งกลายเป็นภาพคงที่ล้วนๆ จากนั้น แบบจำลองจะเรียนรู้สิ่งที่ตรงกันข้าม โดยเริ่มจากสัญญาณรบกวน คาดการณ์และกำจัดสัญญาณรบกวนเล็กน้อยในแต่ละขั้นตอน ทำซ้ำหลายสิบหรือหลายร้อยครั้งจนกระทั่งได้ภาพที่คมชัด เพื่อให้สามารถควบคุมได้ ข้อความแจ้งจะแนะนำแต่ละขั้นตอนการลดสัญญาณรบกวน ดังนั้น "นักบินอวกาศขี่ม้า" จึงควบคุมทิศทางคงที่ไปยังภาพนั้น ระบบสมัยใหม่ เช่น Stable Diffusion รันกระบวนการนี้ในพื้นที่แฝงที่ถูกบีบอัด แทนที่จะใช้พิกเซลแบบ Raw ทำให้เร็วขึ้นมาก เมื่อเปรียบเทียบกับ GAN โมเดลการแพร่กระจายจะฝึกความเสถียรมากกว่าและสร้างความหลากหลายมากกว่า ซึ่งเป็นเหตุผลว่าทำไมโมเดลจึงแซงหน้า GAN ในฐานะแนวทางหลักในการสร้างภาพคุณภาพสูงในช่วงปี 2022

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับสำคัญคือเครือข่ายไม่จำเป็นต้องสร้างภาพในช็อตเดียว มันเรียนรู้ที่จะทำนายเสียงที่เพิ่มเข้ามาในขั้นตอนที่กำหนดเท่านั้น ในระหว่างการฝึก ปริมาณนอยส์ที่ทราบจะถูกเพิ่มเข้าไปในภาพจริง และขอให้โมเดลประมาณค่านอยส์นั้น ความแตกต่างคือข้อผิดพลาดในการฝึก ในช่วงเวลาแห่งการสร้าง แบบจำลองจะลบสัญญาณรบกวนที่คาดการณ์ไว้ซ้ำแล้วซ้ำอีก และค่อยๆ เผยโครงสร้าง การปรับสภาพข้อความถูกแทรกผ่านความสนใจแบบข้าม และคำแนะนำแบบไม่มีตัวแยกประเภทจะขยายความแรงของข้อความแจ้งที่ควบคุมเอาต์พุต

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของแบบจำลองการแพร่กระจาย

การแพร่กระจายเป็นศิลปะสมัยใหม่ในปัจจุบันสำหรับการสร้างภาพและวิดีโอและเสียง โดยมีเครื่องมือเช่น Sora ขยายไปสู่การเคลื่อนไหว แรงผลักดันสำคัญคือความเร็ว: เทคนิคต่างๆ เช่น แบบจำลองการกลั่นและความสม่ำเสมอมีเป้าหมายที่จะลดขั้นตอนการลดสัญญาณรบกวนหลายร้อยขั้นให้เหลือเพียงขั้นตอนเดียวหรือขั้นตอนเดียว ทำให้เกิดการสร้างแบบเรียลไทม์ คาดว่าการแพร่กระจายจะขยายไปสู่เนื้อหา 3 มิติ การออกแบบทางวิทยาศาสตร์ เช่น โมเลกุลและโปรตีน และการแก้ไขที่ควบคุมได้อย่างเข้มงวด ในขณะที่ราคาถูกพอที่จะใช้งานบนโทรศัพท์ได้

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างงานศิลปะและรูปภาพต้นฉบับจากข้อความแจ้งใน Stable Diffusion, DALL-E และ Midjourney

การลงสีและการลงสีภายนอก การเติมหรือขยายบางส่วนของภาพถ่ายได้อย่างลงตัว

การสร้างวิดีโอจากข้อความในเครื่องมือเช่น OpenAI's Sora

การออกแบบโมเลกุลและโครงสร้างโปรตีนใหม่สำหรับการวิจัยการค้นคว้ายา

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ซึ่งแบบจำลองการแพร่กระจายช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

แบบจำลองการแพร่กระจายของ GLIDE

คำถามที่พบบ่อย

What is Diffusion Models?

โมเดลการแพร่กระจายจะสร้างภาพโดยการเรียนรู้ที่จะย้อนกลับกระบวนการรบกวน โดยเปลี่ยนภาพคงที่แบบสุ่มให้เป็นภาพที่มีรายละเอียดทีละขั้นตอน สิ่งเหล่านี้ขับเคลื่อนเครื่องมือแปลงข้อความเป็นรูปภาพชั้นนำในปัจจุบัน เช่น Stable Diffusion, DALL-E และ Midjourney

แนวคิดหลักเบื้องหลังวิธีที่แบบจำลองการแพร่กระจายสร้างภาพคืออะไร

แบบจำลองการแพร่กระจายเรียนรู้ที่จะกลับกระบวนการของสัญญาณรบกวน โดยเริ่มจากสัญญาณรบกวนบริสุทธิ์และการลดสัญญาณรบกวนทีละขั้นตอนจนกระทั่งได้ภาพที่ชัดเจน

ในระหว่างการฝึก โมเดลเรียนรู้อะไรเพื่อคาดการณ์ในแต่ละขั้นตอนจริงๆ

แบบจำลองจะได้รับภาพที่มีสัญญาณรบกวนและเรียนรู้ที่จะประมาณค่าสัญญาณรบกวนที่เพิ่มเข้ามา เพื่อให้สามารถลบสัญญาณรบกวนระหว่างการสร้างได้ในภายหลัง

ข้อความแจ้งส่งผลต่อรูปภาพที่สร้างขึ้นอย่างไร

การปรับสภาพข้อความ (ผ่านการเอาใจใส่และคำแนะนำ) จะกระตุ้นทุกขั้นตอนการลดสัญญาณรบกวน ดังนั้นรูปภาพที่เกิดขึ้นจึงตรงกับข้อความแจ้ง

เหตุใด Stable Diffusion จึงเรียกใช้กระบวนการใน 'พื้นที่แฝง'

การทำงานในพื้นที่แฝงที่ถูกบีบอัดแทนที่จะเป็นพิกเซลความละเอียดสูงสุดจะช่วยลดการคำนวณลงอย่างมากในขณะที่ยังคงรักษาคุณภาพไว้

ข้อได้เปรียบที่สำคัญประการหนึ่งของแบบจำลองการแพร่กระจายเหนือ GAN คืออะไร

โมเดลการแพร่กระจายหลีกเลี่ยงเกมฝ่ายตรงข้ามที่ไม่เสถียรและการล่มสลายของโหมดของ GAN ทำให้มีการฝึกอบรมที่เชื่อถือได้มากขึ้นและมีความหลากหลายมากขึ้น