เครื่องเก็บตัวอย่าง DDPM และ DDIM
DDPM และ DDIM เป็นสองวิธีในการรันกระบวนการย้อนกลับของแบบจำลองการแพร่กระจาย โดยเปลี่ยนสัญญาณรบกวนแบบสุ่มให้เป็นภาพทีละขั้นตอน
ภาพรวม
DDPM is the original stochastic recipe; DDIM is a faster, deterministic shortcut that produces comparable images in far fewer steps.
เจาะลึก
แบบจำลองการแพร่กระจายได้รับการฝึกฝนโดยการค่อยๆ เพิ่มสัญญาณรบกวนแบบเกาส์เซียนให้กับภาพ จากนั้นจึงเรียนรู้ที่จะทำนายสัญญาณรบกวนดังกล่าว การสุ่มตัวอย่างกลับสิ่งนี้ DDPM (Denoising Diffusion Probabilistic Models, Ho et al. 2020) เดินย้อนกลับไปทุกระดับของเสียงรบกวน โดยเพิ่มสัญญาณรบกวนแบบสุ่มเล็กๆ น้อยๆ ในแต่ละขั้นตอน ดังนั้น โดยทั่วไปต้องใช้หลายร้อยถึงหนึ่งพันก้าว DDIM (Denoising Diffusion Implicit Models, Song et al. 2021) นำเครือข่ายที่ได้รับการฝึกมาเหมือนกันทุกประการกลับมาใช้ใหม่ แต่เป็นไปตามวิถีโคจรที่กำหนดขึ้นซึ่งไม่ใช่แบบ Markovian เมื่อยกเลิกการสุ่มที่ฉีดเข้าไป DDIM จะสามารถข้ามเวลาได้หลายครั้งและยังคงได้ภาพคุณภาพสูงใน 10-50 ขั้นตอน เนื่องจาก DDIM ถูกกำหนดไว้ เสียงเริ่มต้นที่เหมือนกันจึงให้ภาพเดียวกันเสมอ ช่วยให้การแก้ไขและทำซ้ำได้อย่างราบรื่น
ข้อมูลเชิงลึกทางเทคนิค
เครื่องเก็บตัวอย่างทั้งสองใช้เครือข่ายที่คาดการณ์เอปไซลอนสัญญาณรบกวนที่เพิ่มให้กับรูปภาพ ณ ไทม์สเต็ป t การอัปเดตของ DDPM จะลบเวอร์ชันที่ปรับขนาดของการทำนายนั้น แล้วเพิ่มสัญญาณรบกวนความแปรปรวนที่ดึงมาจากด้านหลัง DDIM เขียนการอัปเดตใหม่เพื่อประมาณค่าคลีนอิมเมจ x0 ก่อน จากนั้นจึงฉายซ้ำไปยังลำดับเวลาถัดไป (น้อยกว่า) โดยไม่มีคำสุ่ม พารามิเตอร์ eta ผสมผสานทั้งสอง: eta=1 กู้คืน DDPM, eta=0 ให้ DDIM ที่กำหนดโดยสมบูรณ์
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของ DDPM และ DDIM Samplers
การวิจัยตัวอย่างกำลังเร่งไปสู่การสร้างขั้นตอนเดียวหรือไม่กี่ขั้นตอน ตัวแก้ปัญหา ODE ที่มีลำดับสูงกว่า เช่น DPM-Solver และ DPM-Solver++ ได้ตัดการสุ่มตัวอย่างที่มีคุณภาพให้เหลือต่ำกว่า 20 ขั้นตอนแล้ว ในขณะที่วิธีการกลั่น (การกลั่นแบบก้าวหน้า แบบจำลองความสอดคล้อง ความสอดคล้องแฝง) บีบอัดแบบจำลองให้เป็นเครื่องกำเนิดไฟฟ้า 1-4 ขั้นตอน คาดว่า DDPM/DDIM จะยังคงเป็นบรรทัดฐานทางแนวคิด ในขณะที่ระบบการผลิตอาศัยตัวแก้ปัญหาแบบกลั่นและแบบปรับตัวสำหรับการสังเคราะห์ภาพและวิดีโอแบบเรียลไทม์บนฮาร์ดแวร์สำหรับผู้บริโภค
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างภาพการแพร่กระจายที่เสถียร โดยที่ DDIM ถูกนำเสนอเป็นตัวอย่างเริ่มต้นที่รวดเร็วสำหรับการแจ้งข้อความเป็นภาพในเครื่องมือ เช่น Automatic1111 และ ComfyUI
ไปป์ไลน์ศิลปะที่ทำซ้ำได้ซึ่งแก้ไขเมล็ดสุ่มด้วย DDIM ที่กำหนด ดังนั้นพรอมต์และเมล็ดเดียวกันจะสร้างภาพที่เหมือนกันเสมอ
การประมาณค่าพื้นที่แฝงระหว่างสองภาพอย่างราบรื่นสำหรับการปรับเปลี่ยนภาพเคลื่อนไหว เกิดขึ้นได้โดยการแมปที่กำหนดขึ้นของ DDIM จากสัญญาณรบกวนไปยังเอาต์พุต
การทำซ้ำครีเอทีฟโฆษณาอย่างรวดเร็วโดยนักออกแบบใช้การแสดงตัวอย่าง DDIM 20 ขั้นตอนเพื่อสำรวจแนวคิดก่อนที่จะดำเนินการเรนเดอร์เต็มขั้นตอนที่ช้ากว่าและมีความแม่นยำสูงกว่า
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DDPM and DDIM Samplers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ระยะเริ่มต้นFréchet
คำถามที่พบบ่อย
What is DDPM and DDIM Samplers?
DDPM และ DDIM เป็นสองวิธีในการรันกระบวนการย้อนกลับของแบบจำลองการแพร่กระจาย โดยเปลี่ยนสัญญาณรบกวนแบบสุ่มให้เป็นภาพทีละขั้นตอน DDPM เป็นสูตรสุ่มดั้งเดิม DDIM เป็นทางลัดที่รวดเร็วและกำหนดได้เองซึ่งสร้างภาพที่เทียบเคียงได้ในขั้นตอนที่น้อยกว่ามาก
ข้อได้เปรียบเชิงปฏิบัติหลักของ DDIM เหนือ DDPM คืออะไร?
DDIM เป็นไปตามวิถีโคจรที่ไม่ใช่แบบ Markovian ที่กำหนดตายตัว ซึ่งปล่อยให้มันข้ามเวลาหลายขั้น สร้างภาพที่มีคุณภาพในเวลาประมาณ 10-50 ขั้นตอน แทนที่จะเป็นหลายร้อยขั้นตอน
โครงข่ายประสาทเทียมของโมเดลการแพร่กระจายเรียนรู้ที่จะทำนายอะไรระหว่างการฝึกจริง ๆ
เครือข่ายได้รับการฝึกอบรมให้ทำนายสัญญาณรบกวนแบบเกาส์เซียน (เอปไซลอน) ที่เพิ่มในแต่ละช่วงเวลา ซึ่งทั้ง DDPM และ DDIM จะใช้เพื่อย้อนกลับกระบวนการ
เหตุใด DDIM จึงสามารถสร้างภาพที่เหมือนกันทุกประการจากสัญญาณรบกวนเริ่มต้นที่เหมือนกันทุกครั้ง
DDIM จะลดคำว่าสัญญาณรบกวนสุ่มในการอัพเดต ทำให้เส้นทางจากสัญญาณรบกวนไปยังภาพถูกกำหนดอย่างสมบูรณ์และสามารถทำซ้ำได้
ใน DDIM ค่าของพารามิเตอร์ eta ใดที่กู้คืนพฤติกรรม DDPM สุ่มดั้งเดิม
พารามิเตอร์ eta จะประมาณค่าระหว่างสองตัวอย่าง: eta=1 ให้ค่าสุ่ม DDPM เต็มรูปแบบ ในขณะที่ eta=0 ให้ DDIM ที่กำหนดโดยสมบูรณ์
โดยทั่วไป DDPM ดั้งเดิมต้องใช้ประมาณกี่ขั้นตอนสำหรับตัวอย่างคุณภาพสูง
DDPM เดินย้อนกลับทุกระดับเสียงรบกวนโดยเพิ่มความสุ่ม ดังนั้นโดยทั่วไปจึงต้องมีขั้นตอนย้อนกลับหลายร้อยถึงพันก้าว