แบบจำลองการแพร่กระจายแฝง
โมเดลการแพร่กระจายแฝงจะสร้างภาพโดยการรันกระบวนการแพร่กระจายในพื้นที่แฝงที่ถูกบีบอัด แทนที่จะเป็นพิกเซลดิบ ซึ่งช่วยลดต้นทุนการประมวลผลลงอย่างมาก
ภาพรวม
They are the engine behind Stable Diffusion and most modern open-source image generators.
เจาะลึก
แบบจำลองการแพร่กระจายแบบมาตรฐานเรียนรู้ที่จะย้อนกลับกระบวนการที่มีสัญญาณรบกวน โดยเริ่มต้นจากสัญญาณรบกวนบริสุทธิ์และค่อยๆ ลดสัญญาณรบกวนลงในภาพ การดำเนินการนี้กับพิกเซลโดยตรงมีราคาแพงเนื่องจากรูปภาพขนาด 512x512 มีค่าหลายแสนค่า การแพร่กระจายแบบแฝงซึ่ง Rombach และเพื่อนร่วมงานแนะนำในปี 2565 มีการใช้ตัวเข้ารหัสอัตโนมัติแบบแปรผัน (VAE) ที่ได้รับการฝึกไว้ล่วงหน้าเพื่อบีบอัดรูปภาพให้เป็นตารางแฝงขนาดเล็ก (มักมีขนาด 64x64x4 หรือเล็กกว่าประมาณ 48 เท่า) จากนั้นการแพร่กระจายของ U-Net จะเรียนรู้ที่จะปฏิเสธภายในพื้นที่แฝงขนาดกะทัดรัดนั้น ซึ่งได้รับคำแนะนำจากข้อความผ่านการให้ความสนใจแบบข้าม ในที่สุดตัวถอดรหัส VAE จะสร้างพิกเซลความละเอียดเต็มขึ้นมาใหม่ การบีบอัดการรับรู้นี้จะเก็บข้อมูลที่มีความหมายทางความหมาย ในขณะที่ละทิ้งรายละเอียดที่มองไม่เห็น ทำให้การสร้างคุณภาพสูงบน GPU ของผู้บริโภคเป็นไปได้
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับสำคัญคือการแยกการบีบอัดการรับรู้ออกจากการสร้างแบบจำลองเชิงกำเนิด VAE จัดการรายละเอียดพิกเซลความถี่สูงเพียงครั้งเดียว และ U-Net จะจำลองเฉพาะการกระจายแฝงในมิติที่ต่ำกว่าเท่านั้น การปรับสภาพข้อความถูกฉีดผ่านเลเยอร์การสนใจข้าม โดยที่คุณสมบัติเชิงพื้นที่ของ U-Net ให้ความสำคัญกับการฝังโทเค็นจากตัวเข้ารหัสข้อความเช่น CLIP เนื่องจากค่าแฝงนั้นเล็กกว่าพิกเซลประมาณ 48 เท่า แต่ละขั้นตอนการลดสัญญาณรบกวนจึงมีราคาถูกกว่าอย่างมากทั้งในหน่วยความจำและ FLOP
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของแบบจำลองการแพร่กระจายแฝง
การแพร่กระจายที่แฝงอยู่ขยายออกไปนอกเหนือจากภาพไปสู่วิดีโอ (Stable Video Diffusion) เนื้อหา 3 มิติ และสเปกโตรแกรมเสียง ทั้งหมดนี้ใช้สูตรการบีบอัดแล้วลดขนาดแบบเดียวกัน การวิจัยกำลังผลักดันไปสู่ขั้นตอนการสุ่มตัวอย่างที่น้อยลงด้วยแบบจำลองการกลั่นและความสม่ำเสมอ VAE ที่ดีขึ้นซึ่งรักษาข้อความและใบหน้าที่ละเอียด และสูตรการแก้ไขการไหล เช่น สูตรใน Stable Diffusion 3 ที่จะปรับวิถีการสร้างให้ตรงเพื่อผลลัพธ์ที่รวดเร็วและคมชัดยิ่งขึ้น
การใช้งานจริงในโลกแห่งความเป็นจริง
การกระจายที่เสถียรสร้างงานศิลปะและการออกแบบแนวคิดจากข้อความแจ้งบน GPU สำหรับผู้บริโภคเพียงตัวเดียว
Adobe และ Canva ขับเคลื่อนฟีเจอร์การเติมข้อความเป็นรูปภาพและการเติมแบบสร้างสรรค์ที่สร้างบนแบ็คโบนการแพร่กระจายแฝง
สตูดิโอเกมที่ผลิตแผนที่พื้นผิว สไปรท์ และคอนเซ็ปอาร์ทเกี่ยวกับสิ่งแวดล้อมเพื่อเร่งการผลิตล่วงหน้า
ทีมภาพสต็อกและการตลาดสร้างภาพจำลองผลิตภัณฑ์และภาพโฆษณาตามแบรนด์โดยไม่ต้องถ่ายภาพ
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โมเดลการแพร่กระจายวิดีโอ
คำถามที่พบบ่อย
What is Latent Diffusion Models?
โมเดลการแพร่กระจายแฝงจะสร้างภาพโดยการรันกระบวนการแพร่กระจายในพื้นที่แฝงที่ถูกบีบอัด แทนที่จะเป็นพิกเซลดิบ ซึ่งช่วยลดต้นทุนการประมวลผลลงอย่างมาก พวกมันคือกลไกเบื้องหลัง Stable Diffusion และเครื่องสร้างภาพโอเพ่นซอร์สที่ทันสมัยที่สุด
อะไรคือนวัตกรรมหลักของโมเดลการแพร่กระจายแฝงเมื่อเปรียบเทียบกับการแพร่กระจายของพื้นที่พิกเซล
การแพร่กระจายแฝงจะบีบอัดภาพลงในพื้นที่แฝงที่เล็กลงโดยใช้ VAE ดังนั้นการลดสัญญาณรบกวนที่มีราคาแพงจึงเกิดขึ้นกับค่าที่น้อยกว่าพิกเซลเต็มอย่างมาก
องค์ประกอบใดที่บีบอัดรูปภาพลงในพื้นที่แฝงแล้วสร้างใหม่ในภายหลัง
VAE ที่ได้รับการฝึกอบรมล่วงหน้าจะเข้ารหัสภาพลงในตารางแฝงขนาดกะทัดรัด และเครื่องถอดรหัสจะสร้างพิกเซลความละเอียดสูงขึ้นใหม่ในตอนท้าย
โดยทั่วไปแล้วข้อความจะถูกฉีดเข้าไปใน denoising U-Net ในการแพร่กระจายที่แฝงอยู่อย่างไร
การฝังโทเค็นจากตัวเข้ารหัสข้อความจะถูกป้อนเข้าไปในเลเยอร์การสนใจข้าม เพื่อให้คุณลักษณะเชิงพื้นที่เข้าร่วมกับพรอมต์
เหตุใดการทำงานในพื้นที่แฝงจึงลดต้นทุนการคำนวณ
เดี๋ยว — เหตุผลที่ถูกต้องก็คือตารางแฝงนั้นเล็กกว่าภาพพิกเซลมาก (มักจะประมาณ ~48x) ดังนั้นแต่ละขั้นตอนการลดสัญญาณรบกวนจึงต้องการ FLOP และหน่วยความจำน้อยกว่ามาก
โมเดลโอเพ่นซอร์สใดที่ใช้กันอย่างแพร่หลายที่ทำให้การแพร่กระจายแฝงเป็นที่นิยม
Stable Diffusion เปิดตัวในปี 2022 นำมาซึ่งการแพร่กระจายแฝงไปยังฮาร์ดแวร์ของผู้บริโภคและการนำไปใช้ในวงกว้าง