คู่มือ AI แบบเห็นภาพ

การปรับแต่งหลายแนวคิดการแพร่กระจายแบบกำหนดเอง

การกระจายแบบกำหนดเองเป็นวิธีการปรับแต่งแบบละเอียดน้ำหนักเบาที่สอนแนวคิดส่วนตัวใหม่ๆ ให้กับโมเดลข้อความเป็นรูปภาพ เช่น สุนัขหรือเก้าอี้เฉพาะจากภาพถ่ายเพียงไม่กี่ภาพ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Its standout feature is composing several newly learned concepts together in one generated scene.

เจาะลึก

เปิดตัวโดยนักวิจัยของ Adobe และ CMU ในปี 2565 Custom Diffusion ปรับแต่งโมเดลต่างๆ เช่น Stable Diffusion โดยไม่ต้องฝึกอบรมเครือข่ายทั้งหมดใหม่ แทนที่จะอัปเดตทุกน้ำหนัก กลับพบว่าการอัปเดตเพียงส่วนเล็กๆ ซึ่งเป็นเมทริกซ์การฉายภาพคีย์และค่าในเลเยอร์การสนใจข้าม ก็เพียงพอที่จะดูดซับแนวคิดใหม่จากรูปภาพประมาณ 4 ถึง 20 ภาพ สิ่งนี้ทำให้การปรับจูนรวดเร็ว (นาที) และมีพื้นที่เก็บข้อมูลขนาดเล็ก (เมกะไบต์แทนที่จะเป็นกิกะไบต์) สิ่งสำคัญที่สุดคือ สามารถเรียนรู้แนวคิดหลายรายการพร้อมกันผ่านการฝึกอบรมร่วมกัน หรือโดยการผสานแนวคิดที่ได้รับการฝึกอบรมแยกกันโดยใช้การปรับให้เหมาะสมที่มีข้อจำกัด ซึ่งจะทำให้คุณสามารถบอกได้ว่าแมวตัวใดตัวหนึ่งของคุณนั่งอยู่บนเก้าอี้ดีไซเนอร์เฉพาะตัวของคุณ ซึ่งเป็นวิธีการที่มีแนวคิดเดียวที่พยายามจะรวมกัน

ข้อมูลเชิงลึกทางเทคนิค

ความสนใจข้ามคือจุดที่ข้อความแจ้งส่งผลต่อรูปภาพ โทเค็นข้อความจะสร้างแบบสอบถามที่เข้าร่วมกับคุณลักษณะภาพของโมเดลการแพร่กระจายผ่านเมทริกซ์คีย์และค่า Custom Diffusion จะหยุดการทำงานของ U-Net ส่วนใหญ่ และปรับแต่งเฉพาะการฉายภาพ K และ V ซึ่งเป็นส่วนที่รับผิดชอบมากที่สุดในการผูกคำเข้ากับรูปลักษณ์ นอกจากนี้ยังใช้ชุดการทำให้เป็นมาตรฐานของรูปภาพจริงที่แชร์หมวดหมู่ของแนวคิด เพื่อป้องกันไม่ให้โมเดลมีความเหมาะสมมากเกินไปและลืมความหมายของคำที่กว้างขึ้น

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการปรับแต่งหลายแนวคิดการกระจายแบบกำหนดเอง

การปรับเปลี่ยนในแบบของคุณแบบหลายแนวคิดกำลังมาบรรจบกับระบบนิเวศของอะแดปเตอร์ เช่น LoRA ซึ่งสามารถผสมผสานโมดูลแนวคิดขนาดเล็กจำนวนมากในเวลาอนุมานได้ ระบบในอนาคตตั้งเป้าที่จะรวบรวมแนวคิดแบบกำหนดเองหลายสิบรายการอย่างหมดจดโดยไม่มีการตกของแอตทริบิวต์ (สีของแมวรั่วบนเก้าอี้) และทำการปรับแต่งในไม่กี่วินาทีหรือแม้แต่ตัวเข้ารหัสเท่านั้น โดยไม่มีการปรับให้เหมาะสม คาดว่าสิ่งนี้จะสนับสนุนการสร้างสินทรัพย์ที่สอดคล้องกับแบรนด์ อวาตาร์ส่วนตัว และการปรับแต่งบนอุปกรณ์

การใช้งานจริงในโลกแห่งความเป็นจริง

สอนโมเดลสัตว์เลี้ยงเฉพาะของคุณจากภาพถ่ายจำนวนหนึ่ง จากนั้นสร้างมันขึ้นมาด้วยท่าทาง เครื่องแต่งกาย และการตั้งค่าใหม่

การเรียนรู้ผลิตภัณฑ์ของแบรนด์ (รองเท้าผ้าใบหรือขวด) และมาสคอตของแบรนด์ จากนั้นจึงรวมทั้งสองไว้ในอิมเมจการตลาดเดียว

การถ่ายภาพวัตถุศิลปะส่วนบุคคลบวกกับความคล้ายคลึงของสมาชิกในครอบครัวและนำมารวมกันในฉากที่ประดิษฐ์ขึ้น

การผสมผสานเฟอร์นิเจอร์สั่งทำพิเศษเข้ากับสไตล์ห้องสั่งทำพิเศษเพื่อจำลองแนวคิดการออกแบบตกแต่งภายใน

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Custom Diffusion Multi-Concept Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

นโยบายการแพร่กระจายสำหรับการควบคุมหุ่นยนต์

คำถามที่พบบ่อย

What is Custom Diffusion Multi-Concept Tuning?

การกระจายแบบกำหนดเองเป็นวิธีการปรับแต่งแบบละเอียดน้ำหนักเบาที่สอนแนวคิดส่วนตัวใหม่ๆ ให้กับโมเดลข้อความเป็นรูปภาพ เช่น สุนัขหรือเก้าอี้เฉพาะจากภาพถ่ายเพียงไม่กี่ภาพ คุณสมบัติที่โดดเด่นของมันคือการรวบรวมแนวคิดที่เพิ่งเรียนรู้หลายอย่างเข้าด้วยกันในฉากที่สร้างขึ้นเพียงฉากเดียว

ส่วนใดของโมเดลการแพร่กระจายที่ Custom Diffusion มีการปรับแต่งอย่างละเอียดเป็นหลัก

โดยจะอัปเดตเฉพาะเมทริกซ์ K และ V แบบ cross-attention ซึ่งผูกคำเข้ากับลักษณะที่ปรากฏ ทำให้ปรับจูนได้เร็วและไฟล์ที่บันทึกไว้มีขนาดเล็ก

Custom Diffusion โดดเด่นที่สุดเมื่อเปรียบเทียบกับวิธีการแบบแนวคิดเดียวคืออะไร

ความสามารถอันเป็นเอกลักษณ์ของมันคือการสร้างแนวคิดที่หลากหลาย โดยผสมผสานหัวข้อเฉพาะบุคคลหลายเรื่องเข้าด้วยกัน

Custom Diffusion ต้องใช้ภาพตัวอย่างประมาณกี่ภาพเพื่อเรียนรู้แนวคิด

โดยเรียนรู้จากรูปภาพเล็กๆ น้อยๆ ทำให้การปรับเปลี่ยนในแบบของคุณใช้งานได้จริงสำหรับผู้ใช้ทุกวัน

เหตุใด Custom Diffusion จึงใช้ชุดรูปภาพที่ทำให้เป็นมาตรฐานจากหมวดหมู่ที่กว้างกว่าของแนวคิด

รูปภาพการทำให้เป็นมาตรฐานจะรักษาความหมายทั่วไปของคำในหมวดหมู่ไว้ครบถ้วน ดังนั้นแบบจำลองจะไม่ยุบลงเหลือเพียงแนวคิดใหม่เท่านั้น

แนวคิด Custom Diffusion ที่ได้รับการฝึกอบรมแยกกันสองแนวคิดสามารถใช้ร่วมกันได้อย่างไร

แนวคิดที่เรียนรู้อย่างอิสระสามารถผสานเข้าด้วยกันผ่านการเพิ่มประสิทธิภาพที่มีข้อจำกัดในรูปแบบปิด ทำให้เกิดการแจ้งเตือนร่วมกัน