คู่มือ AI แบบเห็นภาพ

ดรีมบูธ

DreamBooth ปรับแต่งโมเดลรูปภาพทั้งหมดบนภาพถ่ายจำนวนหนึ่ง เพื่อให้ 'จดจำ' วัตถุเฉพาะอย่างลึกซึ้ง ไม่ว่าจะเป็นใบหน้า สัตว์เลี้ยง หรือผลิตภัณฑ์ของคุณ และสามารถวางไว้ในทุกฉากได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It trades larger file sizes for higher fidelity than lighter personalization methods.

เจาะลึก

DreamBooth ซึ่งเผยแพร่โดยนักวิจัย Google ในปี 2022 ปรับแต่งโมเดลข้อความเป็นรูปภาพโดยการปรับน้ำหนักของเครือข่ายอย่างละเอียดในภาพ 3-5 ภาพของวัตถุ โดยเชื่อมโยงหัวเรื่องกับโทเค็นที่หายากซึ่งจับคู่กับคำในชั้นเรียน เช่น 'รูปถ่ายของสุนัข sks' ดังนั้นแบบจำลองจึงเรียนรู้ว่า 'sks' หมายถึง *สุนัขตัวนี้* โดยเฉพาะ ความท้าทายหลักคือ 'การเลื่อนลอยของภาษา' และการปรับมากเกินไป: ฝึกหนักเกินไปและโมเดลลืมวิธีวาดสุนัขตัวอื่น หรือสร้างเฉพาะท่าฝึกเท่านั้น การแก้ไขที่สำคัญของ DreamBooth คือการสูญเสียการเก็บรักษาไว้ก่อน: มันยังฝึกเกี่ยวกับรูปภาพสุนัขทั่วไปที่โมเดลสร้างขึ้นเอง โดยยึดแนวคิด 'สุนัข' ที่กว้างขึ้น ในขณะที่โทเค็นที่หายากจะดูดซับหัวข้อเฉพาะ ผลลัพธ์ที่ได้คือความสมจริงและความยืดหยุ่นที่โดดเด่น โดยปล่อยให้ตัวแบบปรากฏในการจัดแสง ท่าทาง และสไตล์ที่แปลกใหม่

ข้อมูลเชิงลึกทางเทคนิค

DreamBooth อัปเดตน้ำหนักของโมเดลการแพร่กระจาย ไม่ใช่แค่การฝัง ซึ่งเป็นเหตุผลว่าทำไมความเที่ยงตรงจึงสูง โดยจะจับคู่ตัวระบุที่ไม่ซ้ำกัน (โทเค็นที่หายาก เช่น 'sks') กับคำนามคลาส ดังนั้นโมเดลจึงแนบรายละเอียดรูปลักษณ์ใหม่เข้ากับโทเค็น ในขณะเดียวกันก็ใช้ประโยชน์จากความรู้ในชั้นเรียนที่มีอยู่ การสูญเสียการเก็บรักษาก่อนหน้านั้นเหมาะสมกับอิมเมจของคลาสที่สร้างขึ้นโดยอัตโนมัติ การต่อต้านการปรับมากเกินไป และ 'การเบี่ยงเบนของภาษา' ดังนั้นโมเดลจึงสร้างสมาชิกที่หลากหลายของคลาสนั้น

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของดรีมบูธ

DreamBooth ได้สร้างมาตรฐานสำหรับการปรับแต่งส่วนบุคคลที่มีความเที่ยงตรงสูง และได้รวมเข้ากับ LoRA มากขึ้นเรื่อยๆ เพื่อลดพื้นที่จัดเก็บข้อมูลและการประมวลผลที่หนักหน่วง ขณะนี้ 'DreamBooth-LoRA' เป็นค่าเริ่มต้นในเครื่องมือต่างๆ มากมาย คาดหวังการฝึกอบรมที่เร็วขึ้น เซสชันหลายวิชาที่เรียนรู้ผู้คนหลายคนพร้อมกัน และการรักษาเอกลักษณ์ของวิดีโอและอวาตาร์ 3 มิติที่เข้มงวดยิ่งขึ้น ในขณะที่แอปสำหรับผู้บริโภคนำมาใช้ ให้ระวังรั้วเกี่ยวกับการยินยอมและความคล้ายคลึง เนื่องจากความเที่ยงตรงแบบเดียวกันที่เปิดใช้งานอวตารที่กำหนดเองยังทำให้เกิดข้อกังวลเรื่องการปลอมแปลงและการแอบอ้างบุคคลอื่นด้วย

การใช้งานจริงในโลกแห่งความเป็นจริง

สร้างภาพเฮดช็อตแบบมืออาชีพของบุคคลในชุดและฉากต่างๆ มากมายจากการถ่ายเซลฟี่เพียงไม่กี่ภาพ

การวางรองเท้าผ้าใบหรือกระเป๋าถือแบบใดแบบหนึ่งลงในฉากโฆษณาที่ไม่มีที่สิ้นสุดโดยที่ยังคงดีไซน์ที่แน่นอนเอาไว้

การสร้างมาสคอตที่มีภาพประกอบที่สอดคล้องกันสำหรับแบรนด์ทั้งบนโปสเตอร์ โพสต์บนโซเชียล และบรรจุภัณฑ์

การผลิตชุดอวตารแบบกำหนดเองโดยที่ใบหน้าของผู้ใช้ปรากฏเป็นซูเปอร์ฮีโร่ จิตรกร หรือนักบินอวกาศ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DreamBooth quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การรับรู้การกระทำ

คำถามที่พบบ่อย

What is DreamBooth?

DreamBooth ปรับแต่งโมเดลรูปภาพทั้งหมดบนภาพถ่ายจำนวนหนึ่ง เพื่อให้ 'จดจำ' วัตถุเฉพาะอย่างลึกซึ้ง ไม่ว่าจะเป็นใบหน้า สัตว์เลี้ยง หรือผลิตภัณฑ์ของคุณ และสามารถวางไว้ในทุกฉากได้ มันแลกเปลี่ยนขนาดไฟล์ที่ใหญ่กว่าเพื่อความเที่ยงตรงที่สูงกว่าวิธีการปรับแต่งส่วนบุคคลที่เบากว่า

DreamBooth แก้ไขอะไรโดยที่ Textual Inversion ไม่ได้ทำ

DreamBooth ปรับน้ำหนักของเครือข่ายอย่างละเอียด ในขณะที่ Textual Inversion เรียนรู้เฉพาะการฝังเท่านั้น

จุดประสงค์ของการสูญเสียการเก็บรักษาล่วงหน้าของ DreamBooth คืออะไร?

การฝึกอบรมเกี่ยวกับอิมเมจของชั้นเรียนที่สร้างอัตโนมัติช่วยยึดแนวคิดทั่วไป เพื่อให้โมเดลไม่ลืมวิธีการวาดสมาชิกคนอื่นๆ ในชั้นเรียน

โดยทั่วไปหัวข้อต่างๆ จะถูกอ้างอิงอย่างไรในข้อความแจ้งการฝึกอบรม DreamBooth

ตัวระบุที่หายากที่ไม่ซ้ำกันจะจับคู่กับคำนามคลาส ดังนั้นโมเดลจึงแนบรายละเอียดใหม่เข้ากับโทเค็น

DreamBooth ต้องการรูปภาพประมาณกี่รูป

เช่นเดียวกับวิธีการปรับแต่งภาพไม่กี่ภาพแบบอื่นๆ DreamBooth ทำงานได้จากภาพเพียงไม่กี่ภาพ

ข้อแลกเปลี่ยนทั่วไปของการใช้ DreamBooth คืออะไร

เนื่องจากเป็นการปรับแต่งน้ำหนัก ไฟล์ DreamBooth จึงมีขนาดใหญ่ขึ้น และการฝึกอบรมจึงมีความต้องการมากกว่า Textual Inversion