การเสริม Mixup และ CutMix
Mixup และ CutMix เป็นวิธีการเพิ่มข้อมูลที่สร้างตัวอย่างการฝึกอบรมใหม่โดยการผสมผสานรูปภาพสองภาพและป้ายกำกับเข้าด้วยกัน
ภาพรวม
Mixup linearly interpolates whole images and labels, while CutMix pastes a rectangular patch from one image onto another and mixes labels by patch area — both reduce overfitting and improve robustness.
เจาะลึก
Mixup (Zhang et al., 2017) สร้างตัวอย่างใหม่เป็น x̃ = แล·x_a + (1−แล)·x_b โดยมีป้ายกำกับ ỹ ผสมด้วย แลมเดียวกัน โดยที่ แล ถูกดึงมาจากการแจกแจงแบบเบต้า สิ่งนี้สนับสนุนให้แบบจำลองทำงานเป็นเส้นตรงระหว่างตัวอย่าง ทำให้ขอบเขตการตัดสินใจราบรื่นขึ้น และปรับปรุงการสอบเทียบ CutMix (Yun et al., 2019) จะตัดพื้นที่สี่เหลี่ยมจากรูปภาพ B และวางลงบนรูปภาพ A แทน น้ำหนักของป้ายกำกับถูกกำหนดตามสัดส่วนของพิกเซลที่แต่ละภาพมีส่วนร่วม เนื่องจาก CutMix รักษาขอบเขตของภาพที่สอดคล้องกันในเครื่อง (แทนที่จะผสมแบบน่ากลัว) จึงรักษาโครงสร้างเชิงพื้นที่ที่มีประโยชน์ในขณะที่ยังคงบังคับให้โมเดลสนใจวัตถุและชิ้นส่วนหลายชิ้น เทคนิคทั้งสองทำหน้าที่เป็นตัวกำหนดมาตรฐานที่แข็งแกร่ง เพิ่มความแม่นยำในการวัดประสิทธิภาพระดับ ImageNet และปรับปรุงความทนทานต่อความเสียหายและอินพุตของฝ่ายตรงข้ามอย่างเห็นได้ชัด
ข้อมูลเชิงลึกทางเทคนิค
ทั้งสองวิธีแก้ไขเป้าหมายการสูญเสีย ไม่ใช่แค่อินพุต ฉลากกลายเป็นเป้าหมายแบบอ่อนและผสมกัน ดังนั้นการสูญเสียข้ามเอนโทรปีจึงเป็นการผสมผสานแบบถ่วงน้ำหนัก แลมของสองคลาส ซึ่งเป็นรูปแบบหนึ่งของการปรับฉลากให้เรียบซึ่งเชื่อมโยงกับอัตราส่วนการผสมพิกเซลอย่างมีประสิทธิภาพ ใน CutMix แล เท่ากับเศษส่วนของพิกเซลที่ไม่เปลี่ยนแปลง ซึ่งคำนวณจากพื้นที่กล่องตัดหารด้วยพื้นที่ภาพทั้งหมด ซึ่งทำให้สัดส่วนป้ายกำกับสอดคล้องกับจำนวนภาพแต่ละภาพที่มองเห็นได้
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการเสริม Mixup และ CutMix
ขณะนี้การเพิ่มแบบผสมเป็นมาตรฐานในสูตรการจำแนกประเภทภาพที่แข็งแกร่ง และสนับสนุนไปป์ไลน์การฝึกอบรมที่ทันสมัยสำหรับตัวแปลงการมองเห็น ซึ่งมักต้องมีการปรับมาตรฐานอย่างหนัก การวิจัยยังคงดำเนินต่อไปเกี่ยวกับตัวแปรที่คำนึงถึงความโดดเด่น (เช่น การตัดพื้นที่ที่ให้ข้อมูล) การผสมระดับโทเค็นสำหรับหม้อแปลง และส่วนขยายของเสียง ข้อความ และข้อมูล 3 มิติ คาดว่ากลยุทธ์การผสมผสานจะยังคงเป็นต้นทุนที่ต่ำในการเพิ่มความแม่นยำ การสอบเทียบ และความทนทาน ในขณะที่สถาปัตยกรรมต้องการข้อมูลเพิ่มมากขึ้น
การใช้งานจริงในโลกแห่งความเป็นจริง
การฝึกอบรมตัวแยกประเภท ImageNet ด้วย CutMix เพื่อเพิ่มความแม่นยำอันดับ 1 และปรับปรุงการแปลออบเจ็กต์
การใช้ Mixup เพื่อปรับปรุงการสอบเทียบโมเดล ดังนั้นความเชื่อมั่นที่คาดการณ์ไว้จะตรงกับความแม่นยำที่แท้จริงมากขึ้น
ปรับวิชันทรานส์ฟอร์มเมอร์ให้เป็นมาตรฐานอย่างมาก (เช่น DeiT) ด้วยการผสมผสาน Mixup และ CutMix เพื่อฝึกฝนกับข้อมูลที่จำกัด
เพิ่มความทนทานต่อความเสียหายของภาพและอินพุตที่ไม่กระจายในระบบการมองเห็นที่มีความสำคัญด้านความปลอดภัย
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixup and CutMix Augmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การเพิ่มเวลาทดสอบ
คำถามที่พบบ่อย
What is Mixup and CutMix Augmentation?
Mixup และ CutMix เป็นวิธีการเพิ่มข้อมูลที่สร้างตัวอย่างการฝึกอบรมใหม่โดยการผสมผสานรูปภาพสองภาพและป้ายกำกับเข้าด้วยกัน Mixup จะสอดแทรกรูปภาพและป้ายกำกับทั้งหมดเป็นเส้นตรง ในขณะที่ CutMix จะวางแพตช์สี่เหลี่ยมจากรูปภาพหนึ่งไปยังอีกรูปภาพหนึ่ง และผสมป้ายกำกับตามพื้นที่ของแพตช์ ซึ่งทั้งลดการติดตั้งมากเกินไปและปรับปรุงความทนทาน
Mixup สร้างตัวอย่างการฝึกอบรมใหม่ได้อย่างไร
รูปแบบการผสม x̃ = แลม x_a + (1−แล)x_b และผสมป้ายกำกับที่มี แลมเดียวกันที่ดึงมาจากการแจกแจงแบบเบต้า
อะไรคือความแตกต่างหลักระหว่าง CutMix และ Mixup?
CutMix คัดลอกพื้นที่สี่เหลี่ยมจากภาพหนึ่งไปยังอีกภาพหนึ่ง โดยเก็บเนื้อหาที่สอดคล้องกันในเครื่องแทนที่จะรวมภาพสองภาพเข้าด้วยกัน
ใน CutMix น้ำหนักการผสม (แลมบ์ดา) สำหรับฉลากจะกำหนดอย่างไร
สัดส่วนฉลากใน CutMix ถูกกำหนดโดยพื้นที่ของกล่องที่วางโดยสัมพันธ์กับรูปภาพทั้งหมด ทำให้ป้ายกำกับสอดคล้องกับพิกเซลที่มองเห็นได้
นอกจากรูปภาพอินพุตแล้ว Mixup และ CutMix มีอะไรแก้ไขอีกบ้าง
ทั้งสองวิธีผสมฉลากเข้าด้วยกัน ทำให้เกิดเป้าหมายแบบอ่อนที่ทำหน้าที่เหมือนกับรูปแบบการปรับฉลากให้เรียบโดยอาศัยข้อมูล
การกระจายแบบใดที่มักใช้ในการสุ่มตัวอย่างค่าสัมประสิทธิ์การผสมแลมบ์ดา
โดยทั่วไป Mixup และ CutMix จะดึง γ จากการแจกแจงแบบเบต้า ซึ่งจะควบคุมว่าตัวอย่างทั้งสองจะผสมกันมากเพียงใด