ตัวเข้ารหัสอัตโนมัติที่สวมหน้ากาก
Masked Autoencoders (MAE) เป็นวิธีการดูแลตนเองที่สอนโมเดลการมองเห็นเพื่อสร้างภาพขึ้นใหม่หลังจากที่รูปภาพส่วนใหญ่ถูกซ่อนไว้
ภาพรวม
By learning to fill in the blanks, the model builds rich visual understanding without any human labels.
เจาะลึก
โปรแกรมเข้ารหัสอัตโนมัติแบบสวมหน้ากากซึ่งแนะนำโดย Kaiming He และเพื่อนร่วมงานที่ Meta AI ในปี 2021 ถ่ายภาพ แบ่งออกเป็นแพตช์เล็กๆ และสุ่มซ่อนส่วนที่มีขนาดใหญ่มาก ซึ่งมักจะอยู่ที่ 75% ตัวเข้ารหัส Vision Transformer จะประมวลผลเฉพาะแพตช์ที่มองเห็นได้เท่านั้น ในขณะที่ตัวถอดรหัสน้ำหนักเบาจะพยายามสร้างพิกเซลดั้งเดิมของพิกเซลที่หายไปขึ้นมาใหม่ เนื่องจากมีสิ่งที่ซ่อนอยู่มากมาย โมเดลจึงไม่สามารถคัดลอกพิกเซลใกล้เคียงได้ง่ายๆ และต้องเรียนรู้โครงสร้างที่มีความหมาย เช่น รูปร่างและส่วนของวัตถุ ตัวเข้ารหัสที่ข้ามแพตช์ที่สวมหน้ากากทำให้การฝึกทำได้รวดเร็วและหน่วยความจำมีประสิทธิภาพ หลังจากการฝึกล่วงหน้า ตัวถอดรหัสจะถูกละทิ้ง และเครื่องเข้ารหัสจะถ่ายโอนไปยังงานจำแนกประเภท การตรวจจับ และการแบ่งส่วน
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับสำคัญคือความไม่สมมาตร: ตัวเข้ารหัสขนาดใหญ่มองเห็นเพียง 25% ของแพตช์ที่ไม่ได้ปกปิดเท่านั้น ในขณะที่ตัวถอดรหัสขนาดเล็กจะสร้างส่วนที่เหลือขึ้นมาใหม่ แพตช์จะแบนราบ ฝังเป็นเส้นตรง และได้รับการเข้ารหัสตามตำแหน่ง การสูญเสียการสร้างใหม่เป็นข้อผิดพลาดกำลังสองเฉลี่ยที่คำนวณเฉพาะบนแพตช์ที่ปิดบัง โดยทั่วไปจะเป็นค่าพิกเซลที่ทำให้เป็นมาตรฐาน อัตราส่วนการมาสก์ที่สูงบังคับให้การเรียนรู้เชิงความหมายมากกว่าการแก้ไขในระดับต่ำ และการข้ามโทเค็นที่มาสก์ในโปรแกรมเปลี่ยนไฟล์จะตัดการประมวลผลอย่างมากเมื่อเทียบกับการประมวลผลภาพเต็ม
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของตัวเข้ารหัสอัตโนมัติแบบสวมหน้ากาก
การสร้างมาสก์ขึ้นใหม่แบบ MAE กำลังกลายเป็นสูตรการฝึกล่วงหน้าเริ่มต้นในรูปแบบต่างๆ นักวิจัยกำลังขยายขอบเขตไปยังวิดีโอ (ซ่อนลูกบาศก์กาลอวกาศ) สเปกโตรแกรมเสียง การสแกนทางการแพทย์ และภาพถ่ายดาวเทียม ซึ่งป้ายกำกับนั้นหายากและมีราคาแพง คาดหวังการผสมผสานที่แน่นแฟ้นยิ่งขึ้นกับภาษาสำหรับโมเดลรากฐานหลายรูปแบบ ตัวถอดรหัสที่มีประสิทธิภาพมากขึ้น และการมาสก์แบบปรับเปลี่ยนได้ซึ่งกำหนดเป้าหมายไปยังภูมิภาคที่ให้ข้อมูล เมื่อการประมวลผลเติบโตขึ้น การฝึกอบรมล่วงหน้าแบบสวมหน้ากากในคอลเลกชันรูปภาพขนาดใหญ่ที่ไม่มีป้ายกำกับควรปรับปรุงความแม่นยำดาวน์สตรีมต่อไป ในขณะเดียวกันก็ลดการพึ่งพาคำอธิบายประกอบของมนุษย์ที่มีค่าใช้จ่ายสูง
การใช้งานจริงในโลกแห่งความเป็นจริง
ฝึกอบรม Vision Transformer ล่วงหน้ากับภาพถ่ายที่ไม่มีป้ายกำกับหลายล้านภาพ จากนั้นปรับแต่งอย่างละเอียดสำหรับการจัดหมวดหมู่ ImageNet ด้วยความแม่นยำระดับสูง
คุณลักษณะการเรียนรู้จากการสแกนทางการแพทย์ที่ไม่มีป้ายกำกับ (X-rays, MRI) ซึ่งคำอธิบายประกอบของผู้เชี่ยวชาญมีราคาแพงและมีจำกัด
การปรับวิธีการเข้ากับวิดีโอโดยการมาสก์แพตช์กาลอวกาศเพื่อฝึกโมเดลการรู้จำการกระทำล่วงหน้า (VideoMAE)
การฝึกอบรมล่วงหน้าเกี่ยวกับภาพถ่ายดาวเทียมและภาพถ่ายทางอากาศเพื่อรองรับการทำแผนที่การใช้ที่ดินและการตรวจจับการเปลี่ยนแปลงโดยไม่ต้องใช้ป้ายกำกับด้วยตนเอง
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Autoencoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Muse Masked การสร้างภาพกำเนิด
คำถามที่พบบ่อย
What is Masked Autoencoders?
Masked Autoencoders (MAE) เป็นวิธีการดูแลตนเองที่สอนโมเดลการมองเห็นเพื่อสร้างภาพขึ้นใหม่หลังจากที่รูปภาพส่วนใหญ่ถูกซ่อนไว้ ด้วยการเรียนรู้ที่จะเติมคำในช่องว่าง แบบจำลองจะสร้างความเข้าใจเชิงภาพที่สมบูรณ์โดยไม่ต้องมีป้ายกำกับของมนุษย์
งานหลักที่ดูแลตนเองหลักใน Masked Autoencoder คืออะไร
MAE ซ่อนแพตช์รูปภาพส่วนใหญ่และฝึกโมเดลเพื่อสร้างพิกเซลที่หายไปขึ้นมาใหม่ โดยไม่ต้องใช้ป้ายกำกับของมนุษย์
โดยทั่วไปแล้ว MAE ดั้งเดิมจะปกปิดส่วนแพตช์รูปภาพประมาณเท่าใด
MAE ดั้งเดิมจะมาสก์ประมาณ 75% ของแพตช์ ซึ่งเป็นอัตราส่วนที่สูงที่บังคับให้โมเดลเรียนรู้โครงสร้างที่มีความหมายแทนที่จะคัดลอกเพื่อนบ้าน
เหตุใดตัวเข้ารหัส MAE จึงประมวลผลเฉพาะแพตช์ที่มองเห็นได้ (ไม่ปกปิด)
การข้ามโทเค็นที่มาสก์ในตัวเข้ารหัสจะช่วยลดการประมวลผลและหน่วยความจำลงอย่างมาก เนื่องจากจะจัดการแพตช์เพียงเล็กน้อยเท่านั้น
จะเกิดอะไรขึ้นกับตัวถอดรหัสหลังจากการฝึกอบรมล่วงหน้าของ MAE เสร็จสิ้นแล้ว
ตัวถอดรหัสน้ำหนักเบาจำเป็นสำหรับการสร้างใหม่ระหว่างการฝึกล่วงหน้าเท่านั้น หลังจากนั้นตัวเข้ารหัสที่เรียนรู้จะถ่ายโอนไปยังงานต่างๆ เช่น การตรวจจับ
โดยทั่วไปแล้ว MAE จะใช้ฟังก์ชันการสูญเสียใดในการฟื้นฟู
MAE ลดข้อผิดพลาดกำลังสองเฉลี่ยให้เหลือน้อยที่สุดระหว่างค่าพิกเซลที่คาดการณ์ไว้และค่าพิกเซลจริง โดยคำนวณบนแพตช์ที่ปิดบังเท่านั้น