คู่มือทางเทคนิค

การเรียนรู้ที่ตรงกันข้าม

การเรียนรู้แบบตรงกันข้ามจะสอนแบบจำลองเพื่อดึงสิ่งที่คล้ายกันมารวมกันและผลักสิ่งที่แตกต่างออกจากกันในพื้นที่ฝังตัว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

เป็นเรื่องสำคัญเนื่องจากช่วยให้ AI เรียนรู้การนำเสนอที่มีประสิทธิภาพจากข้อมูลที่ไม่มีป้ายกำกับเป็นส่วนใหญ่ ขับเคลื่อนการค้นหารูปภาพ คำแนะนำ และแบบจำลองหลายรูปแบบ

เจาะลึก

แทนที่จะทำนายป้ายกำกับ การเรียนรู้แบบเปรียบเทียบจะเรียนรู้โดยการเปรียบเทียบ: เมื่อพิจารณาจากรายการจุดยึด โมเดลจะได้รับการฝึกเพื่อให้ 'ค่าบวก' ที่ตรงกันเข้าใกล้มันในปริภูมิเวกเตอร์ ในขณะที่ 'ค่าลบ' ที่ไม่ตรงกันจะตกลงไปในระยะไกล สูตรทั่วไปที่มีการดูแลตนเอง (เช่น SimCLR) จะสร้างผลบวกโดยการสุ่มเพิ่มรูปภาพเดียวกันสองครั้ง (ครอบตัด สีที่กระวนกระวายใจ เบลอ) อย่างอื่นในชุดนั้นเป็นค่าลบ แบบจำลองจะจับคู่อินพุตกับเวกเตอร์ และการสูญเสียจะให้รางวัลความคล้ายคลึงกันสูงสำหรับทั้งคู่ และความคล้ายคลึงกันต่ำสำหรับส่วนที่เหลือ สิ่งนี้ทำให้เกิดการฝังที่ระยะทางสะท้อนถึงความหมาย ดังนั้นงานปลายน้ำจึงจำเป็นต้องมีป้ายกำกับน้อยกว่ามาก CLIP ใช้แนวคิดเดียวกันในรูปแบบต่างๆ โดยจับคู่รูปภาพกับคำบรรยาย

ข้อมูลเชิงลึกทางเทคนิค

การสูญเสียน้ำหนักเทียมคือ InfoNCE (ค่าซอฟต์แม็กซ์เหนือคะแนนความคล้ายคลึงกัน) โดยมักจะมีความคล้ายคลึงกันของโคไซน์หารด้วยอุณหภูมิที่ควบคุมว่าต้องการให้ค่าบวกมากเพียงใด สิ่งสำคัญที่สุดคือประสิทธิภาพได้รับการปรับปรุงโดยมีข้อเสียหลายประการ ดังนั้นแบทช์ขนาดใหญ่หรือธนาคารหน่วยความจำ/คิว (เช่นใน MoCo) จึงจัดหาสิ่งเหล่านี้ วิธีการบางอย่าง เช่น BYOL และ SimSiam ทิ้งผลเชิงลบที่ชัดเจน และใช้โมเมนตัมหรือเครือข่ายเป้าหมายแบบหยุดการไล่ระดับสีแทนเพื่อหลีกเลี่ยงการล่มสลาย ซึ่งการฝังทั้งหมดจะเหมือนกัน

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการเรียนรู้ที่ตรงกันข้าม

การเรียนรู้แบบตรงกันข้ามกำลังมาบรรจบกับการกำกับดูแลตนเองแบบปิดบังและแบบสร้างสรรค์ในวัตถุประสงค์แบบผสมผสานที่จับทั้งความคล้ายคลึงระดับโลกและรายละเอียดที่ละเอียด ผลกระทบที่ใหญ่ที่สุดของมันคือ multimodal: การฝังข้อความรูปภาพและการจัดแนวที่ตรงกันข้าม (และตอนนี้คือเสียงและวิดีโอ) จะสนับสนุนการค้นหา การสร้างเสริมการดึงข้อมูล และการจำแนกประเภทภาพเป็นศูนย์ และรอยเท้าดังกล่าวจะเติบโตขึ้น คาดว่าจะมีการทำงานมากขึ้นในการลดความอยากอาหารจำนวนมาก กลยุทธ์การเพิ่มและการขุดเชิงลบที่ดีขึ้น และในการขยายแนวทางไปยังโดเมน เช่น การสร้างภาพทางการแพทย์และอนุกรมเวลา ซึ่งฉลากหายากและมีราคาแพง

การใช้งานจริงในโลกแห่งความเป็นจริง

CLIP เรียนรู้พื้นที่ข้อความรูปภาพที่ใช้ร่วมกัน เพื่อให้คุณสามารถค้นหาไลบรารีรูปภาพด้วยวลีที่พิมพ์เช่น 'สุนัขบนสเก็ตบอร์ด'

ฝึกอบรมแกนหลักการมองเห็นล่วงหน้าด้วย SimCLR บนภาพถ่ายที่ไม่มีป้ายกำกับ จากนั้นปรับแต่งอย่างละเอียดเพื่อการตรวจหาโรคด้วยชุดป้ายกำกับขนาดเล็กเท่านั้น

สร้างคำแนะนำผลิตภัณฑ์หรือเพลงโดยฝังรายการที่ผู้ใช้ชอบไว้ใกล้กันเพื่อดึงข้อมูลเพื่อนบ้านที่ใกล้ที่สุด

ระบบการตรวจสอบใบหน้าที่ฝึกการฝังเพื่อให้รูปถ่ายสองรูปของคนคนเดียวกันอยู่ใกล้กันและคนละคนอยู่ห่างกัน

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Contrastive Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเรียนรู้แบบสหพันธ์

คำถามที่พบบ่อย

การเรียนรู้แบบตรงกันข้ามคืออะไร?

การเรียนรู้แบบตรงกันข้ามจะสอนแบบจำลองเพื่อดึงสิ่งที่คล้ายกันมารวมกันและผลักสิ่งที่แตกต่างออกจากกันในพื้นที่ฝังตัว เป็นเรื่องสำคัญเนื่องจากช่วยให้ AI เรียนรู้การนำเสนอที่มีประสิทธิภาพจากข้อมูลที่ไม่มีป้ายกำกับเป็นส่วนใหญ่ ขับเคลื่อนการค้นหารูปภาพ คำแนะนำ และแบบจำลองหลายรูปแบบ

วัตถุประสงค์หลักของการเรียนรู้แบบเปรียบเทียบคืออะไร?

การเรียนรู้ที่ขัดแย้งกันทำให้เกิดพื้นที่ฝังตัว ดังนั้นคู่ที่ตรงกันจึงอยู่ใกล้กันและคู่ที่ไม่ตรงกันจะอยู่ห่างกัน

ในวิธีการตรวจสอบภาพด้วยตนเอง เช่น SimCLR โดยทั่วไปแล้วคู่ที่เป็นบวกจะถูกสร้างขึ้นอย่างไร

SimCLR สร้างผลบวกจากมุมมองเสริมสองมุมมองของรูปภาพหนึ่งภาพ โดยที่รูปภาพอื่นๆ ในกลุ่มจะทำหน้าที่เป็นเนกาทีฟ

ฟังก์ชั่นการสูญเสียใดที่เกี่ยวข้องกับการเรียนรู้แบบเปรียบเทียบมากที่สุด?

InfoNCE ซึ่งเป็นค่าซอฟต์แม็กซ์เหนือคะแนนความคล้ายคลึงกับอุณหภูมิ เป็นวัตถุประสงค์มาตรฐานในการเปรียบเทียบ

เหตุใดวิธีการเช่น MoCo จึงใช้ธนาคารหน่วยความจำหรือคิว

การเรียนรู้แบบตรงกันข้ามมีประโยชน์จากเชิงลบหลายประการ คิวจัดเตรียมไว้ในขณะที่ยังคงจัดการขนาดแบตช์ได้

BYOL และ SimSiam ป้องกันปัญหาอะไรโดยเฉพาะโดยไม่ใช้คำเชิงลบที่ชัดเจน?

หากไม่มีค่าเนกาทีฟ แบบจำลองสามารถแมปทุกอย่างกับเวกเตอร์เดียวกันได้เล็กน้อย เป้าหมายการไล่ระดับสีและโมเมนตัมป้องกันการล่มสลายนี้