คู่มือทางเทคนิค

การสุ่มตัวอย่างเชิงลบและการประมาณค่าความเปรียบต่างของสัญญาณรบกวน

การสุ่มตัวอย่างเชิงลบและการประมาณค่าความเปรียบต่างของสัญญาณรบกวน (NCE) เป็นเทคนิคที่ช่วยให้แบบจำลองเรียนรู้คำศัพท์จำนวนมากโดยไม่ต้องคำนวณซอฟต์แม็กซ์เต็มรูปแบบที่มีราคาแพง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Instead of scoring every possible output, they teach the model to tell real (positive) examples from a handful of fake (negative) ones.

เจาะลึก

เมื่อคำศัพท์มีคำนับแสนคำ softmax ปกติจะต้องทำให้ทุกคำเป็นมาตรฐานสำหรับแต่ละขั้นตอนการฝึกอบรม — ช้าเกินไป การประมาณค่าความเปรียบต่างของสัญญาณรบกวนจะกำหนดกรอบปัญหาใหม่เป็นการจำแนกแบบไบนารี โดยให้เป้าหมายและตัวอย่าง 'สัญญาณรบกวน' สองสามตัวอย่างที่ดึงมาจากการกระจายที่รู้จัก เรียนรู้ที่จะแยกแยะตัวอย่างที่แท้จริงจากสัญญาณรบกวน ซึ่งจะกู้คืนความน่าจะเป็นที่ต้องการโดยปริยายโดยไม่ต้องทำให้เป็นมาตรฐานอย่างชัดเจน การสุ่มตัวอย่างเชิงลบซึ่งเป็นที่นิยมโดยโมเดลข้ามแกรมของ word2vec เป็นแบบลูกพี่ลูกน้องอย่างง่าย: สำหรับการจับคู่จริง (คำ บริบท) แต่ละคู่ มันจะสุ่มตัวอย่างค่าเนกาทีฟ k ค่า และฝึกฝนแบบจำลองเพื่อให้คะแนนสูงให้กับคู่จริง และคะแนนต่ำให้กับคู่จริง โดยใช้วัตถุประสงค์ sigmoid ทั้งสองเปลี่ยนปัญหาหลายคลาสที่มีราคาแพงให้กลายเป็นไบนารี่ราคาถูกจำนวนมาก ทำให้การฝึกอบรมการฝังขนาดใหญ่ทำได้จริง การเลือกการกระจายสัญญาณรบกวน (มักจะใช้ยูนิแกรมยกกำลัง 3/4) ส่งผลอย่างมากต่อคุณภาพ

ข้อมูลเชิงลึกทางเทคนิค

NCE ประมาณการแบบจำลองโดยการจำแนกข้อมูลเทียบกับสัญญาณรบกวน และเมื่อจำนวนตัวอย่างสัญญาณรบกวนเพิ่มขึ้น ก็คงจะประมาณความเป็นไปได้สูงสุดด้วยค่า softmax ที่ทำให้เป็นมาตรฐานที่เหมาะสม การสุ่มตัวอย่างเชิงลบจะทำให้เงื่อนไขการทำให้เป็นมาตรฐานของ NCE ลดลงโดยสิ้นเชิง โดยปรับบันทึก σ (คะแนนบวก) ให้เหมาะสม + Σ log σ (− คะแนนลบ) ซึ่งทำให้เร็วขึ้นแต่ไม่มีตัวประมาณความหนาแน่นที่สม่ำเสมออีกต่อไป เนื่องจากได้รับการปรับแต่งเพื่อการเรียนรู้การฝังที่ดี แทนที่จะปรับเทียบความน่าจะเป็น การสุ่มตัวอย่างคำเชิงลบจากการแจกแจงแบบยูนิแกรมแบบเรียบ (ความถี่^0.75) จะช่วยสร้างสมดุลระหว่างคำทั่วไปและคำที่หายาก

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการสุ่มตัวอย่างเชิงลบและการประมาณค่าความเปรียบต่างของสัญญาณรบกวน

แนวคิดหลัก — เรียนรู้โดยการเปรียบเทียบความแตกต่างเชิงบวกกับเชิงลบตัวอย่าง — ปัจจุบันเป็นรากฐานการเรียนรู้การเป็นตัวแทนแบบมีการดูแลตนเองและแบบเปรียบเทียบสมัยใหม่ผ่านวิสัยทัศน์ ภาษา และข้อเสนอแนะ งานในอนาคตมุ่งเน้นไปที่การขุดแบบฮาร์ดเนกาทีฟ (การเลือกค่าเนกาทีฟที่ให้ข้อมูลแทนการสุ่ม) การหักล้างค่าลบลวง และการปรับสเกลค่าเนกาทีฟในราคาถูกผ่านธนาคารหน่วยความจำขนาดใหญ่หรือการสุ่มตัวอย่างในแบตช์ เมื่อโมเดลเติบโตขึ้น วัตถุประสงค์ในการสุ่มตัวอย่างที่มีประสิทธิภาพยังคงมีความสำคัญไม่ว่าพื้นที่เอาท์พุตหรือชุดผู้สมัครจะมีขนาดใหญ่มาก เช่น การดึงข้อมูลและผู้แนะนำขนาดใหญ่

การใช้งานจริงในโลกแห่งความเป็นจริง

word2vec ข้ามแกรมพร้อมการเรียนรู้การสุ่มตัวอย่างเชิงลบที่ฝังจากโทเค็นนับพันล้านโดยไม่ต้อง softmax เต็ม

แบบจำลองภาษาในอดีตใช้ NCE เพื่อฝึกฝนคำศัพท์นับแสนคำอย่างมีประสิทธิภาพ

ระบบการแนะนำและการดึงข้อมูลสุ่มตัวอย่างรายการ 'เชิงลบ' ที่ผู้ใช้ไม่ได้โต้ตอบด้วยเพื่อฝึกโมเดลการฝังสองทาวเวอร์

การฝังกราฟและกราฟความรู้ (เช่น การทำให้ส่วนหัวหรือส่วนท้ายของทริปเปิลเสียหาย) โดยใช้ตัวอย่างเชิงลบเพื่อเรียนรู้ความสัมพันธ์ของเอนทิตี

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Negative Sampling and Noise Contrastive Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การขุดแบบออนไลน์และแบบลบอย่างหนัก

คำถามที่พบบ่อย

What is Negative Sampling and Noise Contrastive Estimation?

การสุ่มตัวอย่างเชิงลบและการประมาณค่าความเปรียบต่างของสัญญาณรบกวน (NCE) เป็นเทคนิคที่ช่วยให้แบบจำลองเรียนรู้คำศัพท์จำนวนมากโดยไม่ต้องคำนวณซอฟต์แม็กซ์เต็มรูปแบบที่มีราคาแพง แทนที่จะให้คะแนนทุกผลลัพธ์ที่เป็นไปได้ พวกเขาสอนโมเดลให้บอกตัวอย่างจริง (เชิงบวก) จากตัวอย่างปลอม (เชิงลบ) จำนวนหนึ่ง

การสุ่มตัวอย่างเชิงลบและ NCE แก้ปัญหาอะไรเป็นหลัก

ทั้งสองวิธีหลีกเลี่ยงการทำให้คำศัพท์จำนวนมากเป็นมาตรฐานโดยการเปลี่ยนกรอบการฝึกอบรมเป็นการเลือกปฏิบัติแบบไบนารีที่ถูกกว่า

การประมาณค่าความเปรียบต่างของสัญญาณรบกวนปรับกรอบงานการเรียนรู้อย่างไร

NCE ฝึกโมเดลเพื่อแยกแยะตัวอย่างจริงจากตัวอย่างที่ดึงมาจากการกระจายเสียงที่รู้จัก

โมเดลใดที่ทำให้การสุ่มตัวอย่างเชิงลบเป็นที่นิยมสำหรับการเรียนรู้การฝังคำ

การสุ่มตัวอย่างเชิงลบถูกนำมาใช้และแพร่หลายโดยรูปแบบข้ามกรัมของ word2vec

การสุ่มตัวอย่างเชิงลบแตกต่างจาก NCE แบบเต็มอย่างไร

การสุ่มตัวอย่างเชิงลบช่วยลดความซับซ้อนของ NCE โดยการนำการทำให้เป็นมาตรฐานออก แลกเปลี่ยนความถูกต้องของความน่าจะเป็นเพื่อความรวดเร็วและการฝังที่ดี

เหตุใดค่าเนกาทีฟจึงมักสุ่มตัวอย่างจากการแจกแจงแบบยูนิแกรมยกกำลัง 3/4

เลขชี้กำลัง 0.75 ทำให้การกระจายความถี่ราบรื่น ดังนั้นคำทั่วไปจะไม่ครอบงำและคำที่หายากยังคงปรากฏอยู่