คู่มือ AI ภาษา

การสร้างแบบจำลองภาษามาสก์

การสร้างแบบจำลองภาษามาสก์จะสอน AI ให้เติมคำที่จงใจซ่อนไว้โดยใช้บริบทโดยรอบทั้งหมดทั้งซ้ายและขวา

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.

เจาะลึก

ในการสร้างแบบจำลองภาษามาสก์ (MLM) คุณจะต้องใช้ประโยค สุ่มซ่อนโทเค็นประมาณ 15% ด้วยสัญลักษณ์พิเศษ [MASK] และฝึกโมเดลให้เดาต้นฉบับ เนื่องจากโมเดลมองเห็นคำทั้งสองด้านของช่องว่างแต่ละช่อง จึงสร้างความเข้าใจบริบทแบบสองทิศทาง BERT ซึ่งแนะนำโดย Google ในปี 2018 ทำให้สิ่งนี้เป็นที่นิยม รายละเอียดอันชาญฉลาด: ของตำแหน่งที่ปิดบัง ประมาณ 80% กลายเป็น [MASK] 10% จะถูกสลับเป็นคำแบบสุ่ม และ 10% จะไม่เปลี่ยนแปลง วิธีนี้จะป้องกันไม่ให้โมเดลคาดหวังโทเค็น [MASK] ในเวลาคาดการณ์เท่านั้นและบังคับให้มีความทนทาน หลังจากการฝึกล่วงหน้านี้ แบบจำลองจะได้รับการปรับแต่งอย่างละเอียดสำหรับงานต่างๆ เช่น การจัดหมวดหมู่ การตอบคำถาม และการจดจำเอนทิตีที่มีชื่อ

ข้อมูลเชิงลึกทางเทคนิค

MLM ใช้ตัวเข้ารหัส Transformer ที่มีการเอาใจใส่ตนเองแบบสองทิศทาง ดังนั้นทุกโทเค็นจึงเข้าร่วมกับโทเค็นอื่นทั้งหมดพร้อมกัน การสูญเสียจะถูกคำนวณเฉพาะตำแหน่งที่มาสก์โดยใช้เอนโทรปีข้ามกับรหัสโทเค็นจริง เนื่องจากความสนใจไม่ใช่สาเหตุ (ไม่มีการปกปิดในอนาคต) การเป็นตัวแทนของคำแต่ละคำจะหลอมรวมบริบทด้านซ้ายและขวาเป็นเวกเตอร์หนาแน่นเพียงตัวเดียว ความเป็นสองทิศทางนั้นเป็นสิ่งที่โมเดลโทเค็นถัดไปยอมแพ้ต่อความสามารถในการสร้าง

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการสร้างแบบจำลองภาษาสวมหน้ากาก

Pure MLM ถูกบดบังบางส่วนโดยโมเดลตัวถอดรหัสแบบกำเนิดสำหรับแชทบอท แต่ยังคงมีความโดดเด่นในการฝัง การดึงข้อมูล และการจัดหมวดหมู่ที่ความเข้าใจเหนือกว่าการสร้าง ตัวแปรต่างๆ เช่น RoBERTa, การตรวจจับโทเค็นที่ถูกแทนที่ของ ELECTRA และ DeBERTa ยังคงผลักดันความแม่นยำและประสิทธิภาพอย่างต่อเนื่อง คาดหวังว่าตัวเข้ารหัสแบบ MLM จะเป็นศูนย์กลางในการค้นหา ความคล้ายคลึงทางความหมาย และเป็นส่วนประกอบที่มีน้ำหนักเบาภายในระบบการดึงข้อมูลเสริมและต่อเนื่องหลายรูปแบบที่ใหญ่กว่า ซึ่งความเข้าใจที่รวดเร็วและลึกซึ้งมีความสำคัญมากกว่าข้อความรูปแบบอิสระ

การใช้งานจริงในโลกแห่งความเป็นจริง

ขับเคลื่อน Google ความเข้าใจตาม BERT ของการค้นหาเกี่ยวกับคำค้นหาเชิงสนทนาเพื่อแสดงหน้าเว็บที่เกี่ยวข้องมากขึ้น

การสร้างการฝังประโยคสำหรับระบบการค้นหาความหมายและการเรียกค้นเอกสาร

ปรับแต่ง BERT เพื่อวิเคราะห์ความรู้สึกในการรีวิวผลิตภัณฑ์หรือตั๋วสนับสนุน

การจดจำชื่อนิติบุคคลที่แยกบุคคล องค์กร และวันที่ออกจากข้อความทางกฎหมายหรือทางการแพทย์

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Language Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างแบบจำลองภาษา

คำถามที่พบบ่อย

What is Masked Language Modeling?

การสร้างแบบจำลองภาษามาสก์จะสอน AI ให้เติมคำที่จงใจซ่อนไว้โดยใช้บริบทโดยรอบทั้งหมดทั้งซ้ายและขวา เคล็ดลับการฝึกอบรมเบื้องหลังของ BERT คือเคล็ดลับและเหตุผลที่โมเดลสามารถเข้าใจความหมายของประโยคได้อย่างลึกซึ้ง แทนที่จะเพียงคาดเดาสิ่งที่จะเกิดขึ้นต่อไป

งานฝึกอบรมหลักในการสร้างแบบจำลองภาษาที่สวมหน้ากากคืออะไร?

MLM ซ่อนโทเค็นบางส่วนและฝึกโมเดลเพื่อกู้คืนโทเค็นเหล่านั้นโดยใช้บริบททั้งซ้ายและขวา

โดยทั่วไปแล้ว BERT จะปกปิดโทเค็นประมาณกี่เปอร์เซ็นต์ระหว่างการฝึกล่วงหน้า

BERT ปิดบังโทเค็นอินพุตประมาณ 15% ซึ่งเป็นความสมดุลระหว่างการให้สัญญาณที่เพียงพอและการปล่อยให้บริบทเพียงพอ

เหตุใด MLM จึงให้แบบจำลองความเข้าใจแบบสองทิศทาง

ตัวเข้ารหัส Transformer ใช้การเอาใจใส่ตนเองโดยไม่ตั้งใจ ดังนั้นทุกโทเค็นจึงสามารถมองเห็นโทเค็นอื่นๆ ทั้งหมดได้ทั้งสองด้าน

ในรูปแบบการพรางตัวของ BERT จะเกิดอะไรขึ้นกับประมาณ 10% ของตำแหน่งที่เลือกแทนที่จะกลายเป็น [MASK]

เพื่อปรับปรุงความทนทาน ตำแหน่งที่ปิดบัง 10% จะถูกสลับเป็นโทเค็นแบบสุ่ม และ 10% จะไม่มีการเปลี่ยนแปลง

การคำนวณการสูญเสีย MLM อยู่ที่ตำแหน่งใด

การสูญเสียเอนโทรปีข้ามจะใช้กับตำแหน่งที่ปิดบังเท่านั้น โดยเปรียบเทียบการคาดการณ์กับรหัสโทเค็นดั้งเดิม