คู่มือ AI ภาษา

การสร้างแบบจำลองการเรียงสับเปลี่ยน XLNet

XLNet ผสมผสานบริบทแบบสองทิศทางของ BERT เข้ากับการคาดเดาอัตโนมัติของ GPT โดยการฝึกการเรียงลำดับคำแบบสุ่ม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This permutation trick lets it learn from all positions without ever masking tokens.

เจาะลึก

XLNet เปิดตัวในปี 2019 โดย Carnegie Mellon และ Google Brain ได้รับการออกแบบมาเพื่อแก้ไขข้อบกพร่องในการฝึกล่วงหน้าแบบ BERT BERT ปิดบังโทเค็นและคาดการณ์ แต่สัญลักษณ์ [MASK] ปลอมจะไม่ปรากฏในเวลาปรับแต่ง ทำให้เกิดรถไฟ/การทดสอบที่ไม่ตรงกัน และ BERT ถือว่าโทเค็นที่ปิดบังนั้นเป็นอิสระจากกัน XLNet จะใช้ 'การสร้างแบบจำลองภาษาการเรียงสับเปลี่ยน' แทน: โดยจะเพิ่มโอกาสบันทึกที่คาดหวังสูงสุดจากการเรียงลำดับคำที่เป็นไปได้ทั้งหมดในลำดับ ด้วยการทำนายแต่ละโทเค็นโดยให้เซตย่อยแบบสุ่มของโทเค็นอื่นๆ โมเดลจะมองเห็นบริบทแบบสองทิศทางได้อย่างมีประสิทธิภาพในขณะที่ยังคงเป็นโมเดลการถดถอยอัตโนมัติที่เหมาะสมโดยไม่มีการปิดบัง XLNet สร้างขึ้นบนแกนหลักของ Transformer-XL สำหรับหน่วยความจำระยะไกล โดยมีประสิทธิภาพเหนือกว่า BERT ในงานประมาณ 20 งาน รวมถึงการตอบคำถาม การวิเคราะห์ความรู้สึก และการจัดอันดับเอกสาร

ข้อมูลเชิงลึกทางเทคนิค

XLNet ไม่สับเปลี่ยนคำทางกายภาพ โดยจะสับเปลี่ยนลำดับการแยกตัวประกอบผ่านรูปแบบความสนใจ ดังนั้นข้อมูลตำแหน่งจึงถูกเก็บรักษาไว้ เพื่อให้งานนี้สำเร็จ จะใช้ 'การเอาใจใส่ตนเองแบบสองสตรีม': สตรีมเนื้อหาที่เข้ารหัสทั้งโทเค็นและบริบทของโทเค็น และสตรีมแบบสอบถามที่รู้ตำแหน่งของเป้าหมาย แต่ไม่ใช่เนื้อหา ทำให้สามารถคาดการณ์ได้โดยไม่ทำให้คำตอบรั่วไหล การเกิดซ้ำของ Transformer-XL และการเข้ารหัสตำแหน่งที่สัมพันธ์กันทำให้มีหน่วยความจำในส่วนที่ยาว ปรับปรุงการจัดการเอกสารที่มีความยาว

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการสร้างแบบจำลองการเรียงสับเปลี่ยน XLNet

XLNet เป็นข้อพิสูจน์ที่มีอิทธิพลว่าวัตถุประสงค์ autoregressive สามารถจับบริบทแบบสองทิศทาง ซึ่งทำให้การแบ่ง BERT-versus-GPT เบลอ ในขณะที่ฟิลด์ส่วนใหญ่รวมเข้าด้วยกันโดยใช้ตัวเข้ารหัสแบบมาสก์หรือตัวถอดรหัสอัตโนมัติขนาดใหญ่ แนวคิดการเรียงสับเปลี่ยนของ XLNet และการเกิดซ้ำของ Transformer-XL ได้รับการแจ้งให้ทราบในภายหลังเกี่ยวกับการสร้างแบบจำลองบริบทแบบยาวและวัตถุประสงค์การฝึกอบรมล่วงหน้าแบบรวมศูนย์ ข้อมูลเชิงลึกยังคงมีความเกี่ยวข้องในขณะที่นักวิจัยแสวงหาสถาปัตยกรรมที่ผสมผสานการสร้างแบบจำลองบริบทที่แข็งแกร่งเข้ากับการสร้างที่มีประสิทธิภาพและปราศจากหน้ากาก

การใช้งานจริงในโลกแห่งความเป็นจริง

บรรลุผลลัพธ์สูงสุดในเกณฑ์มาตรฐานการตอบคำถามเช่น SQuAD

การจัดการงานเอกสารขนาดยาว เช่น การทดสอบการอ่านเพื่อความเข้าใจ RACE ผ่านหน่วยความจำ Transformer-XL

ขับเคลื่อนระบบการจัดอันดับเอกสารและการดึงข้อมูล

การปรับปรุงการจำแนกประเภทความรู้สึกและการจัดหมวดหมู่ข้อความเหนือเส้นพื้นฐานของ BERT

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the XLNet Permutation Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างแบบจำลองหัวข้อ

คำถามที่พบบ่อย

What is XLNet Permutation Modeling?

XLNet ผสมผสานบริบทแบบสองทิศทางของ BERT เข้ากับการคาดเดาอัตโนมัติของ GPT โดยการฝึกการเรียงลำดับคำแบบสุ่ม เคล็ดลับการเรียงสับเปลี่ยนนี้ช่วยให้เรียนรู้จากทุกตำแหน่งโดยไม่ต้องปิดบังโทเค็น

XLNet ใช้วัตถุประสงค์ในการฝึกอบรมล่วงหน้าอะไร

XLNet เพิ่มโอกาสบันทึกที่คาดหวังสูงสุดจากการเรียงสับเปลี่ยนทั้งหมดของลำดับการแยกตัวประกอบโทเค็น เรียกว่าการสร้างแบบจำลองภาษาการเรียงสับเปลี่ยน

จุดอ่อนของ BERT ข้อใดที่ XLNet ออกแบบมาโดยเฉพาะเพื่อแก้ไข

สัญลักษณ์ปลอม [MASK] ของ BERT จะไม่ปรากฏในระหว่างการปรับแต่งแบบละเอียด และจะถือว่าการคาดคะเนที่สวมหน้ากากเป็นอิสระ XLNet หลีกเลี่ยงปัญหาทั้งสอง

การเอาใจใส่ตนเองแบบสองสตรีมของ XLNet แยกจากอะไร?

สตรีมเนื้อหาเข้ารหัสโทเค็นและบริบท ในขณะที่สตรีมแบบสอบถามทราบตำแหน่งของเป้าหมายแต่ไม่ทราบตำแหน่งของเป้าหมาย ทำให้สามารถคาดการณ์ได้โดยไม่มีการรั่วไหล

XLNet สับเปลี่ยนคำในประโยคหรือไม่?

XLNet เปลี่ยนลำดับการทำนาย (การแยกตัวประกอบ) ผ่านมาสก์ความสนใจ ตำแหน่งโทเค็นดั้งเดิมจะถูกรักษาไว้ผ่านการเข้ารหัสตำแหน่ง

สถาปัตยกรรมใดที่ทำหน้าที่เป็นแกนหลักของ XLNet สำหรับบริบทระยะไกล

XLNet สร้างบน Transformer-XL ซึ่งเพิ่มการเกิดซ้ำของเซ็กเมนต์และการเข้ารหัสตำแหน่งที่สัมพันธ์กันสำหรับการจัดการลำดับที่ยาว