คู่มือ AI ภาษา

การฝึกล่วงหน้าของ ELECTRA

ELECTRA เป็นวิธีที่มีประสิทธิภาพมากกว่าในการฝึกโมเดลภาษาล่วงหน้าโดยการสอนให้พวกเขามองเห็นคำปลอม แทนที่จะเดาคำที่ซ่อนอยู่

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matches BERT's quality using a fraction of the compute.

เจาะลึก

ELECTRA (การเรียนรู้ตัวเข้ารหัสอย่างมีประสิทธิภาพที่จำแนกการเปลี่ยนโทเค็นได้อย่างแม่นยำ) เปิดตัวโดย Google และ Stanford ในปี 2020 แทนที่งานการสร้างแบบจำลองภาษาที่สวมหน้ากากของ BERT ด้วย 'การตรวจจับโทเค็นที่ถูกแทนที่' เครือข่ายตัวสร้างขนาดเล็กจะสลับคำบางคำในประโยคเพื่อหาทางเลือกอื่นที่เป็นไปได้ และโมเดลหลัก (ผู้แยกแยะ) เรียนรู้ที่จะตัดสินใจสำหรับทุก ๆ โทเค็น ไม่ว่าจะเป็นต้นฉบับหรือถูกแทนที่ เนื่องจากโมเดลฝึกฝนกับโทเค็นทั้งหมด ไม่ใช่แค่เพียง ~15% ที่ BERT มาสก์ โมเดลจึงเรียนรู้ได้เร็วกว่ามาก ELECTRA-Small ได้รับการรายงานว่ามีประสิทธิภาพเหนือกว่า GPT ที่มีขนาดใกล้เคียงกันซึ่งได้รับการฝึกฝนด้วยการประมวลผลที่มากกว่า 30 เท่า และ ELECTRA-Large แข่งขันกับ RoBERTa และ XLNet บนเกณฑ์มาตรฐาน GLUE ในขณะที่ใช้การประมวลผลประมาณหนึ่งในสี่

ข้อมูลเชิงลึกทางเทคนิค

หม้อแปลงสองตัวฝึกร่วมกัน ตัวสร้างจะทำการสร้างแบบจำลองภาษามาสก์และเสนอโทเค็นทดแทน ผู้เลือกปฏิบัติจะทำการจำแนกประเภทไบนารี่ (ของจริงเทียบกับของที่ถูกแทนที่) เหนือทุกตำแหน่ง สิ่งสำคัญที่สุดคือ การสูญเสียจะถูกคำนวณบนโทเค็นทั้งหมด ไม่ใช่แค่โทเค็นที่ถูกปิดบัง จึงเป็นสัญญาณการเรียนรู้ที่หนาแน่นยิ่งขึ้น การฝังโทเค็นการแชร์ทั้งสองตัว ตัวสร้างจะถูกเก็บไว้ให้มีขนาดเล็ก (มักจะเป็นหนึ่งในสี่ถึงครึ่งหนึ่งของขนาดของตัวแบ่งแยก) และหลังจากการฝึกอบรมล่วงหน้า ตัวสร้างจะถูกละทิ้ง - มีเพียงตัวแบ่งแยกเท่านั้นที่จะได้รับการปรับแต่งดาวน์สตรีมอย่างละเอียด

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการฝึกอบรมล่วงหน้าของ ELECTRA

แนวคิดการตรวจจับโทเค็นที่ถูกแทนที่ของ ELECTRA มีอิทธิพลต่อตัวเข้ารหัสที่มีประสิทธิภาพรุ่นหลัง เช่น DeBERTa-v3 ซึ่งผสมผสานกับความเอาใจใส่ที่ไม่พันกันเพื่อให้ได้ผลลัพธ์ที่ล้ำสมัย เนื่องจากองค์กรต่างๆ ให้ความสำคัญกับต้นทุนการฝึกอบรมและการปล่อยก๊าซคาร์บอนไดออกไซด์มากขึ้น วัตถุประสงค์ในการฝึกอบรมล่วงหน้าแบบเลือกปฏิบัติที่บีบสัญญาณจากทุกโทเค็นยังคงน่าสนใจสำหรับการสร้างตัวเข้ารหัสที่แข็งแกร่งและกะทัดรัด คาดหวังแนวทางในการแจ้งโมเดลขนาดเล็กและรวดเร็วสำหรับการค้นหา การจัดหมวดหมู่ และการดึงข้อมูลบนอุปกรณ์ ในกรณีที่โมเดลกำเนิดขนาดใหญ่ใช้งานมากเกินไป

การใช้งานจริงในโลกแห่งความเป็นจริง

ขับเคลื่อนการจัดหมวดหมู่ข้อความอย่างรวดเร็วและการวิเคราะห์ความรู้สึก โดยที่จำเป็นต้องใช้ตัวเข้ารหัสที่มีขนาดกะทัดรัดและแม่นยำ

ทำหน้าที่เป็นแกนหลักสำหรับความเกี่ยวข้องในการค้นหาและระบบการจัดอันดับเอกสาร

การปรับแต่ง ELECTRA-Small อย่างละเอียดสำหรับงาน NLP บนอุปกรณ์หรืองาน NLP ที่มีความหน่วงต่ำพร้อมการประมวลผลที่จำกัด

ทำหน้าที่เป็นตัวเข้ารหัสพื้นฐานที่แข็งแกร่งสำหรับการรับรู้เอนทิตีที่มีชื่อและเกณฑ์มาตรฐานการตอบคำถามเช่น SQuAD และ GLUE

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ELECTRA Pretraining quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างแบบจำลองการเรียงสับเปลี่ยน XLNet

คำถามที่พบบ่อย

What is ELECTRA Pretraining?

ELECTRA เป็นวิธีที่มีประสิทธิภาพมากกว่าในการฝึกโมเดลภาษาล่วงหน้าโดยการสอนให้พวกเขามองเห็นคำปลอม แทนที่จะเดาคำที่ซ่อนอยู่ มันตรงกับคุณภาพของ BERT โดยใช้เพียงเศษเสี้ยวของการคำนวณ

ELECTRA ใช้งานการฝึกอบรมอะไรแทนการสร้างแบบจำลองภาษาที่ปกปิด

ELECTRA ฝึกโมเดลเพื่อตรวจจับว่าโทเค็นใดถูกแทนที่ด้วยตัวสร้าง แทนที่จะคาดเดาคำที่ปิดบัง

เหตุใด ELECTRA จึงมีประสิทธิภาพในการคำนวณมากกว่า BERT

Discriminator จะจัดประเภทโทเค็นทุกรายการว่าเป็นของจริงหรือถูกแทนที่ ดังนั้นโมเดลจึงเรียนรู้จากตำแหน่ง 100% แทนที่จะเรียนรู้เฉพาะชุดย่อยที่ปิดบังไว้

เครือข่ายเครื่องกำเนิดไฟฟ้าขนาดเล็กมีบทบาทอย่างไรใน ELECTRA

เครื่องกำเนิดไฟฟ้าสร้างแบบจำลองภาษาที่สวมหน้ากากและมอบโทเค็นปลอมที่เหมือนจริง สร้างงานให้กับผู้เลือกปฏิบัติ

จะเกิดอะไรขึ้นกับเครื่องกำเนิดไฟฟ้าหลังจากการฝึกล่วงหน้าเสร็จสิ้น?

มีเพียงตัวแบ่งแยกเท่านั้นที่จะถูกเก็บไว้และปรับแต่งสำหรับงานดาวน์สตรีม เครื่องกำเนิดไฟฟ้าถูกโยนทิ้งไป

ELECTRA ได้รับการพัฒนาโดยนักวิจัยจากองค์กรใดบ้างเป็นหลัก

ELECTRA เปิดตัวในปี 2020 โดยนักวิจัยที่ Google และมหาวิทยาลัยสแตนฟอร์ด