คู่มือ AI ภาษา

การฝังตามบริบทของ ELMo

ELMo (การฝังจากโมเดลภาษา) เป็นความก้าวหน้าในปี 2018 ที่ทำให้แต่ละคำเป็นตัวแทนตามประโยค ดังนั้น 'ธนาคาร' ใน 'ริมฝั่งแม่น้ำ' จึงแตกต่างจาก 'ธนาคาร' ใน 'ธนาคารออมสิน' เป็นการทำเครื่องหมายการเปลี่ยนแปลงจากเวกเตอร์คำแบบคงที่ไปเป็น NLP ที่รับรู้บริบท

อ่าน 2 นาทีอัปเดตล่าสุด

เจาะลึก

ELMo ซึ่งเปิดตัวโดย Allen Institute สำหรับนักวิจัย AI (Peters et al., 2018) สร้างการแสดงคำโดยการรันประโยคผ่านโมเดลภาษา LSTM แบบสองทิศทางเชิงลึกที่ได้รับการฝึกฝนจากคลังคำนับพันล้านคำ ต่างจาก Word2Vec หรือ GloVe ซึ่งกำหนดเวกเตอร์คงที่หนึ่งตัวต่อคำ ELMo คำนวณเวกเตอร์ใหม่สำหรับทุกเหตุการณ์ตามบริบทโดยรอบ สิ่งสำคัญที่สุดคือ ELMo จะรวมเลเยอร์ LSTM ภายในทั้งหมดผ่านการเรียนรู้น้ำหนักเฉพาะงาน แทนที่จะใช้เฉพาะเลเยอร์บนสุด ชั้นล่างมีแนวโน้มที่จะจับไวยากรณ์ (ส่วนหนึ่งของคำพูด โครงสร้าง) ในขณะที่ชั้นที่สูงกว่าจะจับความหมายและความรู้สึกของคำ การเพิ่ม ELMo ให้กับโมเดลที่มีอยู่ทำให้เกิดประโยชน์อย่างมากในงานวัดประสิทธิภาพ 6 งาน ซึ่งรวมถึงการตอบคำถาม การวิเคราะห์ความรู้สึก และการรับรู้เอนทิตีที่มีชื่อ

ข้อมูลเชิงลึกทางเทคนิค

ELMo ซ้อน LSTM สองตัวเข้าด้วยกัน: โมเดลภาษาไปข้างหน้าทำนายคำถัดไปและโมเดลถอยหลังทำนายคำก่อนหน้า โดยแต่ละโมเดลอยู่เหนืออินพุต CNN ระดับอักขระ (ดังนั้นจึงจัดการกับคำที่มองไม่เห็น) สำหรับงานดาวน์สตรีม ELMo จะยุบการแสดงเลเยอร์โดยใช้ตุ้มน้ำหนักแบบ softmax-normalized บวกกับสเกลาร์ ซึ่งทั้งหมดนี้เรียนรู้ระหว่างการปรับแต่งแบบละเอียด ซึ่งหมายความว่าแต่ละงานสามารถตัดสินใจได้ว่าต้องการสัญญาณทางวากยสัมพันธ์และความหมายมากน้อยเพียงใดจาก biLM ที่ผ่านการฝึกอบรมแบบแช่แข็ง

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการฝังตามบริบทของ ELMo

แนวคิดหลักของ ELMo ซึ่งก็คือการนำเสนอตามบริบทจากการฝึกอบรมโมเดลภาษาล่วงหน้า กลายเป็นพื้นฐาน แต่สถาปัตยกรรม LSTM ที่เกิดขึ้นซ้ำนั้นถูกบดบังอย่างรวดเร็วโดยโมเดลที่ใช้ Transformer เช่น BERT ในปลายปี 2018 ซึ่งอ่านประโยคทั้งหมดในแบบคู่ขนานและปรับขนาดได้ดีกว่ามาก ปัจจุบัน ELMo มีความสำคัญทางประวัติศาสตร์และการศึกษาเป็นส่วนใหญ่ แม้ว่าการจัดการอินพุตของตัวละคร-CNN ​​และแนวคิดการถ่วงน้ำหนักเลเยอร์ยังคงมีอิทธิพลต่องานฝังเฉพาะทางในภาษาที่มีทรัพยากรต่ำและมีความหลากหลายทางสัณฐานวิทยา

การใช้งานจริงในโลกแห่งความเป็นจริง

การปรับปรุงระบบการรู้จำเอนทิตีที่มีชื่อซึ่งต้องบอกว่า 'วอชิงตัน' หมายถึงบุคคล รัฐ หรือเมืองตามคำที่อยู่รอบๆ

ส่งเสริมการวิเคราะห์ความรู้สึกโดยระบุว่า 'ป่วย' หมายถึงเชิงลบใน 'ฉันรู้สึกไม่สบาย' แต่เป็นบวกในคำสแลง 'นั่นป่วย'

ปรับปรุงระบบการตอบคำถามบนเกณฑ์มาตรฐาน SQuAD โดยการป้อนเวกเตอร์โทเค็นที่ไวต่อบริบทเข้าไปในเครื่องอ่าน

แยกแยะความรู้สึกของคำในการแปลด้วยเครื่อง ดังนั้นคำที่มีหลายรูปแบบ เช่น 'plant' จึงแปลบริบทที่กำหนดได้อย่างถูกต้อง

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ELMo Contextual Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is ELMo Contextual Embeddings?

ELMo (การฝังจากโมเดลภาษา) เป็นความก้าวหน้าในปี 2018 ที่ทำให้แต่ละคำเป็นตัวแทนตามประโยค ดังนั้น 'ธนาคาร' ใน 'ริมฝั่งแม่น้ำ' จึงแตกต่างจาก 'ธนาคาร' ใน 'ธนาคารออมสิน' เป็นการทำเครื่องหมายการเปลี่ยนแปลงจากเวกเตอร์คำแบบคงที่ไปเป็น NLP ที่รับรู้บริบท

อะไรคือความแตกต่างที่สำคัญระหว่าง ELMo และการฝังรุ่นก่อนหน้าเช่น Word2Vec?

ELMo สร้างการฝังตามบริบท: เวกเตอร์สำหรับคำจะเปลี่ยนไปตามประโยคที่อยู่รอบๆ ซึ่งแตกต่างจากเวกเตอร์คงที่เดี่ยวของ Word2Vec ต่อคำ

ELMo ใช้สถาปัตยกรรมประสาทอะไรในการอ่านข้อความ

ELMo สร้างขึ้นบน LSTM แบบสองทิศทางเชิงลึกที่ได้รับการฝึกฝนเป็นโมเดลภาษา และประมวลผลลำดับซ้ำๆ

ELMo รวมเลเยอร์ภายในสำหรับงานดาวน์สตรีมอย่างไร

ELMo เรียนรู้ตุ้มน้ำหนักซอฟต์แม็กซ์-นอร์มอลไลซ์เฉพาะงานเพื่อรวมเลเยอร์ biLM ทั้งหมด เพื่อให้แต่ละงานเน้นไวยากรณ์หรือความหมายตามความจำเป็น

ELMo ใช้เป็นหน่วยอินพุตเพื่อจัดการกับคำที่มองไม่เห็นอย่างไร

ELMo สร้างการป้อนคำจาก CNN ระดับตัวละคร จึงสามารถนำเสนอคำที่ไม่เคยเห็นระหว่างการฝึกได้

ประมาณว่า ELMo ได้รับการแนะนำเมื่อใดและโดยใคร?

ELMo ได้รับการเผยแพร่ในปี 2018 โดย Peters และคณะ ที่สถาบันอัลเลนเพื่อ AI (AI2)