คู่มือ AI ภาษา

Word2Vec ข้ามแกรมและ CBOW

Word2Vec เป็นเทคนิคปี 2013 จาก Google ที่เรียนรู้เวกเตอร์คำหนาแน่นโดยการทำนายคำจากเพื่อนบ้าน เปลี่ยนภาษาเป็นเรขาคณิตซึ่งมีคำที่คล้ายกันอยู่ใกล้กัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It made the famous "king - man + woman ≈ queen" analogy possible and kicked off the modern embedding era.

เจาะลึก

Word2Vec เปิดตัวโดย Tomas Mikolov และเพื่อนร่วมงานที่ Google ในปี 2013 เรียนรู้เวกเตอร์ (โดยทั่วไปคือตัวเลข 100-300) สำหรับแต่ละคำโดยการฝึกโครงข่ายประสาทเทียมสองชั้นแบบตื้นบนหน้าต่างบริบทแบบเลื่อน มันมาในสองรสชาติ CBOW (Continuous Bag of Words) นำคำตามบริบทโดยรอบมาทำนายคำที่อยู่ตรงกลางที่หายไป โดยนำเวกเตอร์บริบทมาเฉลี่ยรวมกัน Skip-Gram พลิกสิ่งนี้: ใช้คำตรงกลางและพยายามคาดเดาคำตามบริบทโดยรอบแต่ละคำ โมเดลไม่เคยสนใจงานการทำนายเลย เป้าหมายคือเมทริกซ์น้ำหนักที่เรียนรู้ไปพร้อมกัน ซึ่งแถวต่างๆ จะกลายเป็นคำว่าเวกเตอร์ คำที่ปรากฏในบริบทที่คล้ายคลึงกันจะลงเอยด้วยเวกเตอร์ที่คล้ายกัน โดยจับความหมายจากเหตุการณ์ที่เกิดขึ้นร่วมกันล้วนๆ

ข้อมูลเชิงลึกทางเทคนิค

การฝึก softmax เต็มรูปแบบโดยใช้คำศัพท์จำนวนมากนั้นช้าเกินไป ดังนั้น Word2Vec จึงใช้เทคนิคต่างๆ เช่น การสุ่มตัวอย่างเชิงลบ ซึ่งจัดกรอบการทำนายใหม่เป็นการจำแนกประเภทไบนารี่: แยกความแตกต่างคำตามบริบทที่แท้จริงจากคำสุ่ม "เชิงลบ" จำนวนหนึ่ง นอกจากนี้ยังสุ่มตัวอย่างคำที่ใช้บ่อย เช่น "the" และใช้การแจกแจงแบบ unigram-raised-to-0.75 เพื่อเลือกคำเชิงลบ CBOW เร็วกว่าและดีกว่าสำหรับคำที่ใช้บ่อย Skip-Gram ที่มีการสุ่มตัวอย่างเชิงลบจะจัดการกับคำที่หายากและคลังข้อมูลขนาดเล็กได้ดีกว่า

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของ Word2Vec Skip-Gram และ CBOW

การฝังแบบคงที่เช่น Word2Vec ได้รับการแทนที่โดยส่วนใหญ่โดยโมเดลบริบท (ELMo, BERT, หม้อแปลงไฟฟ้า) ที่ให้คำเวกเตอร์ที่แตกต่างกันขึ้นอยู่กับบริบทของประโยค การแก้ปัญหา polysemy โดยที่ "ธนาคาร" มีเวกเตอร์คงที่หนึ่งตัว Word2Vec ยืนหยัดในเรื่องความเร็ว ความเรียบง่าย และความสามารถในการตีความ: ระบบการแนะนำ การค้นหา และรากฐานการสอน แนวคิดหลักที่ว่าความหมายมาจากสถิติที่เกิดขึ้นร่วมกัน ยังคงเป็นรากฐานทางแนวคิดของแบบจำลองภาษาสมัยใหม่ทั้งหมด

การใช้งานจริงในโลกแห่งความเป็นจริง

Spotify และ Airbnb ดัดแปลง Skip-Gram เพื่อเรียนรู้การฝังเพลงและรายการ ("item2vec") จากลำดับเซสชันของผู้ใช้เพื่อรับคำแนะนำ

ขับเคลื่อนการค้นหาความหมายและการขยายคำพ้อง ดังนั้นข้อความค้นหาสำหรับ "แล็ปท็อป" ยังแสดง "โน้ตบุ๊ก" และ "คอมพิวเตอร์"

การตรวจจับความคล้ายคลึงและความสัมพันธ์ในข้อความ เช่น คู่เมืองหลวงกับประเทศ (ปารีสคือฝรั่งเศส ขณะที่โตเกียวคือญี่ปุ่น)

การเริ่มต้นเลเยอร์อินพุตของไปป์ไลน์ NLP ขนาดใหญ่สำหรับการวิเคราะห์ความรู้สึกและการจำแนกเอกสารเกี่ยวกับข้อมูลที่จำกัด

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Word2Vec Skip-Gram and CBOW quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

เครือข่ายทางหลวงและการข้ามการเชื่อมต่อ

คำถามที่พบบ่อย

What is Word2Vec Skip-Gram and CBOW?

Word2Vec เป็นเทคนิคปี 2013 จาก Google ที่เรียนรู้เวกเตอร์คำหนาแน่นโดยการทำนายคำจากเพื่อนบ้าน เปลี่ยนภาษาเป็นเรขาคณิตซึ่งมีคำที่คล้ายกันอยู่ใกล้กัน มันทำให้การเปรียบเทียบ "ราชา - ผู้ชาย + ผู้หญิง µ ราชินี" อันโด่งดังเป็นไปได้ และได้เริ่มต้นยุคการฝังสมัยใหม่

สถาปัตยกรรม Skip-Gram ทำนายอะไร

Skip-Gram ใช้คำตรงกลางเพียงคำเดียวและพยายามคาดเดาคำตามบริบทโดยรอบแต่ละคำ ซึ่งตรงกันข้ามกับ CBOW

ผลลัพธ์ที่มีประโยชน์ที่แท้จริงของการฝึกโมเดล Word2Vec คืออะไร

งานทำนายเป็นเพียงหนทางสู่จุดจบ เป้าหมายคือเมทริกซ์น้ำหนักที่เรียนรู้ซึ่งแถวจะกลายเป็นการฝังคำที่หนาแน่น

เหตุใด Word2Vec จึงใช้การสุ่มตัวอย่างเชิงลบ

การสุ่มตัวอย่างเชิงลบจะกำหนดกรอบปัญหาใหม่เป็นการจำแนกประเภทไบนารี่โดยเทียบกับคำสุ่มสองสามคำ โดยหลีกเลี่ยงค่าซอฟต์แม็กซ์ที่มีราคาแพงกว่าคำนับหมื่นคำ

โดยทั่วไปแล้ว ตัวแปร Word2Vec ใดทำงานได้ดีกว่ากับคำที่หายากและชุดข้อมูลขนาดเล็ก

Skip-Gram ที่มีการสุ่มตัวอย่างเชิงลบมีแนวโน้มที่จะจับคำที่หายากได้ดีกว่า ในขณะที่ CBOW จะเร็วกว่าและชอบคำที่ใช้บ่อย

คุณสมบัติที่มีชื่อเสียงของเวกเตอร์ Word2Vec ใดที่แสดงโดย "king - man + woman data queen"

เวกเตอร์ Word2Vec เข้ารหัสความสัมพันธ์เพื่อให้สามารถแก้ไขการเปรียบเทียบเชิงความหมายได้ด้วยการบวกและการลบเวกเตอร์อย่างง่าย