คู่มือ AI ภาษา

การฝังคำย่อย FastText

FastText เป็นวิธีการของ Facebook AI ในปี 2016 ที่แสดงแต่ละคำในรูปแบบถุงอักขระ n-gram ดังนั้นจึงสามารถสร้างเวกเตอร์ได้แม้กระทั่งคำที่ไม่เคยเห็นระหว่างการฝึก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This subword approach excels at morphologically rich languages, typos, and rare words where Word2Vec and GloVe fail.

เจาะลึก

FastText พัฒนาโดย Facebook AI Research (Bojanowski, Grave, Joulin, Mikolov) ในปี 2559 ขยายโมเดล Skip-Gram โดยการแบ่งแต่ละคำออกเป็นอักขระ n-gram คำว่า "where" ที่มีความยาว n กรัม 3 จะกลายเป็น <wh, whe, her, ere, re> บวกกับโทเค็นคำเต็ม โดยที่วงเล็บมุมทำเครื่องหมายขอบเขตคำ เวกเตอร์ของคำคือผลรวมของเวกเตอร์ n-gram ซึ่งหมายความว่า FastText สามารถสร้างเวกเตอร์สำหรับคำที่ไม่อยู่ในคำศัพท์ เช่น "ความไม่น่าเชื่อ" จากชิ้นส่วนย่อยที่คุ้นเคย และรวบรวมสัณฐานวิทยาที่ใช้ร่วมกัน ดังนั้น "การวิ่ง" "นักวิ่ง" และ "การวิ่ง" จึงมีความสัมพันธ์กันอย่างเป็นธรรมชาติ โปรเจ็กต์เดียวกันนี้ยังมีตัวแยกประเภทข้อความเชิงเส้นที่รวดเร็วและแม่นยำ (โหมดควบคุม "fastText") ซึ่งใช้สำหรับงานต่างๆ เช่น การระบุภาษาและการแท็กในวงกว้าง

ข้อมูลเชิงลึกทางเทคนิค

อักขระ n-gram แต่ละตัวถูกแฮชลงในตารางถังขนาดคงที่และกำหนดเวกเตอร์ของตัวเอง การแสดงคำคือผลรวมของเวกเตอร์ n-gram ที่เป็นส่วนประกอบ ซึ่งได้รับการฝึกฝนด้วยวัตถุประสงค์ Skip-Gram การสุ่มตัวอย่างเชิงลบแบบเดียวกับ Word2Vec การแบ่งปันพารามิเตอร์คำย่อยระหว่างคำต่างๆ เป็นสาเหตุให้สัณฐานวิทยาถ่ายโอน และเหตุใดคำที่มองไม่เห็นจึงยังคงได้เวกเตอร์ที่สมเหตุสมผล ตัวแยกประเภทที่ได้รับการดูแลใช้โมเดลที่มีคุณสมบัติคล้ายกันซึ่งมีซอฟต์แม็กซ์แบบลำดับชั้น ทำให้ทำงานบน CPU ได้เร็วมาก

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการฝังคำย่อย FastText

แนวคิดคำย่อยของ FastText ได้รับการพิสูจน์แล้วว่าเป็นรากฐาน: หม้อแปลงสมัยใหม่ใช้เทคนิคที่เกี่ยวข้อง เช่น การเข้ารหัส Byte-Pair และการสร้างโทเค็น Word Piece เพื่อจัดการอินพุตใดๆ โดยไม่ต้องใช้คำศัพท์ที่ตายตัว Facebook เปิดตัวเวกเตอร์ FastText ที่ได้รับการฝึกอบรมมาแล้วสำหรับ 157 ภาษา ทำให้เป็นพื้นฐานสำหรับ NLP ที่พูดได้หลายภาษาและมีทรัพยากรต่ำ ซึ่งโมเดลขนาดใหญ่ไม่สามารถใช้งานได้จริง เนื่องจากโมเดลบนอุปกรณ์และ Edge ขนาดเล็กได้รับความสำคัญ พื้นที่ขนาดเล็กและความเร็ว CPU ของ FastText จึงทำให้มีความเกี่ยวข้องกับการจัดประเภทข้อความที่ใช้งานจริง

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างเวกเตอร์สำหรับคำที่สะกดผิดหรือไม่เคยเห็นมาก่อน เช่น "จริงๆ" หรือชื่อผลิตภัณฑ์ใหม่

เวกเตอร์โอเพ่นซอร์สที่ได้รับการฝึกอบรมล่วงหน้าของ Facebook ครอบคลุม 157 ภาษาสำหรับการค้นหาและการแท็กหลายภาษา

การระบุภาษาความเร็วสูงและการจำแนกสแปม/หัวข้อบน CPU ที่ไม่มี GPU

การจัดการกับภาษาที่มีความหลากหลายทางสัณฐานวิทยา เช่น ภาษาฟินแลนด์หรือภาษาตุรกี ซึ่งคำต่างๆ มีรูปแบบที่ผันแปรได้หลากหลาย

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FastText Subword Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การฝังตัวแทน Matryoshka

คำถามที่พบบ่อย

What is FastText Subword Embeddings?

FastText เป็นวิธีการของ Facebook AI ในปี 2016 ที่แสดงแต่ละคำในรูปแบบถุงอักขระ n-gram ดังนั้นจึงสามารถสร้างเวกเตอร์ได้แม้กระทั่งคำที่ไม่เคยเห็นระหว่างการฝึก วิธีการใช้คำย่อยนี้ใช้ได้กับภาษาที่มีสัณฐานวิทยามากมาย การพิมพ์ผิด และคำที่หายากซึ่ง Word2Vec และ GloVe ล้มเหลว

FastText นำเสนอคำเดียวได้อย่างไร

FastText แยกแต่ละคำออกเป็นอักขระ n-gram และรวมเวกเตอร์เพื่อสร้างตัวแทนของคำ

FastText เอาชนะข้อ จำกัด ที่สำคัญของ Word2Vec และ GloVe อะไรบ้าง

เนื่องจาก FastText ประกอบด้วยเวกเตอร์จากส่วนย่อยของคำ จึงสามารถสร้างตัวแทนของคำที่ไม่เคยเห็นในการฝึกได้

สำหรับคำว่า "where" ที่มี n-gram 3 ตัว ซึ่งเป็น n-gram ที่ถูกต้อง (มีเครื่องหมายขอบเขต)

"where" ให้ผลลัพธ์เป็นไตรแกรมเช่น <wh, whe, her, ere, re> บวกกับโทเค็นคำเต็ม "ไหน" เป็นหนึ่งในนั้น

โมเดลการฝังของ FastText สร้างขึ้นบนวัตถุประสงค์การฝึกอบรมพื้นฐานใด

FastText ขยาย Skip-Gram โดยมีวัตถุประสงค์ในการสุ่มตัวอย่างเชิงลบ โดยเพิ่มเวกเตอร์ n-gram ย่อย

เหตุใด FastText จึงมีประโยชน์เป็นพิเศษสำหรับภาษาอย่างฟินแลนด์หรือตุรกี

ภาษาที่มีความหลากหลายทางสัณฐานวิทยาก่อให้เกิดคำหลายรูปแบบ การแชร์เวกเตอร์คำย่อยช่วยให้ FastText เชื่อมโยงพวกมันได้อย่างเป็นธรรมชาติ