การสร้างโทเค็น Word Piece
Word Piece เป็นอัลกอริธึมการแปลงโทเค็นคำย่อยที่ขับเคลื่อน BERT และโมเดล Google จำนวนมาก โดยแยกคำออกเป็นส่วนย่อยที่นำมาใช้ซ้ำได้ เพื่อให้โมเดลสามารถจัดการข้อความใดๆ ที่มีคำศัพท์คงที่ได้
ภาพรวม
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
เจาะลึก
Word Piece สร้างคำศัพท์ของหน่วยคำย่อย แทนที่จะเป็นทั้งคำหรืออักขระตัวเดียว เริ่มต้นจากตัวละครแต่ละตัว โดยผสมผสานสัญลักษณ์คู่เข้าด้วยกันอย่างตะกละตะกลามซึ่งเพิ่มโอกาสของคลังข้อมูลการฝึกมากที่สุด ทำซ้ำจนกระทั่งถึงขนาดคำศัพท์เป้าหมาย (BERT ใช้ประมาณ 30,000 โทเค็น) ในการอนุมาน ระบบจะโทเค็นจากซ้ายไปขวาอย่างตะกละตะกลาม โดยจับคู่คำย่อยที่ยาวที่สุดในคำศัพท์ จากนั้นจึงดำเนินการต่อในส่วนที่เหลือ ส่วนต่อเนื่องในคำจะมีเครื่องหมาย '##' นำหน้า ดังนั้น 'กำลังเล่น' จึงกลายเป็น 'เล่น' + '##ing' วิธีนี้ช่วยแก้ปัญหาที่ไม่มีคำศัพท์: คำที่หายากหรือที่มองไม่เห็นนั้นถูกแยกย่อยเป็นส่วนที่รู้จัก เหลือเพียงอักขระตัวเดียวหากจำเป็น ในขณะที่คำทั่วไปยังคงเป็นโทเค็นเดียวเพื่อประสิทธิภาพ
ข้อมูลเชิงลึกทางเทคนิค
Word Piece แตกต่างจากการเข้ารหัส Byte-Pair ในเกณฑ์การรวม BPE จะรวมคู่ที่อยู่ติดกันบ่อยที่สุด Word Piece ผสานคู่ที่เพิ่มความเป็นไปได้สูงสุดในข้อมูลการฝึกอบรม โดยเลือกคู่ที่มีความถี่ร่วมมากที่สุดเกินกว่าผลคูณของความถี่ของชิ้นส่วน เครื่องหมาย '##' แยกความแตกต่างระหว่างส่วนเริ่มต้นของคำจากส่วนต่อเนื่อง โดยปล่อยให้ tokenizer สร้างขอบเขตของคำขึ้นใหม่อย่างไม่คลุมเครือเมื่อถอดรหัสกลับไปเป็นข้อความ
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการสร้างโทเค็น Word Piece
โมเดลภาษาขนาดใหญ่ที่ใหม่กว่านิยมใช้โมเดลยูนิแกรมระดับไบต์ (ตระกูล GPT) หรือ Sentence Piece มากขึ้น ซึ่งหลีกเลี่ยงการประมวลผลล่วงหน้าเฉพาะภาษาและจัดการอินพุต Unicode ใดๆ Word Piece ยังคงเป็นรากฐานในตัวเข้ารหัสที่ได้รับจาก BERT ซึ่งยังคงใช้งานอย่างกว้างขวางสำหรับการค้นหาและการจัดหมวดหมู่ คาดว่าจะมีการใช้อย่างต่อเนื่องใน NLP ที่ใช้งานจริง ควบคู่ไปกับการวิจัยเกี่ยวกับไบต์และโมเดลอักขระที่ไม่มีโทเค็น ซึ่งอาจลดการพึ่งพาคำศัพท์ย่อยที่ตายตัวโดยสิ้นเชิงในที่สุด
การใช้งานจริงในโลกแห่งความเป็นจริง
BERT โทเค็นคำค้นหาใน Google การค้นหา โดยแบ่งคำที่ไม่คุ้นเคยออกเป็นคำย่อย เพื่อให้โมเดลยังคงสามารถจับคู่หน้าที่เกี่ยวข้องได้
BertTokenizer ของ Hugging Face ใช้ Word Piece เพื่อแปลงข้อความดิบเป็นรหัสโทเค็นที่ป้อนให้กับ BERT สำหรับการวิเคราะห์ความรู้สึกและการจดจำเอนทิตีที่มีชื่อ
BERT หลายภาษาใช้คำศัพท์ Word Piece ที่ใช้ร่วมกันในกว่า 100 ภาษา ทำให้สามารถนำส่วนต่างๆ มาใช้ซ้ำในสคริปต์ที่เกี่ยวข้องได้
DitilBERT และ BERT ทางคลินิก/ชีวการแพทย์สืบทอดต่อจาก Word Piece โดยจัดการกับศัพท์ทางการแพทย์ที่หายาก เช่น 'โรคปอดบวม' โดยการแยกคำเหล่านี้ออกเป็นส่วนๆ ที่รู้จัก
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โทเค็นไลเซชันคำย่อย
คำถามที่พบบ่อย
What is WordPiece Tokenization?
Word Piece เป็นอัลกอริธึมการแปลงโทเค็นคำย่อยที่ขับเคลื่อน BERT และโมเดล Google จำนวนมาก โดยแยกคำออกเป็นส่วนย่อยที่นำมาใช้ซ้ำได้ เพื่อให้โมเดลสามารถจัดการข้อความใดๆ ที่มีคำศัพท์คงที่ได้ นี่คือสาเหตุที่แบบจำลองที่ไม่เคยเห็น 'ความทุกข์' มาก่อนยังสามารถเข้าใจได้โดยการอ่าน 'un', '##happy' และ '##ness'
คำนำหน้า '##' ระบุอะไรในเอาต์พุต Word Piece
Word Piece ทำเครื่องหมายความต่อเนื่องของคำย่อยด้วย '##' ดังนั้น 'กำลังเล่น' จะกลายเป็น 'เล่น' + '##ing' เพื่อให้ตัวถอดรหัสสร้างขอบเขตคำขึ้นใหม่
คำศัพท์ Word Piece ที่ใช้โดย BERT ดั้งเดิมมีขนาดใหญ่เพียงใด
BERT ใช้คำศัพท์ WordPie ซึ่งประกอบด้วยหน่วยคำย่อยประมาณ 30,000 หน่วย เพื่อสร้างความสมดุลระหว่างการครอบคลุมกับขนาดตารางที่ฝัง
เกณฑ์การรวมของ Word Piece แตกต่างจากการเข้ารหัส Byte-Pair มาตรฐานอย่างไร
BPE จะรวมคู่ที่อยู่ติดกันบ่อยที่สุด ในขณะที่ Word Piece จะรวมคู่ที่เพิ่มความเป็นไปได้ในคลังข้อมูลมากที่สุด โดยเลือกคู่ที่มีความถี่ข้อต่อมากกว่าผลคูณของชิ้นส่วน
Word Piece จัดการกับคำที่ไม่เคยเห็นระหว่างการฝึกอบรมอย่างไร
คำที่มองไม่เห็นจะถูกแบ่งออกเป็นคำย่อยที่ยาวที่สุดที่รู้จัก และถอยกลับไปเป็นอักขระเดี่ยว ซึ่งช่วยแก้ปัญหาคำศัพท์ไม่หมด
ในเวลาอนุมาน Word Piece เลือกวิธีแยกคำอย่างไร
Word Piece โทเค็นอย่างตะกละตะกลาม โดยจับคู่รายการคำศัพท์ที่ยาวที่สุดโดยเริ่มต้นที่ตำแหน่งปัจจุบัน จากนั้นทำซ้ำในส่วนที่เหลือ