โทเค็นไลเซชันคำย่อย
การแปลงโทเค็นคำย่อยจะแยกข้อความออกเป็นหน่วยที่เล็กกว่าคำแต่ใหญ่กว่าอักขระ เช่น 'โทเค็น' บวก 'ไลเซชัน'
ภาพรวม
นี่คือวิธีมาตรฐานที่โมเดลภาษาสมัยใหม่เปลี่ยนข้อความให้กลายเป็นรหัสแยกที่พวกมันประมวลผลจริง ๆ โดยสมดุลระหว่างขนาดคําศัพท์กับความหมาย
เจาะลึก
มีคำมากเกินไปที่จะแจกแจง (คำศัพท์อาจมีขนาดใหญ่และพลาดคำที่หายาก) ในขณะที่อักขระตัวเดียวมีความหมายเพียงเล็กน้อยและทำให้ลำดับยาวมาก โทเค็นของคำย่อยคือการประนีประนอม: โดยจะเก็บคำที่ใช้บ่อยทั้งหมด แต่แบ่งคำที่หายากหรือซับซ้อนออกเป็นส่วนย่อยที่มีความหมาย 'ความทุกข์' อาจกลายเป็น 'un', 'happi', 'ness' อัลกอริธึมหลัก ได้แก่ Byte-Pair Encoding (ใช้โดย GPT), Word Piece (ใช้โดย BERT) และ Unigram/Sentence Piece (ใช้โดย T5 และโมเดลหลายภาษาจำนวนมาก) วิธีการนี้จะจัดการกับคำที่มองไม่เห็นได้อย่างงดงาม แบ่งปันส่วนต่างๆ ของคำที่เกี่ยวข้องกัน ('เล่น', 'กำลังเล่น', 'เล่นแล้ว') และรองรับทุกภาษา แต่ละแฟรกเมนต์จะแมปกับ ID จำนวนเต็ม และ ID เหล่านี้คือสิ่งที่เลเยอร์ที่ฝังของโมเดลแปลงเป็นเวกเตอร์
ข้อมูลเชิงลึกทางเทคนิค
อัลกอริธึมที่ต่างกันจะเลือกคำย่อยที่แตกต่างกัน: BPE จะรวมคู่จากล่างขึ้นบนบ่อยครั้ง Word Piece จะเลือกการผสานที่เพิ่มความเป็นไปได้ของคลังข้อมูลมากที่สุด และ Unigram เริ่มต้นด้วยคำศัพท์ขนาดใหญ่และโทเค็นพรุนที่ทำร้ายโอกาสน้อยที่สุด Word Piece ทำเครื่องหมายส่วนภายในคำด้วยคำนำหน้า '##' ในขณะที่ Sentence Piece ถือว่าช่องว่างเป็นสัญลักษณ์พิเศษ ดังนั้นจึงทำงานได้โดยตรงบนข้อความดิบโดยไม่ต้องแยกช่องว่างล่วงหน้า เหมาะสำหรับภาษาที่ไม่มีช่องว่าง
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของ Tokenization คำย่อย
การสร้างโทเค็นคำย่อยจะยังคงมีความโดดเด่นเนื่องจากมีความรวดเร็วและกะทัดรัด แต่จุดอ่อน การแยกทางคณิตศาสตร์ โค้ด และสคริปต์ที่หายากอย่างน่าอึดอัดใจ รวมถึงต้นทุนโทเค็นที่ไม่สม่ำเสมอในภาษาต่าง ๆ กำลังผลักดันการวิจัยไปสู่โมเดลระดับไบต์และไร้โทเค็น คาดว่าจะมีโทเค็นที่ชาญฉลาดยิ่งขึ้น อาจได้เรียนรู้หรือปรับตัวได้ และความเป็นธรรมในหลายภาษาที่ดีขึ้น ดังนั้นข้อความที่ไม่ใช่ภาษาอังกฤษจึงไม่ถูกลงโทษด้วยโทเค็นต่อประโยคที่มากขึ้น
การใช้งานจริงในโลกแห่งความเป็นจริง
BERT ใช้โทเค็นของ Word Piece โดยทำเครื่องหมายส่วนต่อเนื่อง เช่น '##ing' เพื่อสร้างคำต้นฉบับขึ้นมาใหม่
T5 และโมเดลหลายภาษาจำนวนมากใช้ Sentence Piece ซึ่งจัดการภาษาที่ไม่ต้องใช้พื้นที่ เช่น ภาษาญี่ปุ่น โดยตรง
โมเดลการแชทแบ่งคำศัพท์ทางเทคนิคที่หายากออกเป็นส่วนที่รู้จัก แทนที่จะล้มเหลวกับคำที่ไม่รู้จัก
Tokenizers แบ่งปันคำย่อยระหว่าง 'run', 'running' และ 'runner' ทำให้แบบจำลองสามารถสรุปลักษณะทางสัณฐานวิทยาได้อย่างมีประสิทธิภาพ
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Subword Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างโทเค็น Sentence Piece
คำถามที่พบบ่อย
Subword Tokenization คืออะไร?
การแปลงโทเค็นคำย่อยจะแยกข้อความออกเป็นหน่วยที่เล็กกว่าคำแต่ใหญ่กว่าอักขระ เช่น 'โทเค็น' บวก 'ไลเซชัน' นี่เป็นวิธีมาตรฐานที่โมเดลภาษาสมัยใหม่เปลี่ยนข้อความให้เป็น ID ที่ไม่ต่อเนื่องที่พวกเขาประมวลผลจริง โดยรักษาสมดุลขนาดคำศัพท์กับความหมาย
โทเค็นไลเซชันของคำย่อยแก้ปัญหาอะไรได้เมื่อเปรียบเทียบกับการใช้ทั้งคำ
คำศัพท์ทั้งคำมีขนาดใหญ่มากและยังขาดคำที่หายาก คำย่อยทำให้คำศัพท์สามารถจัดการได้และแยกคำที่ไม่รู้จักได้อย่างสวยงาม
ข้อใดต่อไปนี้เป็นอัลกอริธึม subword tokenization ที่ BERT ใช้
BERT ใช้ Word Piece ซึ่งเลือกการผสานที่เพิ่มความเป็นไปได้ในคลังข้อมูลการฝึกอบรมมากที่สุด
โดยทั่วไปแล้ว Word Piece จะทำเครื่องหมายชิ้นส่วนที่ต่อคำได้อย่างไร
Word Piece นำหน้าคำย่อยภายในคำด้วย '##' ดังนั้น 'กำลังเล่น' จึงกลายเป็น 'เล่น' บวกกับ '##ing'
เหตุใด Sentence Piece จึงเหมาะสมกับภาษาอย่างภาษาญี่ปุ่น
Sentence Piece ดำเนินการกับข้อความดิบและเข้ารหัสช่องว่างเป็นสัญลักษณ์พิเศษ ดังนั้นจึงทำงานได้แม้ว่าจะไม่มีการเว้นวรรคระหว่างคำก็ตาม
ในที่สุดแต่ละส่วนของคำย่อยจะจับคู่กับอะไรก่อนที่จะถึงโมเดล
คำย่อยแต่ละคำจะได้รับการกำหนด ID จำนวนเต็ม ซึ่งเลเยอร์ที่ฝังไว้จะกลายเป็นเวกเตอร์ที่โมเดลสามารถประมวลผลได้