Tokenization และการเข้ารหัสคู่ไบต์
โทเค็นไนซ์จะแบ่งข้อความออกเป็นหน่วยเล็กๆ ตามที่โมเดลภาษาอ่านได้จริง และการเข้ารหัสคู่ไบต์ (BPE) เป็นวิธีที่ได้รับความนิยมในการสร้างคำศัพท์นั้น
ภาพรวม
It balances having a manageable vocabulary against handling any word the model might encounter.
เจาะลึก
โมเดลภาษาจะไม่เห็นอักขระดิบหรือทั้งคำ โดยจะเห็นโทเค็น รหัสจำนวนเต็มที่ถูกแมปกับส่วนของข้อความ การเลือกชิ้นส่วนเหล่านั้นถือเป็นข้อดี: คำศัพท์ระดับคำมีขนาดใหญ่และทำให้คำที่มองไม่เห็นหรือสะกดผิดติดขัด ในขณะที่คำศัพท์ระดับตัวละครจะทำให้ลำดับยาวมาก การเข้ารหัสคู่ไบต์เน้นที่จุดกึ่งกลาง ยืมมาจากอัลกอริธึมการบีบอัดข้อมูลในทศวรรษ 1990 BPE เริ่มต้นจากอักขระแต่ละตัว (หรือไบต์ดิบ) และรวมคู่ที่อยู่ติดกันบ่อยที่สุดเข้ากับโทเค็นใหม่ซ้ำ ๆ เพื่อเพิ่มคำศัพท์ไปสู่คำย่อยทั่วไป คำที่ใช้บ่อยๆ จะกลายเป็นสัญลักษณ์เดี่ยวๆ ในขณะที่คำที่หายากจะแบ่งออกเป็นเศษๆ ที่นำมาใช้ซ้ำได้ BPE ระดับไบต์ซึ่งใช้โดยโมเดล GPT ทำงานบนไบต์ดิบ เพื่อให้สามารถแสดงข้อความ Unicode ใดๆ รวมถึงอิโมจิและภาษาใดๆ ก็ได้ โดยไม่มีข้อผิดพลาดจากคำศัพท์เลย
ข้อมูลเชิงลึกทางเทคนิค
การฝึกอบรม BPE เป็นเรื่องที่โลภและขับเคลื่อนด้วยความถี่ เริ่มต้นจากตัวอักษรพื้นฐาน โดยจะนับคู่สัญลักษณ์ที่อยู่ติดกันทั่วทั้งคลังข้อมูลและรวมคู่ที่พบบ่อยที่สุด โดยบันทึกการผสานแต่ละครั้งตามกฎ การทำซ้ำหลายพันครั้งนี้จะทำให้เกิดรายการผสานที่เรียงลำดับและคำศัพท์คงที่ ในการอนุมาน ข้อความจะถูกเข้ารหัสโดยใช้กฎการผสานเหล่านั้นตามลำดับ นี่คือสาเหตุที่การนับโทเค็นไม่ค่อยตรงกับจำนวนคำ การเว้นวรรค การใช้อักษรตัวพิมพ์ใหญ่ และคำที่หายาก ล้วนเปลี่ยนวิธีการแบ่งส่วนของข้อความเป็นโทเค็น และคำเดียวสามารถกลายเป็นโทเค็นได้หลายรายการ
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการแปลงโทเค็นและการเข้ารหัสคู่ไบต์
Tokenization อยู่ระหว่างการคิดใหม่อย่างแข็งขัน โมเดลระดับไบต์และอักขระ เช่น ByT5 และสถาปัตยกรรมไร้โทเค็นหรือสถาปัตยกรรม 'ไบต์แฝง' ที่เกิดขึ้นใหม่ มีเป้าหมายที่จะทิ้งคำศัพท์คงที่ทั้งหมด เพื่อให้โมเดลจัดการกับอินพุตและภาษาใด ๆ ได้อย่างเท่าเทียมกัน นักวิจัยยังจัดการกับความเป็นธรรมของโทเค็นด้วย — ภาษาที่ไม่ใช่ภาษาอังกฤษและทรัพยากรต่ำจำนวนมากในปัจจุบันมีราคาโทเค็นต่อประโยคสูงกว่ามาก ทำให้ราคาสูงขึ้นและลดบริบทที่มีประสิทธิภาพลง คาดว่าโทเค็นไนเซอร์จะได้รับการปรับแต่งสำหรับโค้ด คณิตศาสตร์ และความสมดุลในหลายภาษา รวมถึงการทดลองอย่างต่อเนื่องเพื่อผลักดันขอบเขตกลับไปสู่ไบต์ดิบ
การใช้งานจริงในโลกแห่งความเป็นจริง
โมเดล GPT และ Llama ใช้โทเค็นสไตล์ BPE เพื่อเปลี่ยนข้อความแจ้งเป็นรหัสโทเค็นที่เครือข่ายดำเนินการ
ราคา API และขีดจำกัดหน้าต่างบริบทจะวัดเป็นโทเค็น ดังนั้นโทเค็นจึงส่งผลโดยตรงต่อต้นทุนและจำนวนข้อความที่พอดี
การจัดการอีโมจิ โค้ด และคำที่หายากอย่างงดงามโดยการแยกออกเป็นคำย่อยหรือแฟรกเมนต์ไบต์ที่นำมาใช้ซ้ำได้
รองรับหลายภาษาในรูปแบบเดียวโดยไม่ต้องมีพจนานุกรมแยกต่างหากต่อภาษา ผ่านการเข้ารหัสระดับไบต์
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenization and Byte Pair Encoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การเข้ารหัสแบบไบต์-คู่
คำถามที่พบบ่อย
What is Tokenization and Byte Pair Encoding?
โทเค็นไนซ์จะแบ่งข้อความออกเป็นหน่วยเล็กๆ ตามที่โมเดลภาษาอ่านได้จริง และการเข้ารหัสคู่ไบต์ (BPE) เป็นวิธีที่ได้รับความนิยมในการสร้างคำศัพท์นั้น ทำให้การมีคำศัพท์ที่สามารถจัดการได้สมดุลกับการจัดการคำใดๆ ที่โมเดลอาจพบ
โทเค็นไนซ์สร้างอะไรให้โมเดลภาษาอ่านได้
โมเดลทำงานบนโทเค็น — ID จำนวนเต็มที่ใช้แทนอักขระ คำย่อย หรือคำ — แทนที่จะเป็นสตริงข้อความดิบ
Byte Pair Encoding สร้างคำศัพท์ได้อย่างไร
BPE เริ่มต้นจากอักขระหรือไบต์ และผสานคู่ที่อยู่ติดกันบ่อยที่สุดอย่างตะกละตะกลาม แล้วค่อย ๆ สร้างโทเค็นคำย่อยทั่วไป
วิธีคำย่อยเช่น BPE แก้ปัญหาอะไรได้บ้างเมื่อเปรียบเทียบกับโทเค็นระดับคำ
คำศัพท์ระดับคำล้มเหลวกับคำที่มองไม่เห็น โทเค็นย่อยของคำย่อยจะแบ่งคำที่หายากออกเป็นส่วน ๆ ที่รู้จัก หลีกเลี่ยงปัญหาคำศัพท์ที่ไม่อยู่ในขณะเดียวกันก็รักษาคำศัพท์ให้สามารถจัดการได้
ข้อดีของ BPE ระดับไบต์ที่ใช้ในรุ่น GPT คืออะไร
การทำงานบนไบต์ดิบหมายถึงทุกอินพุตที่เป็นไปได้สามารถเข้ารหัสได้ ดังนั้นจึงไม่มีอักขระที่ไม่รู้จักอย่างแท้จริงโดยไม่คำนึงถึงภาษาหรือสัญลักษณ์
เหตุใดการนับโทเค็นของโมเดลจึงมักจะแตกต่างจากจำนวนคำในประโยค
การสร้างโทเค็นคำย่อยสามารถแบ่งคำเดียวออกเป็นหลายส่วนได้ และไวต่อการเว้นวรรคและตัวพิมพ์ ดังนั้นโทเค็นจึงไม่ค่อยมีจำนวนคำเท่ากัน