การเข้ารหัสแบบไบต์-คู่
การเข้ารหัสคู่ไบต์ (BPE) เป็นอัลกอริธึมที่ได้รับแรงบันดาลใจจากการบีบอัด ซึ่งสร้างคำศัพท์โดยการผสานคู่สัญลักษณ์ที่พบบ่อยที่สุดซ้ำๆ
ภาพรวม
It is the tokenizer behind GPT models, balancing tiny vocabularies of characters against huge vocabularies of whole words.
เจาะลึก
BPE เริ่มต้นด้วยการปฏิบัติต่อข้อความเป็นลำดับของอักขระแต่ละตัว (หรือไบต์ดิบ) จากนั้นจะนับคู่สัญลักษณ์ทุกคู่ที่อยู่ติดกัน รวมคู่ที่พบบ่อยที่สุดเข้ากับโทเค็นใหม่ และทำซ้ำหลายพันครั้ง การรวมแต่ละครั้งจะถูกบันทึกเป็นกฎ ลำดับตัวอักษรทั่วไป เช่น 'th', 'ing' หรือคำที่ใช้บ่อยทั้งหมดจะค่อยๆ กลายเป็นโทเค็นเดี่ยว ในขณะที่คำที่หายากจะยังคงถูกแบ่งออกเป็นชิ้นเล็กๆ เดิมทีเป็นวิธีการบีบอัดข้อมูลตั้งแต่ปี 1994 มันถูกปรับให้เข้ากับ NLP โดย Sennrich และคณะ ในปี 2559 สำหรับการแปลด้วยเครื่อง GPT-2 และ GPT-4 ใช้ BPE ระดับไบต์ ซึ่งทำงานบนไบต์ UTF-8 เพื่อให้สามารถเข้ารหัสอักขระ อีโมจิ หรือภาษาใดๆ ก็ได้โดยไม่มีข้อผิดพลาดที่ไม่เกี่ยวกับคำศัพท์เลย
ข้อมูลเชิงลึกทางเทคนิค
การฝึกอบรม BPE จะสร้างรายการกฎการรวมตามลำดับ ในการทำให้ข้อความใหม่เป็นโทเค็น อัลกอริธึมจะแยกข้อความออกเป็นไบต์/อักขระ และใช้การผสานอย่างตะกละตะกลามในลำดับความสำคัญเดียวกันจนกว่าจะไม่มีกฎที่ตรงกัน BPE ระดับไบต์รับประกันทางเลือกสำรอง: แม้แต่สัญลักษณ์ที่มองไม่เห็นก็สลายตัวเป็นไบต์ที่เป็นส่วนประกอบ ดังนั้นคำศัพท์ขนาด 256 ไบต์บวกกับการผสานที่เรียนรู้จึงครอบคลุมทุกสิ่งโดยไม่ต้องใช้โทเค็น UNK
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการเข้ารหัสแบบไบต์-คู่
BPE ยังคงเป็น tokenizer ที่ใช้งานได้จริง แต่ความกดดันกำลังเพิ่มขึ้นต่อโมเดลระดับไบต์หรืออักขระที่ข้ามการสร้างโทเค็นที่ชัดเจน หลีกเลี่ยงนิสัยแปลกๆ เช่น การแยกโค้ด คณิตศาสตร์ หรือสคริปต์ที่ไม่ใช่ภาษาอังกฤษอย่างอึดอัด การวิจัยเกี่ยวกับสถาปัตยกรรมที่ไม่มีโทเค็นและการเรียนรู้โทเค็นไนเซอร์มีจุดมุ่งหมายเพื่อแก้ไขอคติของ BPE ถึงกระนั้น ความเร็วและประสิทธิภาพในการบีบอัดก็หมายความว่าคำศัพท์สไตล์ BPE จะขับเคลื่อน LLM การผลิตส่วนใหญ่ในอนาคตอันใกล้นี้
การใช้งานจริงในโลกแห่งความเป็นจริง
GPT-2 และ GPT-4 ใช้ BPE ระดับไบต์ เพื่อให้สามารถเข้ารหัสอักขระ Unicode หรืออิโมจิได้โดยไม่มีข้อผิดพลาด
ระบบการแปลด้วยเครื่องใช้ BPE เพื่อแยกคำที่หายากหรือคำประสมออกเป็นส่วนย่อยที่สามารถนำมาใช้ซ้ำได้ซึ่งใช้ร่วมกันในภาษาต่างๆ
ไลบรารีโทเค็นของ Hugging Face ฝึกคำศัพท์ BPE สำหรับโดเมนที่กำหนดเอง เช่น ข้อความชีวการแพทย์หรือกฎหมาย
โมเดลโค้ดสร้างโทเค็นตัวระบุและคีย์เวิร์ดด้วย BPE โดยผสานรูปแบบที่พบบ่อย เช่น 'def' หรือ '==' ให้เป็นโทเค็นเดียว
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Byte-Pair Encoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Tokenization และการเข้ารหัสคู่ไบต์
คำถามที่พบบ่อย
What is Byte-Pair Encoding?
การเข้ารหัสคู่ไบต์ (BPE) เป็นอัลกอริธึมที่ได้รับแรงบันดาลใจจากการบีบอัด ซึ่งสร้างคำศัพท์โดยการผสานคู่สัญลักษณ์ที่พบบ่อยที่สุดซ้ำๆ เป็นโทเค็นไนเซอร์ที่อยู่เบื้องหลังโมเดล GPT ซึ่งสร้างสมดุลระหว่างคำศัพท์เล็กๆ ของตัวอักษรกับคำศัพท์ขนาดใหญ่ทั้งคำ
การดำเนินการหลักที่ BPE ทำซ้ำเพื่อสร้างคำศัพท์คืออะไร
BPE นับคู่สัญลักษณ์ที่อยู่ติดกันและรวมคู่สัญลักษณ์ที่พบบ่อยที่สุดให้เป็นโทเค็นใหม่ ทำซ้ำหลายพันครั้ง
BPE ปฏิบัติต่อข้อความอย่างไรเมื่อเริ่มการฝึกอบรม
BPE เริ่มต้นจากหน่วยที่เล็กที่สุด (อักขระหรือไบต์ดิบ) และเพิ่มโทเค็นให้ใหญ่ขึ้นผ่านการผสาน
เหตุใด BPE ระดับไบต์จึงหลีกเลี่ยงข้อผิดพลาดที่ไม่อยู่ในคำศัพท์ (UNK)
เนื่องจากคำศัพท์พื้นฐานมีทั้งหมด 256 ไบต์ แม้แต่สัญลักษณ์ที่มองไม่เห็นก็ยังถอยกลับไปเป็นตัวแทนไบต์
เดิมทีอัลกอริทึม BPE มาจากไหนก่อนที่ NLP จะนำมาใช้
BPE ได้รับการแนะนำเป็นเทคนิคการบีบอัดข้อมูลในปี 1994 และต่อมาได้รับการดัดแปลงสำหรับโทเค็นย่อยในปี 2559
เมื่อแปลงข้อความใหม่เป็นโทเค็น BPE จะนำกฎที่เรียนรู้ไปใช้อย่างไร
กฎการผสานได้รับคำสั่ง และโทเค็นจะใช้กฎเหล่านั้นอย่างตะกละตะกลามตามลำดับความสำคัญจนกว่าจะไม่มีกฎที่ตรงกันอีกต่อไป