คู่มือ AI ภาษา

การสร้างโทเค็น Sentence Piece

Sentence Piece เป็นโทเค็นที่ไม่เชื่อเรื่องภาษาที่เรียนรู้วิธีแยกข้อความดิบออกเป็นส่วนย่อยของคำโดยตรงจากข้อมูล โดยไม่ต้องอาศัยช่องว่าง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It made multilingual models far easier to build by treating any language the same way.

เจาะลึก

โทเค็นไนเซอร์ส่วนใหญ่จะถือว่าคำต่างๆ ถูกคั่นด้วยช่องว่าง ซึ่งใช้คำต่างๆ เช่น ญี่ปุ่น จีน หรือไทยที่ไม่ได้ใช้ Sentence Piece ซึ่งเผยแพร่โดย Google ในปี 2018 หลีกเลี่ยงสิ่งนี้โดยถือว่าอินพุตเป็นเหมือนกระแสข้อมูลดิบของอักขระ — รวมช่องว่าง — และการเรียนรู้คำศัพท์ของหน่วยคำย่อยจากข้อมูลนั้นเอง มีชื่อเสียงแทนที่ช่องว่างด้วยเครื่องหมายที่มองเห็นได้ (สัญลักษณ์เมตาที่มีลักษณะคล้ายขีดล่าง) ดังนั้นโทเค็นจึงสามารถย้อนกลับได้อย่างสมบูรณ์: คุณสามารถสร้างข้อความต้นฉบับใหม่ได้ทุกเมื่อ Sentence Piece รองรับอัลกอริธึมหลักสองอัลกอริธึม ได้แก่ Byte-Pair Encoding (BPE) และโมเดลภาษา Unigram ซึ่งวิธีหลังเป็นวิธีลายเซ็น เนื่องจากไม่จำเป็นต้องมีการสร้างโทเค็นล่วงหน้าเฉพาะภาษา ไปป์ไลน์เดียวกันจึงใช้งานได้ในหลายร้อยภาษา ซึ่งเป็นสาเหตุที่ทำให้โมเดลอย่าง T5, ALBERT และระบบหลายภาษาจำนวนมากต้องพึ่งพาสิ่งนี้

ข้อมูลเชิงลึกทางเทคนิค

อัลกอริธึม Unigram ของ Sentence Piece เริ่มต้นด้วยคำศัพท์ที่มีผู้สมัครจำนวนมาก และตัดทอนชิ้นส่วนที่มีส่วนมีโอกาสน้อยที่สุดในคลังข้อมูลการฝึกอบรมซ้ำๆ โดยใช้ขั้นตอนการเพิ่มความคาดหวัง เครื่องหมายช่องว่างที่มองเห็นได้ (สัญลักษณ์เมตา) ช่วยให้สามารถแปลงโทเค็นและสลายโทเค็นได้โดยไม่สูญเสียคุณภาพ นอกจากนี้ยังสามารถทำงานในระดับไบต์ รับประกันว่าอักขระใดๆ แม้แต่อิโมจิหรือสคริปต์ที่มองไม่เห็น ก็สามารถแสดงได้โดยไม่เกิดข้อผิดพลาดจากคำศัพท์

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของโทเค็น Sentence Piece

Sentence Piece ยังคงเป็นม้าทำงานสำหรับโมเดลหลายภาษาและโค้ดเนื่องจากการย้อนกลับได้และความเป็นกลางของภาษา สาขาวิชานี้กำลังค่อยๆ สำรวจแนวทางระดับไบต์และไม่ใช้โทเค็น ซึ่งจะข้ามคำศัพท์ย่อยทั้งหมด โดยมีเป้าหมายเพื่อขจัดนิสัยแปลกๆ ของโทเค็นที่ทำร้ายเลขคณิต ภาษาที่หายาก และตัวเลขที่ยาว ถึงกระนั้นก็ตาม การออกแบบ Unigram และ byte-fallback ของ Sentence Piece ยังคงมีอิทธิพลต่อโทเค็นไนเซอร์รุ่นใหม่ และปรัชญาการฝึกจากข้อความดิบที่ไม่สูญเสียจะยังคงเป็นรากฐานสำหรับอนาคตอันใกล้นี้

การใช้งานจริงในโลกแห่งความเป็นจริง

โมเดล T5 ของ Google ซึ่งใช้คำศัพท์ Sentence Piece ที่ได้รับการฝึกอบรมเกี่ยวกับข้อความเว็บหลายภาษา

โทเค็นไลซ์ข้อความภาษาญี่ปุ่นหรือจีนที่ไม่มีช่องว่างระหว่างคำ โดยที่โทเค็นไลเซอร์แบบคำไม่สามารถทำได้

สร้างคำศัพท์ที่ใช้ร่วมกันเพียงคำเดียวในกว่า 100 ภาษาสำหรับระบบการแปลหลายภาษา

การสร้างอินพุตดั้งเดิมใหม่โดยไม่สูญเสียคุณภาพ (รวมถึงการเว้นวรรค) จากโทเค็น มีประโยชน์สำหรับการสร้างโค้ดที่ช่องว่างมีความสำคัญ

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SentencePiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โทเค็นไลเซชันคำย่อย

คำถามที่พบบ่อย

What is SentencePiece Tokenization?

Sentence Piece เป็นโทเค็นที่ไม่เชื่อเรื่องภาษาที่เรียนรู้วิธีแยกข้อความดิบออกเป็นส่วนย่อยของคำโดยตรงจากข้อมูล โดยไม่ต้องอาศัยช่องว่าง มันทำให้การสร้างโมเดลหลายภาษาง่ายขึ้นมากโดยการปฏิบัติกับภาษาใดๆ ก็ตามในลักษณะเดียวกัน

สมมติฐานหลักใดที่ Sentence Piece หลีกเลี่ยงการใช้โทเค็นแบบดั้งเดิมที่ต้องพึ่งพา

Sentence Piece ถือว่าอินพุตเป็นสตรีมอักขระดิบ ดังนั้นจึงใช้งานได้แม้กับภาษาที่ไม่มีช่องว่างระหว่างคำ

เหตุใด Sentence Piece จึงแทนที่ช่องว่างด้วยสัญลักษณ์เมตาที่มองเห็นได้

การเข้ารหัสช่องว่างเป็นเครื่องหมายที่มองเห็นได้หมายความว่าข้อความต้นฉบับรวมถึงการเว้นวรรคจะสามารถสร้างใหม่ได้ทุกประการ

Sentence Piece รองรับอัลกอริธึมสองตัวใดเป็นหลัก

Sentence Piece เสนอการเข้ารหัส Byte-Pair (BPE) และโมเดลภาษา Unigram โดยที่ Unigram เป็นวิธีลายเซ็น

โมเดล Unigram สร้างคำศัพท์ได้อย่างไร

Unigram เริ่มต้นด้วยชิ้นส่วนของผู้สมัครจำนวนมาก และค่อย ๆ ลบชิ้นส่วนที่มีส่วนทำให้เกิดความเป็นไปได้น้อยที่สุดโดยใช้ Expectation-Maximization

โมเดลใดที่มีชื่อเสียงในการใช้โทเค็น SentencePiece?

T5 ของ Google ใช้คำศัพท์ Sentence Piece เช่นเดียวกับ ALBERT และโมเดลหลายภาษา