คู่มือพื้นฐาน

โทเค็น

Tokenization เป็นขั้นตอนที่สับข้อความเป็นส่วนเล็กๆ ที่เรียกว่า token ซึ่งเป็นหน่วยที่โมเดลภาษาอ่านและทำนายได้จริง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

เจาะลึก

ก่อนที่โมเดลจะเห็นข้อความของคุณ โทเค็นไนเซอร์จะแยกออกเป็นโทเค็น ซึ่งโดยปกติจะเป็นส่วนของคำย่อย แทนที่จะเป็นคำทั้งหมดหรือตัวอักษรตัวเดียว คำว่า 'ความทุกข์' อาจกลายเป็น 'un', 'ความสุข' หรือ 'tokenization' อาจแบ่งออกเป็น 'token' และ 'ization' คำทั่วไปมักจะจับคู่กับโทเค็นเดียว ในขณะที่คำ ชื่อ หรือรหัสที่หายากแบ่งออกเป็นหลายคำ จากนั้นแต่ละโทเค็นจะถูกแมปกับหมายเลข ID ที่โมเดลแปลงเป็นเวกเตอร์ สิ่งนี้มีความสำคัญในทางปฏิบัติเนื่องจากโมเดลมีหน้าต่างบริบทคงที่ซึ่งวัดเป็นโทเค็น และ APIs เรียกเก็บเงินต่อโทเค็น ดังนั้นกฎง่ายๆ ของภาษาอังกฤษคือประมาณ 4 อักขระหรือ 0.75 คำต่อโทเค็น โทเค็นไนเซชันยังอธิบายลักษณะเฉพาะของโมเดลคลาสสิกด้วย นั่นคือ การนับตัวอักษรหรือการสะกดคำให้ถูกต้องเป็นเรื่องยาก เนื่องจากโมเดลมองเห็นชิ้นส่วน ไม่ใช่อักขระแต่ละตัว

ข้อมูลเชิงลึกทางเทคนิค

LLM สมัยใหม่ส่วนใหญ่ใช้โทเค็นคำย่อย เช่น Byte Pair Encoding (BPE) หรือตัวแปรระดับไบต์ BPE เริ่มต้นจากอักขระและรวมคู่ที่อยู่ติดกันบ่อยที่สุดซ้ำแล้วซ้ำเล่าเพื่อสร้างคำศัพท์คงที่ (มักจะมีโทเค็น 30,000 ถึง 100,000+ รายการ) สิ่งนี้ทำให้เกิดความสมดุลระหว่างสองขั้ว: โทเค็นระดับคำไม่สามารถจัดการกับคำที่มองไม่เห็นได้ ในขณะที่ระดับอักขระจะทำให้ลำดับยาวมาก คำย่อยช่วยให้โมเดลเป็นตัวแทนของสตริงใดๆ ก็ตาม รวมถึงการสะกดผิดและคำใหม่ ด้วยการเขียนส่วนที่รู้จัก ขณะเดียวกันก็รักษาลำดับให้สั้นพอสมควร

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของโทเค็น

Tokenization เป็นสาขาการวิจัยเชิงรุกเนื่องจากจำกัดประสิทธิภาพและความเป็นธรรม ภาษาที่แปลงเป็นชิ้นส่วนมากขึ้นมีค่าใช้จ่ายมากขึ้นและใช้บริบทได้เร็วขึ้น ดังนั้นความเป็นธรรมในหลายภาษาจึงเป็นเรื่องที่ต้องคำนึงถึงอย่างแท้จริงด้วยคำศัพท์ที่ดีและสมดุลมากขึ้น นักวิจัยยังกำลังสำรวจโมเดลที่ไม่มีโทเค็นหรือระดับไบต์ (เช่น ByT5) และเรียนรู้การใช้โทเค็นซึ่งสามารถขจัดขั้นตอนการปรับแต่งที่เปราะบางด้วยมือโดยสิ้นเชิงได้ สำหรับตอนนี้ คาดว่าจะมีคำศัพท์มากขึ้น โทเค็นไนเซอร์หลายภาษาที่ชาญฉลาดยิ่งขึ้น และการรับรู้ของผู้ใช้ที่เพิ่มขึ้นเกี่ยวกับการกำหนดราคาตามโทเค็นและการกำหนดงบประมาณตามบริบท

การใช้งานจริงในโลกแห่งความเป็นจริง

ราคา API สำหรับโมเดล เช่น GPT และ Claude จะถูกเรียกเก็บเงินต่อโทเค็นอินพุตและเอาต์พุต ดังนั้นการนับโทเค็นจึงส่งผลโดยตรงต่อต้นทุน

ขีดจำกัดหน้าต่างบริบท (เช่น โทเค็น 128K หรือ 200K) จะวัดเป็นโทเค็น โดยกำหนดจำนวนข้อความหรือโค้ดที่คุณสามารถใส่ได้

นักพัฒนาใช้โทเค็น (เช่น tiktoken) เพื่อประมาณขนาดที่พร้อมท์และตัดเนื้อหาก่อนส่งคำขอ

Tokenization อธิบายว่าทำไมโมเดลถึงมีปัญหาในการนับตัวอักษรในคำหรือย้อนกลับสตริง เนื่องจากพวกเขาเห็นกลุ่มคำย่อย ไม่ใช่ตัวอักษร

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่การใช้ Tokenization ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างโทเค็น Sentence Piece

คำถามที่พบบ่อย

What is Tokenization?

Tokenization เป็นขั้นตอนที่สับข้อความเป็นส่วนเล็กๆ ที่เรียกว่า token ซึ่งเป็นหน่วยที่โมเดลภาษาอ่านและทำนายได้จริง โดยจะกำหนดต้นทุน ขีดจำกัดบริบท และแม้กระทั่งว่าโมเดลจัดการกับการสะกดและคำที่หายากได้ดีเพียงใด

'โทเค็น' ในบริบทของโมเดลภาษาคืออะไร

โทเค็นเป็นหน่วยที่โมเดลดำเนินการ ซึ่งมักจะเป็นหน่วยคำย่อย บางครั้งอาจเป็นทั้งคำหรืออักขระเดี่ยว

LLM สมัยใหม่ส่วนใหญ่ใช้วิธีการโทเค็นไนเซชันแบบใด

วิธีการใช้คำย่อย เช่น BPE จะผสานคู่อักขระที่ใช้บ่อย เพื่อสร้างสมดุลระหว่างจุดอ่อนของวิธีระดับคำและระดับอักขระล้วนๆ

เหตุใดการแปลงโทเค็นจึงทำให้งานต่างๆ เช่น การนับตัวอักษรในคำเป็นเรื่องยากสำหรับ LLM

เนื่องจากข้อความถูกจัดกลุ่มเป็นโทเค็นคำย่อย โมเดลจึงไม่รับรู้อักขระแต่ละตัวโดยตรง ทำให้งานระดับตัวอักษรเกิดข้อผิดพลาดได้ง่าย

เหตุใดโทเค็นจึงมีความสำคัญต่อต้นทุน API และขีดจำกัดบริบท

การเรียกเก็บเงินของผู้ให้บริการต่อโทเค็นและกรอบเวลาบริบทมีขนาดเป็นโทเค็น ดังนั้นจำนวนโทเค็นจึงขับเคลื่อนทั้งราคาและจำนวนเงินที่คุณสามารถรวมได้

เหตุใดประโยคเดียวกันจึงมีราคาโทเค็นในบางภาษามากกว่าภาษาอังกฤษ

คำศัพท์ที่ได้รับการฝึกเป็นภาษาอังกฤษเป็นส่วนใหญ่ จะแบ่งภาษาอื่นๆ ออกเป็นโทเค็นมากขึ้น ทำให้มีค่าใช้จ่ายมากขึ้นและอ่านบริบทได้เร็วขึ้น