คู่มือ AI ภาษา

การทำนายโทเค็นถัดไป

การทำนายโทเค็นถัดไปเป็นวัตถุประสงค์ที่เรียบง่ายหลอกลวงเบื้องหลังโมเดลสไตล์ GPT: เมื่อพิจารณาทุกอย่างแล้ว ให้เดาข้อความชิ้นถัดไป

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Repeated billions of times, this single task produces models that write, reason, and converse.

เจาะลึก

การทำนายโทเค็นถัดไปจะฝึกโมเดลเพื่อกำหนดความน่าจะเป็นให้กับโทเค็นถัดไปโดยพิจารณาจากโทเค็นก่อนหน้าทั้งหมด ขั้นแรกข้อความจะถูกแบ่งออกเป็นโทเค็น (ส่วนของคำย่อย) โดยโทเค็นไนเซอร์ เช่น การเข้ารหัสคู่ไบต์ หม้อแปลงไฟฟ้าที่ใช้ตัวถอดรหัสอย่างเดียวจะอ่านลำดับจากซ้ายไปขวา และส่งสัญญาณเอาท์พุตการแจกแจงความน่าจะเป็นไปยังคำศัพท์ทั้งหมดสำหรับตำแหน่งถัดไป ในระหว่างการฝึก โมเดลจะแสดงข้อความจำนวนมากและถูกลงโทษทุกครั้งที่กำหนดความน่าจะเป็นต่ำให้กับโทเค็นถัดไปจริง ในช่วงเวลาแห่งการสร้าง โมเดลจะสุ่มตัวอย่างหรือเลือกโทเค็นอย่างตะกละตะกลาม ผนวกเข้ากับมัน และทำซ้ำลูปนี้แบบถดถอยอัตโนมัติ วัตถุประสงค์ข้อนี้ขยายขนาดได้อย่างน่าทึ่ง: GPT-2, GPT-3 และผู้สืบทอดล้วนเรียนรู้ไวยากรณ์ ข้อเท็จจริง การแปล และการให้เหตุผลล้วนๆ โดยการทำนายโทเค็นถัดไปได้เป็นอย่างดี

ข้อมูลเชิงลึกทางเทคนิค

กลไกสำคัญคือความสนใจในตนเองเชิงสาเหตุ (โดยปกปิด) เมื่อทำนายตำแหน่ง N แบบจำลองอาจเข้าร่วมเฉพาะตำแหน่ง 1 ถึง N-1 เท่านั้น โดยไม่เคยมีอนาคต เลเยอร์เอาท์พุตจะฉายสถานะที่ซ่อนอยู่ขั้นสุดท้ายไปยังคำศัพท์ และใช้ softmax เพื่อรับความน่าจะเป็น การฝึกอบรมจะช่วยลดค่าเอนโทรปีข้าม เทียบเท่ากับการเพิ่มโอกาสสูงสุดให้กับข้อความที่สังเกต การควบคุมการสุ่มตัวอย่าง เช่น อุณหภูมิและ top-p ปรับรูปแบบการกระจายตัวที่อนุมานเพื่อแลกความคิดสร้างสรรค์กับความน่าเชื่อถือ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการทำนายโทเค็นถัดไป

การทำนายโทเค็นถัดไปเป็นรากฐานของโมเดลภาษาขนาดใหญ่ที่ทันสมัยทั้งหมด และจะยังคงเป็นแกนหลักของ AI เชิงสร้างสรรค์ การวิจัยกำลังขยายขอบเขตด้วยหน้าต่างบริบทที่ยาวขึ้น การถอดรหัสแบบเก็งกำไรและแบบขนานเพื่อความรวดเร็ว และวัตถุประสงค์การคาดการณ์หลายโทเค็นที่คาดเดาโทเค็นในอนาคตหลายรายการพร้อมกัน เสริมการเรียนรู้จากชั้นผลตอบรับของมนุษย์ที่อยู่ด้านบนเพื่อจัดแนวผลลัพธ์ ขอบเขตกำลังทำให้วัตถุประสงค์ง่ายๆ แบบเดียวกันถูกลง เร็วขึ้น และควบคุมได้มากขึ้นในขนาดที่ใหญ่ขึ้นกว่าเดิม

การใช้งานจริงในโลกแห่งความเป็นจริง

ขับเคลื่อน ChatGPT และผู้ช่วยที่คล้ายกันเพื่อสร้างการตอบกลับการสนทนาทีละโทเค็น

เติมข้อความอัตโนมัติและคำแนะนำโค้ดในเครื่องมือเช่น GitHub Copilot ขณะที่คุณพิมพ์

การร่างอีเมล บทความ และสำเนาการตลาดจากข้อความแจ้งสั้นๆ

การสร้างข้อความแบบเรียลไทม์ในตัวช่วยในการเขียนที่จะจบประโยคของคุณ

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Next-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การฝึกอบรมการทำนายหลายโทเค็น

คำถามที่พบบ่อย

What is Next-Token Prediction?

การทำนายโทเค็นถัดไปเป็นวัตถุประสงค์ที่เรียบง่ายหลอกลวงเบื้องหลังโมเดลสไตล์ GPT: เมื่อพิจารณาทุกอย่างแล้ว ให้เดาข้อความชิ้นถัดไป งานเดียวนี้ทำซ้ำหลายพันล้านครั้งเพื่อสร้างแบบจำลองที่เขียน ใช้เหตุผล และสนทนา

โมเดลการทำนายโทเค็นถัดไปจะส่งออกผลลัพธ์อย่างไรในแต่ละขั้นตอน

แบบจำลองนี้สร้างความน่าจะเป็นสำหรับโทเค็นถัดไปที่เป็นไปได้ทั้งหมด จากนั้นจะมีการเลือกหนึ่งรายการผ่านการสุ่มตัวอย่างหรือตัวเลือกที่ละโมบ

ตัวถอดรหัสสไตล์ GPT ใช้ความสนใจประเภทใด

การมาสก์เชิงสาเหตุช่วยให้แน่ใจว่าตำแหน่ง N สามารถมองเห็นได้เฉพาะตำแหน่งก่อนหน้านั้น โดยคงการตั้งค่าการทำนายจากซ้ายไปขวา

การสร้าง 'การถดถอยอัตโนมัติ' หมายถึงอะไรที่นี่

การสร้างแบบถดถอยอัตโนมัติจะสร้างหนึ่งโทเค็น เพิ่มลงในบริบท และวนซ้ำ

โดยทั่วไปฟังก์ชันการสูญเสียใดที่จะถูกย่อให้เล็กสุดระหว่างการฝึก?

เอนโทรปีข้ามจะลงโทษโมเดลในการกำหนดความน่าจะเป็นต่ำให้กับโทเค็นถัดไปที่แท้จริง ซึ่งเทียบเท่ากับการเพิ่มโอกาสสูงสุด

การเพิ่มอุณหภูมิระหว่างการเก็บตัวอย่างมีประโยชน์อย่างไร

อุณหภูมิที่สูงขึ้นจะทำให้การแจกแจงความน่าจะเป็นราบเรียบลง เพิ่มความสุ่ม อุณหภูมิที่ต่ำกว่าทำให้การเลือกเป็นแบบอนุรักษ์นิยมมากขึ้น