การฝึกอบรมการทำนายหลายโทเค็น
แทนที่จะทำนายโทเค็นถัดไป แบบจำลองได้รับการฝึกฝนให้ทำนายโทเค็นในอนาคตหลายรายการพร้อมกัน
ภาพรวม
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
เจาะลึก
โมเดลภาษามาตรฐานได้รับการฝึกฝนด้วยการทำนายโทเค็นถัดไป: ตามบริบท ทำนายโทเค็นถัดไปเดี่ยว การทำนายโทเค็นหลายรายการ (MTP) ซึ่งได้รับความนิยมในรายงาน Meta ปี 2024 และนำมาใช้ใน DeepSeek-V3 เพิ่มหัวเอาต์พุตน้ำหนักเบาเป็นพิเศษ เพื่อให้โมเดลคาดการณ์โทเค็นถัดไปพร้อมกัน บวกกับโทเค็นที่ 2, 3 และ 4 ที่อยู่ข้างหน้าจากสถานะที่ซ่อนอยู่เดียวกัน สิ่งนี้บังคับให้เครือข่ายต้องวางแผนเพิ่มเติมในอนาคตและทำให้สัญญาณการฝึกอบรมหนาแน่นขึ้น - แต่ละตำแหน่งในปัจจุบันมีส่วนทำให้เกิดการสูญเสียหลายเงื่อนไข Meta รายงานประโยชน์ที่เพิ่มขึ้นอย่างมากจากการเขียนโค้ดและการใช้เหตุผลเชิงสร้างสรรค์ โดยที่โมเดลขนาดใหญ่จะได้รับประโยชน์มากกว่า สิ่งสำคัญอย่างยิ่งคือสามารถทิ้งหัวส่วนเกินออกได้หลังการฝึก ดังนั้นขนาดของโมเดลเมื่อนำไปใช้งานจึงไม่จำเป็นต้องเพิ่มขึ้น
ข้อมูลเชิงลึกทางเทคนิค
MTP ติดหัวทำนายแบบอิสระไว้ที่ด้านบนของลำตัวหม้อแปลงที่ใช้ร่วมกัน head k ทำนายโทเค็นที่ตำแหน่ง t+k จากการเป็นตัวแทนที่ตำแหน่ง t การสูญเสียจะถูกสรุประหว่างการฝึก ในการอนุมาน หัวเสริมเปิดใช้งานการถอดรหัสแบบคาดเดาได้เอง: โมเดลเสนอโทเค็นหลายรายการในการส่งผ่านครั้งเดียว จากนั้นตรวจสอบโทเค็นเหล่านั้น ทำให้สร้างได้เร็วขึ้นประมาณ 3 เท่าโดยประมาณโดยไม่ต้องเปลี่ยนการกระจายเอาต์พุต
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการฝึกอบรมการทำนายแบบหลายโทเค็น
MTP กำลังกลายเป็นส่วนผสมเริ่มต้นในสูตรการฝึกอบรมระดับแนวหน้า เนื่องจากจะช่วยปรับปรุงทั้งคุณภาพและความเร็วในการอนุมานด้วยต้นทุนเพียงเล็กน้อย คาดหวังการผสานรวมที่เข้มงวดมากขึ้นกับการถอดรหัสเชิงเก็งกำไร ขอบเขตการคาดการณ์ที่ลึกยิ่งขึ้น และใช้เป็นวัตถุประสงค์เสริมที่ปรับปรุงการวางแผนขอบฟ้าระยะยาว เมื่อรวมกับแบบจำลองการให้เหตุผล การทำนายหลายขั้นตอนล่วงหน้าอาจช่วยให้แบบจำลองจำลองผลที่ตามมาภายในก่อนที่จะตัดสินใจหาคำตอบ
การใช้งานจริงในโลกแห่งความเป็นจริง
DeepSeek-V3 ใช้วัตถุประสงค์ MTP ในระหว่างการฝึกล่วงหน้าเพื่อเพิ่มประสิทธิภาพข้อมูลและเปิดใช้งานการถอดรหัสเชิงคาดเดา
โมเดลการสร้างโค้ดของ Meta แสดงความแม่นยำที่เพิ่มขึ้นจาก HumanEval และ MBPP จากการทำนายโทเค็นหลายรายการ
การถอดรหัสแบบเก็งกำไรในตัวเอง: การร่างโทเค็น 3-4 ต่อการส่งต่อ จากนั้นตรวจสอบเพื่อให้ได้เอาต์พุตที่เร็วขึ้นและรักษาการกระจายไว้
เติมข้อความอัตโนมัติได้เร็วขึ้นในผู้ช่วยเขียนโค้ด โดยมีการเสนอและตรวจสอบโทเค็นที่เป็นไปได้หลายรายการในขั้นตอนเดียว
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสตรีมมิ่งแบบเก็งกำไรและการคาดการณ์แบบหลายโทเค็น
คำถามที่พบบ่อย
What is Multi-Token Prediction Training?
แทนที่จะทำนายโทเค็นถัดไป แบบจำลองได้รับการฝึกฝนให้ทำนายโทเค็นในอนาคตหลายรายการพร้อมกัน สิ่งนี้ทำให้สัญญาณการเรียนรู้คมชัดขึ้นและปลดล็อคการอนุมานได้เร็วขึ้นผ่านการถอดรหัสแบบคาดเดาด้วยตนเอง
การคาดการณ์แบบหลายโทเค็นเพิ่มอะไรเมื่อเปรียบเทียบกับการฝึกอบรมโทเค็นถัดไปแบบมาตรฐาน
MTP เพิ่มหัวเอาต์พุตเพิ่มเติม ดังนั้นแบบจำลองจึงคาดการณ์โทเค็นถัดไปบวกกับโทเค็นหลายตัวที่อยู่ข้างหน้าจากสถานะที่ซ่อนอยู่เดียว
โมเดลใดที่ใช้วัตถุประสงค์การทำนายแบบหลายโทเค็นในการฝึกล่วงหน้าอย่างโดดเด่น
DeepSeek-V3 นำวัตถุประสงค์การฝึกอบรม MTP ไปใช้เพื่อปรับปรุงประสิทธิภาพของข้อมูลและเปิดใช้การถอดรหัสเชิงคาดเดา
เหตุใด MTP จึงทำให้สัญญาณการฝึกหนาแน่นขึ้น
การคาดการณ์โทเค็นในอนาคตหลายรายการหมายความว่าแต่ละตำแหน่งโทเค็นสร้างการสูญเสียการคาดการณ์หลายครั้ง ทำให้มีสัญญาณการเรียนรู้มากขึ้นต่อโทเค็น
หัวทำนายพิเศษมีประโยชน์ในการอนุมานอะไรบ้าง
หัวเสริมสามารถร่างโทเค็นได้หลายโทเค็นต่อการผ่านที่ได้รับการตรวจสอบแล้ว ซึ่งจะช่วยเร่งการสร้างโดยไม่ต้องเปลี่ยนการกระจายเอาต์พุต
จะเกิดอะไรขึ้นกับศีรษะเสริมหลังการฝึกหากคุณไม่ต้องการเร่งความเร็ว?
หัวพิเศษเป็นทางเลือกเมื่อใช้งาน การละทิ้งจะทำให้โมเดลมีขนาดเท่ากันกับโมเดลโทเค็นถัดไปมาตรฐาน