คู่มือทางเทคนิค

การสตรีมมิ่งแบบเก็งกำไรและการคาดการณ์แบบหลายโทเค็น

การสตรีมแบบเก็งกำไรและการทำนายโทเค็นหลายรายการจะช่วยเพิ่มความเร็วในการสร้างโมเดลภาษาโดยการคาดเดาโทเค็นในอนาคตหลายรายการพร้อมกัน และตรวจสอบโทเค็นเหล่านั้นในการส่งผ่านครั้งเดียว แทนที่จะสร้างโทเค็นทีละรายการ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They cut latency without changing the text the model would have written.

เจาะลึก

การถอดรหัสอัตโนมัติแบบถอยหลังอัตโนมัติปกติจะช้าเนื่องจากแต่ละโทเค็นต้องมีการส่งต่อแบบเต็ม และโทเค็นจะถูกสร้างขึ้นทีละรายการอย่างเคร่งครัด ปล่อยให้ GPU ใช้งานน้อยเกินไป การถอดรหัสแบบเก็งกำไรจะแก้ไขปัญหานี้ด้วยตัวร่างราคาถูกที่เสนอโทเค็นผู้สมัครจำนวนมาก ซึ่งโมเดลเป้าหมายขนาดใหญ่จะตรวจสอบแบบขนาน คำนำหน้าใดๆ ที่ตรงกับสิ่งที่เป้าหมายจะสร้างขึ้นนั้นสามารถยอมรับได้ฟรี และคำนำหน้าที่ไม่ตรงกันแรกจะได้รับการแก้ไข Speculative streaming and Medusa-style multi-token prediction fold the drafter into the model itself: extra lightweight prediction heads (or a stream of speculative tokens) let one model both draft and verify, avoiding a separate draft model. เนื่องจากการตรวจสอบความถูกต้องแม่นยำ การกระจายเอาต์พุตจึงเหมือนกับการถอดรหัสมาตรฐาน คุณจึงได้รับขั้นตอนตามลำดับน้อยลง 2 ถึง 3 เท่า

ข้อมูลเชิงลึกทางเทคนิค

สิ่งสำคัญคือหม้อแปลงไฟฟ้าสามารถทำคะแนนได้หลายตำแหน่งในการส่งต่อครั้งเดียวโดยมีราคาถูกเท่ากับตำแหน่งเดียว เนื่องจากเป็นการเชื่อมต่อแบนด์วิดท์หน่วยความจำ ไม่ใช่ผูกกับการคำนวณ ในระหว่างการถอดรหัส หัวทำนายหลายตัวปล่อยโทเค็นของผู้สมัครสำหรับหลายตำแหน่งถัดไป ต้นไม้หรือลำดับของผู้สมัครได้รับการตรวจสอบร่วมกัน และการยอมรับใช้การสุ่มตัวอย่างการปฏิเสธ (หรือการจับคู่ที่ละโมบ) ดังนั้นโทเค็นที่ยอมรับจะเป็นไปตามการกระจายเป้าหมายที่แน่นอน ความยาวที่ยอมรับได้ต่อขั้นตอนจะเป็นตัวกำหนดความเร็ว

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการสตรีมมิ่งแบบเก็งกำไรและการทำนายโทเค็นแบบหลายโทเค็น

วิธีการเก็งกำไรในตัวเองที่ไม่จำเป็นต้องร่างแบบจำลองแยกต่างหากกำลังกลายเป็นค่าเริ่มต้นในกลไกการอนุมาน และการวิจัยกำลังผลักดันอัตราการยอมรับให้สูงขึ้นด้วยหัวร่างที่ดีกว่า ผู้สมัครที่มีโครงสร้างแบบต้นไม้ และการฝึกอบรมโมเดลพื้นฐานร่วมกันสำหรับการทำนายโทเค็นหลายโทเค็น (ซึ่งสามารถปรับปรุงคุณภาพได้เช่นกัน) Expect these techniques to combine with quantization and batching so interactive assistants feel instant even as models grow.

การใช้งานจริงในโลกแห่งความเป็นจริง

ลดเวลาแฝงในการตอบสนองของผู้ช่วยแชทลง 2 ถึง 3 เท่าโดยใช้หัวทำนายพิเศษสไตล์ Medusa

การเพิ่มการถอดรหัสแบบคาดเดาตนเองไปยังเซิร์ฟเวอร์การอนุมาน ดังนั้นจึงไม่จำเป็นต้องโฮสต์โมเดลแบบร่างแยกต่างหาก

เร่งการเสร็จสิ้นโค้ดโดยที่การรันโทเค็นที่ยาวและคาดเดาได้ได้รับการยอมรับเป็นชิ้นใหญ่

ลดต้นทุน GPU ต่อคำขอโดยแยกโทเค็นเพิ่มเติมจากการส่งผ่านที่ผูกกับหน่วยความจำแต่ละรายการ

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Streaming and Multi-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การฝึกอบรมการทำนายหลายโทเค็น

คำถามที่พบบ่อย

What is Speculative Streaming and Multi-Token Prediction?

การสตรีมแบบเก็งกำไรและการทำนายโทเค็นหลายรายการจะช่วยเพิ่มความเร็วในการสร้างโมเดลภาษาโดยการคาดเดาโทเค็นในอนาคตหลายรายการพร้อมกัน และตรวจสอบโทเค็นเหล่านั้นในการส่งผ่านครั้งเดียว แทนที่จะสร้างโทเค็นทีละรายการ พวกเขาลดเวลาในการตอบสนองโดยไม่เปลี่ยนข้อความที่โมเดลจะเขียน

เหตุใดการถอดรหัสอัตโนมัติแบบมาตรฐานจึงมักจะช้าบน GPU

โทเค็นแต่ละรายการต้องมีการส่งต่อของตัวเองและมีการเรียงลำดับตามลำดับอย่างเคร่งครัด ดังนั้น GPU จึงมีแบนด์วิธหน่วยความจำจำกัดและใช้งานน้อยเกินไปในระหว่างการถอดรหัส

'ผู้ร่าง' ทำอะไรในการถอดรหัสแบบเก็งกำไร?

ผู้ร่างราคาถูกเสนอโทเค็นผู้สมัครจำนวนหนึ่งเพื่อให้โมเดลเป้าหมายขนาดใหญ่ตรวจสอบพร้อมกัน

คุณภาพเอาต์พุตจะรักษาไว้อย่างไรในการถอดรหัสแบบเก็งกำไร

การตรวจสอบ (การจับคู่ที่ละโมบหรือการสุ่มตัวอย่างการปฏิเสธ) ช่วยให้มั่นใจว่าโทเค็นที่ยอมรับเป็นไปตามการกระจายที่แน่นอนที่โมเดลเป้าหมายจะสร้างขึ้น ดังนั้นเอาต์พุตจึงไม่เปลี่ยนแปลง

อะไรที่ทำให้การทำนายหลายโทเค็นสไตล์ Medusa แตกต่างจากการถอดรหัสเก็งกำไรแบบคลาสสิก

วิธีการแบบ Medusa จะพับการร่างลงในโมเดลด้วยหัวทำนายพิเศษ โดยไม่ต้องโฮสต์โมเดลแบบร่างแยกต่างหาก

เหตุใดหม้อแปลงไฟฟ้าจึงสามารถตรวจสอบตำแหน่งผู้สมัครหลายตำแหน่งได้เกือบถูกเกือบเท่ากับตำแหน่งเดียวในระหว่างการถอดรหัส

ในระหว่างการถอดรหัส ปัญหาคอขวดคือการเคลื่อนย้ายน้ำหนักออกจากหน่วยความจำ ดังนั้นการให้คะแนนตำแหน่งพิเศษในการส่งผ่านเดียวกันจึงเพิ่มต้นทุนการประมวลผลเพียงเล็กน้อย