โมเดลร่างการถอดรหัสเก็งกำไร
การถอดรหัสแบบเก็งกำไรใช้โมเดล 'แบบร่าง' ขนาดเล็กและรวดเร็วเพื่อคาดเดาโทเค็นที่กำลังจะมาถึงหลายตัวซึ่งโมเดลขนาดใหญ่จะตรวจสอบในการส่งผ่านครั้งเดียว
ภาพรวม
It speeds up text generation 2-3x with no change to the output.
เจาะลึก
โมเดลภาษาขนาดใหญ่จะสร้างข้อความทีละโทเค็น และแต่ละขั้นตอนจำเป็นต้องมีการส่งต่อแบบเต็มผ่านพารามิเตอร์นับพันล้านรายการ ซึ่งช้าและผูกกับหน่วยความจำ การถอดรหัสแบบเก็งกำไรโจมตีสิ่งนี้โดยการจับคู่โมเดล 'เป้าหมาย' ขนาดใหญ่กับโมเดล 'ร่าง' ราคาถูก โมเดลแบบร่างเสนอโทเค็นผู้สมัครจำนวน 4-8 ชิ้นอย่างรวดเร็ว จากนั้นโมเดลขนาดใหญ่จะประมวลผลทั้งหมดในการส่งต่อแบบขนานเดียว และตรวจสอบแต่ละรายการ โทเค็นที่ตรงกับสิ่งที่โมเดลใหญ่จะผลิตนั้นได้รับการยอมรับ ความไม่ตรงกันครั้งแรกได้รับการแก้ไขและส่วนที่เหลือจะถูกละทิ้ง เนื่องจากการตรวจสอบโทเค็นหลายรายการพร้อมกันมีค่าใช้จ่ายประมาณเดียวกับการสร้างโทเค็น การเรียกใช้ที่ยอมรับจึงเกือบจะฟรี ขั้นตอนการสุ่มตัวอย่างการปฏิเสธช่วยรับประกันว่าการแจกแจงขั้นสุดท้ายจะเหมือนกันกับการรันโมเดลใหญ่เพียงอย่างเดียว นั่นคือความเร็วโดยไม่สูญเสียคุณภาพ
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับสำคัญคือการทดสอบการสุ่มตัวอย่างแบบปฏิเสธที่มีการปรับเปลี่ยน สำหรับโทเค็นแบบร่างแต่ละรายการ ความน่าจะเป็นของโมเดลเป้าหมายจะถูกเปรียบเทียบกับโมเดลแบบร่าง หากเป้าหมายกำหนดความน่าจะเป็นที่เท่ากันหรือสูงกว่า โทเค็นจะได้รับการยอมรับ มิฉะนั้นจะยอมรับด้วยความน่าจะเป็นเท่ากับอัตราส่วน และเมื่อถูกปฏิเสธ โทเค็นที่แก้ไขแล้วจะถูกสุ่มตัวอย่างจากการกระจายส่วนที่เหลือที่ปรับแล้ว คณิตศาสตร์นี้ทำให้ผลลัพธ์เทียบเท่ากับการสุ่มตัวอย่างโดยตรงจากแบบจำลองขนาดใหญ่
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของแบบจำลองร่างการถอดรหัสเก็งกำไร
คาดว่าโมเดลแบบร่างจะกลายเป็นโครงสร้างพื้นฐานมาตรฐานในเซิร์ฟเวอร์อนุมาน เช่น vLLM และ TensorRT-LLM รูปแบบการคาดเดาในตัวเอง (Medusa, EAGLE) ทิ้งแบบจำลองแบบร่างที่แยกจากกันโดยสิ้นเชิงโดยการเพิ่มส่วนหัวการทำนายแบบน้ำหนักเบา และการร่างแบบต้นไม้จะตรวจสอบความต่อเนื่องของผู้สมัครจำนวนมากในคราวเดียว เมื่อหน้าต่างบริบทเติบโตขึ้นและต้นทุนการให้บริการครอบงำ ผู้ร่างที่จับคู่โมเดลและการตรวจสอบฮาร์ดแวร์ที่ชาญฉลาดยิ่งขึ้นจะผลักดันอัตราการยอมรับและปริมาณงานให้สูงขึ้น
การใช้งานจริงในโลกแห่งความเป็นจริง
Anthropic, OpenAI และ Google ใช้การถอดรหัสแบบคาดเดาเพื่อลดเวลาในการตอบสนองและค่าใช้จ่ายในการให้บริการผู้ช่วยแชทที่ให้บริการผู้ใช้หลายล้านคน
vLLM และ NVIDIA TensorRT-LLM มาพร้อมการถอดรหัสแบบเก็งกำไรในตัว ดังนั้นผู้โฮสต์ด้วยตนเองจึงสามารถเร่งการปรับใช้ Llama หรือ Mistral ได้
จับคู่โมเดลร่าง 7B กับเป้าหมาย 70B (เช่น ตระกูล Llama-3) เพื่อเพิ่มโทเค็นต่อวินาทีประมาณสองเท่าบน GPU ตัวเดียว
เครื่องมือเติมโค้ดให้สมบูรณ์ใช้โมเดลแบบร่างขนาดเล็กเพื่อเสนอต้นแบบที่โมเดลขนาดใหญ่ตรวจสอบ และทำให้ข้อเสนอแนะรวดเร็วในตัวแก้ไข
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การแก้ไขเชิงคาดเดาสำหรับโมเดลโค้ด
คำถามที่พบบ่อย
What is Speculative Decoding Draft Models?
การถอดรหัสแบบเก็งกำไรใช้โมเดล 'แบบร่าง' ขนาดเล็กและรวดเร็วเพื่อคาดเดาโทเค็นที่กำลังจะมาถึงหลายตัวซึ่งโมเดลขนาดใหญ่จะตรวจสอบในการส่งผ่านครั้งเดียว มันเพิ่มความเร็วในการสร้างข้อความ 2-3x โดยไม่มีการเปลี่ยนแปลงผลลัพธ์
บทบาทหลักของแบบจำลอง 'แบบร่าง' ในการถอดรหัสแบบเก็งกำไรคืออะไร?
โมเดลร่างขนาดเล็กสามารถคาดเดาโทเค็นที่กำลังจะมาถึงได้ในราคาถูก ซึ่งโมเดลเป้าหมายขนาดใหญ่จะตรวจสอบในการส่งผ่านคู่ขนานเพียงครั้งเดียว
เหตุใดการตรวจสอบโทเค็นที่ร่างไว้หลายรายการพร้อมกันจึงช่วยประหยัดเวลา
การสร้างนั้นเกี่ยวข้องกับหน่วยความจำ การตรวจสอบโทเค็นหลายรายการในการส่งผ่านแบบแบตช์ครั้งเดียวนั้นเกือบถูกเท่ากับขั้นตอนเดียว ดังนั้นการเรียกใช้ที่ยอมรับจึงเกือบจะฟรี
จะเกิดอะไรขึ้นกับโทเค็นที่ร่างไว้หลังจากโทเค็นแรกที่โมเดลเป้าหมายปฏิเสธ
การยอมรับดำเนินไปจนกระทั่งเกิดความขัดแย้งครั้งแรก โทเค็นนั้นได้รับการแก้ไขและโทเค็นแบบร่างที่ตามมาทั้งหมดจะถูกโยนทิ้งไป
การถอดรหัสแบบเก็งกำไรทำให้แน่ใจได้อย่างไรว่าคุณภาพเอาต์พุตจะไม่ลดลง
การทดสอบการสุ่มตัวอย่างการปฏิเสธที่ได้รับการแก้ไขรับประกันว่าการแจกแจงโทเค็นขั้นสุดท้ายจะตรงกับการสุ่มตัวอย่างโดยตรงจากโมเดลเป้าหมาย
ข้อใดต่อไปนี้เป็นแนวทาง 'การคาดเดาในตนเอง' ที่หลีกเลี่ยงแบบจำลองร่างที่แยกจากกัน
Medusa และ EAGLE เพิ่มหัวทำนายพิเศษน้ำหนักเบาให้กับโมเดลหลัก เพื่อให้สามารถร่างโทเค็นในอนาคตของตัวเองได้