คู่มือทางเทคนิค

การถอดรหัสเก็งกำไรด้วย EAGLE

การถอดรหัสแบบเก็งกำไรจะเร่งความเร็วในการอนุมานโมเดลภาษาขนาดใหญ่โดยปล่อยให้โมเดลร่างขนาดเล็กเดาโทเค็นหลายอันข้างหน้า ซึ่งโมเดลขนาดใหญ่จะตรวจสอบในการส่งผ่านครั้งเดียว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

EAGLE is a state-of-the-art version that drafts at the feature level rather than the token level, delivering 2-4x speedups with zero loss in output quality.

เจาะลึก

การสร้าง LLM ปกติเป็นแบบถดถอยอัตโนมัติ โดยโมเดลจะสร้างโทเค็นหนึ่งรายการ ป้อนกลับ และทำซ้ำ ดังนั้นแต่ละโทเค็นจึงต้องมีการส่งต่อแบบเต็มผ่านพารามิเตอร์นับพันล้านรายการ การถอดรหัสแบบเก็งกำไรช่วยขจัดปัญหาคอขวดนี้ ผู้ร่างราคาถูกเสนอโทเค็นผู้สมัครจำนวนหนึ่ง และโมเดลเป้าหมายราคาแพงจะตรวจสอบทั้งหมดในการส่งแบบคู่ขนานครั้งเดียว โดยยอมรับคำนำหน้าที่ถูกต้องที่ยาวที่สุด EAGLE (อัลกอริธึมการคาดการณ์สำหรับประสิทธิภาพของโมเดลภาษาที่มากขึ้น) ปรับปรุงวิธีการก่อนหน้านี้โดยการร่างในพื้นที่ฟีเจอร์ที่ซ่อนอยู่ของโมเดล และป้อนกลับการฝังที่แท้จริงของโทเค็นก่อนหน้าเพื่อลดความไม่แน่นอน EAGLE-2 เพิ่มแผนผังร่างแบบไดนามิก และ EAGLE-3 จะลดข้อจำกัดการคาดการณ์คุณลักษณะเพื่อขยายขนาดให้ดีขึ้น สิ่งสำคัญที่สุดคือ การตรวจสอบรับประกันว่าเอาต์พุตจะเหมือนกับที่โมเดลเป้าหมายจะผลิตเพียงอย่างเดียว

ข้อมูลเชิงลึกทางเทคนิค

EAGLE ฝึกส่วนหัว autoregressive ขนาดเล็กที่คาดการณ์คุณลักษณะสถานะที่ซ่อนอยู่ถัดไปของโมเดลเป้าหมาย จากนั้นนำส่วนหัว LM ของเป้าหมายกลับมาใช้ใหม่เพื่อเปลี่ยนคุณลักษณะให้กลายเป็นตัวเลือกโทเค็น การปรับเงื่อนไขของลำดับโทเค็นที่เลื่อนไปบวกกับฟีเจอร์ก่อนหน้า จะช่วยลดความคลุมเครือที่รบกวนการร่างฟีเจอร์เท่านั้น แผนผังของผู้สมัครได้รับการตรวจสอบทันที การกระจายของโมเดลเป้าหมายจะถูกเก็บรักษาไว้อย่างแน่นอน เนื่องจากโทเค็นที่ยอมรับจะต้องตรงกับตัวเลือกตัวอย่างหรือ argmax ทำให้การเร่งความเร็วไม่สูญเสีย

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการถอดรหัสเชิงเก็งกำไรด้วย EAGLE

การถอดรหัสแบบเก็งกำไรกำลังกลายเป็นโครงสร้างพื้นฐานเริ่มต้นในการให้บริการสแต็ก เช่น vLLM และ TensorRT-LLM คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับการแบ่งแบทช์และการแชร์แคช KV โมเดลการร่างด้วยตนเองที่ไม่ต้องใช้ตัวร่างแยกต่างหาก และการออกแบบร่วมฮาร์ดแวร์ที่ต้องใช้การตรวจสอบแบบขนาน การร่างฟีเจอร์สไตล์ EAGLE กำลังขยายไปสู่โมเดลหลายรูปแบบและการให้เหตุผล ซึ่งการคิดแบบโซ่ยาวทำให้เกิดต้นทุนต่อโทเค็นที่เจ็บปวดเป็นพิเศษ และการอนุมานบนอุปกรณ์ที่เวลาแฝงมีความสำคัญมากที่สุด

การใช้งานจริงในโลกแห่งความเป็นจริง

ลดเวลาในการตอบสนองในตัวช่วยแชท เพื่อให้การตอบกลับสตรีมเร็วขึ้น 2-3 เท่า โดยไม่ต้องเปลี่ยนคำตอบของโมเดล

ลดต้นทุนการให้บริการ GPU สำหรับผู้ให้บริการ API จำนวนมากโดยการสร้างโทเค็นมากขึ้นต่อการส่งต่อ

เร่งโมเดลการให้เหตุผลแบบลูกโซ่ทางความคิดแบบยาวซึ่งมีการสร้างโทเค็นนับพันรายการต่อการสืบค้น

เร่งเครื่องมือในการเติมโค้ดให้สมบูรณ์ โดยที่ลำดับโทเค็นที่ทำซ้ำและคาดการณ์ได้จะให้อัตราการยอมรับแบบร่างสูง

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding with EAGLE quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การถอดรหัสเก็งกำไร

คำถามที่พบบ่อย

What is Speculative Decoding with EAGLE?

การถอดรหัสแบบเก็งกำไรจะเร่งความเร็วในการอนุมานโมเดลภาษาขนาดใหญ่โดยปล่อยให้โมเดลร่างขนาดเล็กเดาโทเค็นหลายอันข้างหน้า ซึ่งโมเดลขนาดใหญ่จะตรวจสอบในการส่งผ่านครั้งเดียว EAGLE เป็นเวอร์ชันล้ำสมัยที่ร่างในระดับคุณสมบัติมากกว่าระดับโทเค็น โดยให้ความเร็วเพิ่มขึ้น 2-4 เท่าโดยไม่มีการสูญเสียคุณภาพเอาต์พุต

แนวคิดหลักเบื้องหลังการถอดรหัสแบบเก็งกำไรคืออะไร

ผู้ร่างขนาดเล็กคาดเดาโทเค็นหลายอันข้างหน้า และโมเดลเป้าหมายขนาดใหญ่จะตรวจสอบร่วมกัน โดยยอมรับคำนำหน้าที่ถูกต้องที่ยาวที่สุด

EAGLE แตกต่างจากวิธีการถอดรหัสแบบเก็งกำไรรุ่นก่อนๆ อย่างไร

EAGLE คาดการณ์คุณลักษณะที่ซ่อนอยู่ของโมเดลเป้าหมาย และใช้ส่วนหัว LM ของมันซ้ำ ซึ่งสร้างแบบร่างที่แม่นยำมากกว่าวิธีโทเค็นอย่างเดียว

เหตุใดการถอดรหัสแบบเก็งกำไรจึงถือว่า 'ไม่สูญเสีย'

เนื่องจากโมเดลเป้าหมายตรวจสอบแต่ละโทเค็นที่ร่างไว้โดยเทียบกับการแจกจ่ายของตัวเอง ผลลัพธ์ที่ยอมรับจึงเป็นสิ่งที่เป้าหมายจะสร้างเพียงอย่างเดียว

ปัญหาใดในการร่างฟีเจอร์ของ EAGLE ที่ป้อนกลับการฝังโทเค็นก่อนหน้าช่วยแก้ปัญหา

การปรับสภาพโทเค็นก่อนหน้าตามจริงจะช่วยลดความคลุมเครือในการทำนายคุณลักษณะที่ซ่อนอยู่ถัดไป ปรับปรุงความแม่นยำของร่าง

EAGLE-2 เพิ่มอะไรจาก EAGLE ดั้งเดิม

EAGLE-2 นำเสนอแผนผังร่างแบบไดนามิกที่คำนึงถึงบริบท ซึ่งขยายสาขาที่มีแนวโน้มดีเพื่อเพิ่มอัตราการยอมรับ