การตรวจสอบการสุ่มตัวอย่างแบบเก็งกำไร
การสุ่มตัวอย่างแบบเก็งกำไรช่วยเพิ่มความเร็วในการสร้างโมเดลภาษาขนาดใหญ่โดยปล่อยให้โมเดล 'ร่าง' ขนาดเล็กเดาโทเค็นหลายอันข้างหน้า จากนั้นให้โมเดลขนาดใหญ่ตรวจสอบพวกมันในการส่งผ่านครั้งเดียว
ภาพรวม
The clever verification step guarantees the output matches what the big model would have produced on its own.
เจาะลึก
การสร้างแบบถดถอยอัตโนมัตินั้นช้าเนื่องจากแต่ละโทเค็นต้องการการส่งต่อแบบเต็มของโมเดลขนาดใหญ่ การสุ่มตัวอย่างแบบเก็งกำไรจะแก้ไขปัญหานี้โดยการจับคู่แบบจำลองแบบร่างราคาถูกกับแบบจำลองเป้าหมายที่มีราคาแพง ร่างเสนอโทเค็นระยะสั้น (เช่น 4-8) เป้าหมายจะทำคะแนนทั้งหมดในการส่งต่อแบบขนานครั้งเดียว กฎการสุ่มตัวอย่างการปฏิเสธที่ได้รับการแก้ไขจะยอมรับคำนำหน้าที่ยาวที่สุดซึ่งสอดคล้องกับการกระจายของเป้าหมายเอง และจะสุ่มตัวอย่างใหม่ในตำแหน่งแรกที่ถูกปฏิเสธ เนื่องจากการยอมรับนั้นมีความน่าจะเป็นและได้รับการแก้ไขแล้ว กระแสโทเค็นสุดท้ายจึงถูกกระจายอย่างพิสูจน์ได้เหมือนกับว่าเป้าหมายสร้างขึ้นเพียงลำพัง ไม่มีการสูญเสียคุณภาพ การเร่งความเร็วโดยทั่วไปคือ 2-3 เท่าเมื่อร่างรวดเร็วและสอดคล้องกัน เนื่องจากมีการยืนยันโทเค็นหลายรายการต่อการโทรที่มีราคาแพง
ข้อมูลเชิงลึกทางเทคนิค
สำหรับโทเค็นแบบร่างแต่ละรายการ คุณจะเปรียบเทียบความน่าจะเป็นเป้าหมาย q และความน่าจะเป็นแบบร่าง p ยอมรับด้วยความน่าจะเป็น min(1, q/p); หากถูกปฏิเสธ ให้เก็บตัวอย่างจากการกระจายตัวของสารตกค้างที่ทำให้เป็นมาตรฐานสูงสุด (0, q-p) กฎการปฏิเสธนี้ทำให้การกระจายส่วนเพิ่มเหมือนกับการสุ่มตัวอย่างเป้าหมายล้วนๆ การส่งผ่านแบบขนานของเป้าหมายยังทำให้มีการแจกแจงโทเค็นถัดไป 'ฟรี' หลังจากโทเค็นที่ยอมรับครั้งล่าสุด ดังนั้นความคืบหน้าจึงไม่หยุดชะงัก
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการตรวจสอบการเก็บตัวอย่างแบบเก็งกำไร
การถอดรหัสแบบเก็งกำไรกำลังกลายเป็นมาตรฐานในสแต็กการอนุมาน ตัวแปรที่ใหม่กว่าจะทิ้งโมเดลร่างที่แยกต่างหาก: การเก็งกำไรในตัวเองใช้การคาดเดาล่วงหน้าก่อนเวลาหรือการทำนายพิเศษ (Medusa, EAGLE) การร่างแบบต้นไม้จะตรวจสอบความต่อเนื่องของผู้สมัครจำนวนมากในคราวเดียว และการถอดรหัส lookahead จะทำให้การเดา n-gram ขนานกัน คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับการจัดการแบตช์และการจัดการแคช KV ขนาดร่างที่รับรู้ด้วยฮาร์ดแวร์ และการใช้งานที่กว้างขึ้นในผลิตภัณฑ์ที่ไวต่อความหน่วง เช่น ผู้ช่วยแชทและเครื่องมือการเขียนโค้ดที่ทุกมิลลิวินาทีมีความสำคัญ
การใช้งานจริงในโลกแห่งความเป็นจริง
ให้บริการโมเดลแชท 70B พร้อมด้วยโมเดลร่าง 7B เพื่อลดเวลาแฝงในการตอบสนองประมาณครึ่งหนึ่งโดยมีคุณภาพเอาต์พุตที่เหมือนกัน
หัวแบบเมดูซ่าในโมเดลเดียวทำนายโทเค็นในอนาคตหลายรายการ จากนั้นตรวจสอบโดยไม่มีเครือข่ายร่างแยกต่างหาก
การถอดรหัสแบบเก็งกำไรแบบต้นไม้ที่เสนอการต่อเนื่องของการแยกสาขาหลายรายการ และตรวจสอบได้ทั้งหมดในการส่งผ่านเป้าหมายเดียว
เร่งตัวช่วยในการเติมโค้ดให้สมบูรณ์โดยที่โมเดลแบบร่างจัดการต้นแบบที่คาดการณ์ได้ซึ่งโมเดลขนาดใหญ่จะยืนยันอย่างรวดเร็ว
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Sampling Verification quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การปรับแต่งการสุ่มตัวอย่างการปฏิเสธ
คำถามที่พบบ่อย
What is Speculative Sampling Verification?
การสุ่มตัวอย่างแบบเก็งกำไรช่วยเพิ่มความเร็วในการสร้างโมเดลภาษาขนาดใหญ่โดยปล่อยให้โมเดล 'ร่าง' ขนาดเล็กเดาโทเค็นหลายอันข้างหน้า จากนั้นให้โมเดลขนาดใหญ่ตรวจสอบพวกมันในการส่งผ่านครั้งเดียว ขั้นตอนการตรวจสอบที่ชาญฉลาดช่วยรับประกันว่าผลลัพธ์จะตรงกับที่โมเดลขนาดใหญ่จะผลิตขึ้นมาเอง
แนวคิดหลักเบื้องหลังการสุ่มตัวอย่างแบบเก็งกำไรคืออะไร
แบบจำลองแบบร่างราคาถูกคาดเดาโทเค็นข้างหน้าหลายโทเค็น และแบบจำลองเป้าหมายราคาแพงจะตรวจสอบทั้งหมดในการส่งต่อแบบขนานเพียงครั้งเดียว
เหตุใดการสุ่มตัวอย่างแบบเก็งกำไรจึงไม่ลดคุณภาพเอาต์พุต
การแก้ไขการสุ่มตัวอย่างการปฏิเสธที่ได้รับการแก้ไขรับประกันว่าโทเค็นที่ยอมรับจะถูกกระจายตรงตามที่โมเดลเป้าหมายสร้างขึ้นเพียงอย่างเดียว
เหตุใดการสุ่มตัวอย่างแบบเก็งกำไรจึงสามารถก้าวหน้าได้แม้ว่าโทเค็นจะถูกปฏิเสธในลำดับกลางๆ
การส่งต่อเป้าหมายเดียวจะสร้างการแจกจ่ายโทเค็นถัดไปหลังจากโทเค็นที่ยอมรับครั้งล่าสุด ดังนั้นอย่างน้อยหนึ่งโทเค็นจะก้าวหน้าเสมอ
ข้อใดคือแนวทาง 'การเก็งกำไรในตนเอง' ที่หลีกเลี่ยงแบบจำลองร่างแยกต่างหาก
Medusa และ EAGLE เพิ่มส่วนหัวพิเศษหรือใช้การออกก่อนเวลาเพื่อให้โมเดลเดียวกันเสนอโทเค็นในอนาคต โดยไม่จำเป็นต้องมีโมเดลร่างที่แตกต่างกัน