การสุ่มตัวอย่างและการจัดอันดับใหม่ที่ดีที่สุด
การสุ่มตัวอย่างที่ดีที่สุดของ N จะสร้างคำตอบของผู้สมัครหลายคำตอบจากแบบจำลอง จากนั้นเลือกคำตอบที่ดีที่สุดโดยใช้ขั้นตอนการให้คะแนนที่แยกต่างหาก
ภาพรวม
It is one of the simplest, most reliable ways to trade extra compute at inference time for higher answer quality.
เจาะลึก
โมเดลภาษาที่มีการสุ่มตัวอย่างจะสร้างเอาต์พุตที่แตกต่างกันในแต่ละครั้งที่คุณรัน Best-of-N ใช้ประโยชน์จากสิ่งนี้: คุณวาดคำตอบของผู้สมัคร N รายการ จากนั้นจัดอันดับใหม่และส่งคืนคำตอบอันดับต้นๆ การจัดอันดับใหม่อาจเป็นโมเดลรางวัลการเรียนรู้ (โดยทั่วไปในการเรียนรู้แบบเสริมกำลังจากผลตอบรับของมนุษย์) ผู้ตรวจสอบที่ตรวจสอบความถูกต้อง หรือการวิเคราะห์พฤติกรรมแบบง่าย เช่น ข้อตกลงคำตอบผ่านการลงคะแนนเสียงข้างมาก เนื่องจากแบบจำลองต้องการความพยายามที่ดีเพียงครั้งเดียวจากหลายๆ ครั้ง คุณภาพจึงมักจะเพิ่มขึ้นอย่างรวดเร็วเมื่อ N เติบโตขึ้น โดยเฉพาะอย่างยิ่งในงานการให้เหตุผลและการเขียนโค้ดซึ่งมีเส้นทางที่ถูกต้องแต่ไม่ใช่ตัวอย่างแรกเสมอไป ค่าใช้จ่ายจะเป็นเส้นตรงในหน่วย N และจะเพิ่มขึ้นในระดับสูงหรือแม้กระทั่งย้อนกลับหากผู้บันทึกคะแนนไม่สมบูรณ์ โหมดความล้มเหลวที่เรียกว่าการแฮ็กรางวัลหรือการเพิ่มประสิทธิภาพรางวัลมากเกินไป
ข้อมูลเชิงลึกทางเทคนิค
คุณภาพที่ดีที่สุดของ N ขึ้นอยู่กับผู้บันทึกคะแนนทั้งหมด ด้วยเครื่องตรวจสอบที่สมบูรณ์แบบ ความแม่นยำเข้าใกล้โอกาสที่ตัวอย่าง N อย่างน้อยหนึ่งรายการจะถูกต้อง ซึ่งจะเพิ่มขึ้นอย่างรวดเร็วด้วย N ด้วยรูปแบบการให้รางวัลที่มีเสียงดัง การเลือกอาจถูกหลอกได้: การกด N สูงมากจะขยายเอาต์พุตที่ได้คะแนนสูงแต่จริงๆ แล้วผิด เนื่องจากคุณกำลังปรับให้เหมาะสมกับจุดบอดของผู้บันทึกคะแนน นี่คือเหตุผลว่าทำไมโมเดลรางวัลที่แข็งแกร่งที่ได้รับการปรับเทียบแล้วจึงมีความสำคัญสำหรับเทคนิคในการให้ผลตอบแทนที่คุ้มค่า
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการสุ่มตัวอย่างและการจัดอันดับใหม่ที่ดีที่สุด
Best-of-N กำลังกลายเป็นองค์ประกอบหลักของการปรับขนาดเวลาอนุมาน ควบคู่ไปกับห่วงโซ่แห่งความคิดและการค้นหาแบบต้นไม้ คาดหวังรูปแบบที่ชาญฉลาดยิ่งขึ้น: การลงคะแนนเสียงข้างมากแบบถ่วงน้ำหนัก ประมวลผลแบบจำลองการให้รางวัลที่ให้คะแนนขั้นตอนการให้เหตุผลแต่ละขั้นตอน และ N แบบปรับได้ที่จะหยุดการสุ่มตัวอย่างเมื่อมีความเชื่อมั่นสูง เมื่อตัวตรวจสอบได้รับการปรับปรุง โดยเฉพาะอย่างยิ่งสำหรับโค้ดและคณิตศาสตร์ที่สามารถตรวจสอบความถูกต้องได้ การจัดอันดับตัวอย่างจำนวนมากใหม่จะเป็นวิธีมาตรฐานในการแปลงการประมวลผลสำรองให้เป็นความน่าเชื่อถือโดยไม่ต้องฝึกอบรมโมเดลพื้นฐานใหม่
การใช้งานจริงในโลกแห่งความเป็นจริง
สุ่มตัวอย่างวิธีแก้ปัญหาทางคณิตศาสตร์ 64 ข้อ และเลือกคำตอบที่กลุ่มตัวอย่างส่วนใหญ่เห็นด้วย (ความสม่ำเสมอในตนเอง / การลงคะแนนเสียงข้างมาก)
สร้างการเติมโค้ดให้สมบูรณ์หลายครั้งและเก็บโค้ดที่ผ่านการทดสอบหน่วยส่วนใหญ่ไว้เป็นตัวตรวจสอบอัตโนมัติ
ดึงคำตอบหลายรายการในไปป์ไลน์ RLHF และเลือกคำตอบที่โมเดลให้คะแนนรางวัลสูงสุดเพื่อให้บริการแก่ผู้ใช้
สร้างบทสรุปฉบับร่างหลายฉบับและจัดอันดับใหม่ด้วยแบบจำลองคุณภาพเพื่อให้ได้ข้อสรุปที่น่าเชื่อถือและกระชับที่สุด
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Best-of-N Sampling and Reranking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
อุณหภูมิและการสุ่มตัวอย่าง
คำถามที่พบบ่อย
What is Best-of-N Sampling and Reranking?
การสุ่มตัวอย่างที่ดีที่สุดของ N จะสร้างคำตอบของผู้สมัครหลายคำตอบจากแบบจำลอง จากนั้นเลือกคำตอบที่ดีที่สุดโดยใช้ขั้นตอนการให้คะแนนที่แยกต่างหาก นี่เป็นหนึ่งในวิธีที่ง่ายที่สุดและน่าเชื่อถือที่สุดในการแลกเปลี่ยนการประมวลผลเพิ่มเติม ณ เวลาอนุมานเพื่อให้ได้คำตอบที่มีคุณภาพสูงขึ้น
แนวคิดหลักของการสุ่มตัวอย่างที่ดีที่สุดของ N คืออะไร
Best-of-N ดึงคำตอบของผู้สมัครหลายรายแล้วจัดอันดับใหม่ โดยส่งคืนคำตอบที่มีคะแนนสูงสุด
งานประเภทใดที่ best-of-N มีแนวโน้มที่จะช่วยได้มากที่สุด
เมื่อมีคำตอบที่ถูกต้องที่ตรวจสอบได้ซึ่งโมเดลพบเพียงบางครั้งเท่านั้น การสุ่มตัวอย่างผู้สมัครจำนวนมากขึ้นจะเพิ่มโอกาสที่คำตอบนั้นจะถูก
อะไรเป็นตัวกำหนดว่า Best-of-N จะปรับปรุงผลลัพธ์ได้จริงหรือไม่
การคัดเลือกจะดีพอๆ กับการจัดอันดับใหม่เท่านั้น ผู้ให้คะแนนที่อ่อนแอหรือลำเอียงสามารถเลือกคำตอบที่ผิดได้
โหมดความล้มเหลวใดที่สามารถปรากฏขึ้นได้เมื่อ N ถูกผลักสูงมากด้วยโมเดลรางวัลที่ไม่สมบูรณ์
การเพิ่มประสิทธิภาพอย่างหนักเพื่อต่อสู้กับผู้บันทึกคะแนนที่มีข้อบกพร่องจะขยายเอาต์พุตที่ใช้ประโยชน์จากจุดบอดของมัน ดังนั้นความแม่นยำจึงอาจอยู่ที่ระดับสูงสุดหรือลดลงได้
กลยุทธ์การจัดอันดับใหม่อย่างง่ายใดที่เรียกว่าความสม่ำเสมอในตนเอง
ความสม่ำเสมอในตนเองสุ่มตัวอย่างห่วงโซ่การให้เหตุผลจำนวนมาก และเลือกคำตอบสุดท้ายที่กลุ่มส่วนใหญ่เห็นด้วย