คู่มือ AI ภาษา

การควบคุมกระบวนการสำหรับการใช้เหตุผลทางคณิตศาสตร์

การควบคุมดูแลกระบวนการให้รางวัลแก่แบบจำลองสำหรับทุกขั้นตอนที่ถูกต้องในห่วงโซ่การให้เหตุผล ไม่ใช่แค่คำตอบสุดท้าย

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

For math, where one wrong move ruins everything, grading the work itself produces far more reliable solvers.

เจาะลึก

โมเดลรางวัลส่วนใหญ่จะให้คะแนนเฉพาะคำตอบสุดท้ายเท่านั้น (การควบคุมผลลัพธ์) นั่นทำให้โมเดล 'โชคดี' — ไปถึงหมายเลขที่ถูกต้องผ่านขั้นตอนที่มีข้อบกพร่องซึ่งหักล้างกัน การควบคุมกระบวนการจะฝึก Process Reward Model (PRM) แทนบนฉลากของมนุษย์หรือ AI ที่ทำเครื่องหมายแต่ละขั้นตอนระหว่างกลางว่าถูกต้อง ไม่ถูกต้อง หรือเป็นกลาง OpenAI รายงาน "มาตรวจสอบทีละขั้นตอน" ปี 2023 ของ OpenAI ได้เผยแพร่ PRM800K ซึ่งมีป้ายกำกับระดับขั้นตอนประมาณ 800,000 รายการเกี่ยวกับปัญหา MATH และแสดงให้เห็นว่าเครื่องมือตรวจสอบที่มีการควบคุมดูแลกระบวนการสามารถแก้ไขชุดย่อยการทดสอบได้ 78% เทียบกับผลลัพธ์พื้นฐานที่อ่อนแอกว่าเท่านั้น PRM ใช้ในการอนุมานเพื่อจัดอันดับโซลูชันตัวอย่างจำนวนมาก โดยเลือกห่วงโซ่ที่มีคะแนนขั้นต่ำสูงสุด นอกจากนี้ยังให้ข้อเสนอแนะที่ตีความได้: คุณสามารถดูได้อย่างชัดเจนว่าการให้เหตุผลแตกตรงไหน

ข้อมูลเชิงลึกทางเทคนิค

ในช่วงเวลาทดสอบ แบบจำลองจะสุ่มตัวอย่างโซลูชันที่เป็นตัวเลือกจำนวนมาก คะแนน PRM ในแต่ละขั้นตอน และคะแนนโดยรวมของโซลูชันมักจะเป็นผลคูณ (หรือขั้นต่ำ) ของความน่าจะเป็นของความถูกต้องต่อขั้นตอน จากนั้น 'Best-of-N' จะเลือกห่วงโซ่การให้คะแนนสูงสุด เนื่องจากมีการกำหนดเครดิตในพื้นที่ สัญญาณการฝึกอบรมจึงหนาแน่นกว่าและมีสัญญาณรบกวนน้อยกว่ารางวัลที่สิ้นสุดลำดับเดียว ซึ่งช่วยลดการแฮ็กรางวัลที่ขั้นตอนที่ผิดจะให้คำตอบที่ถูกต้องโดยบังเอิญ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการกำกับดูแลกระบวนการสำหรับการใช้เหตุผลทางคณิตศาสตร์

การติดป้ายกำกับขั้นตอนแบบแมนนวลมีราคาแพง ดังนั้นการวิจัยจึงเปลี่ยนไปสู่การควบคุมดูแลกระบวนการแบบอัตโนมัติ โดยใช้การเปิดตัว Monte Carlo (Math-Shepherd) เพื่อประเมินมูลค่าของแต่ละขั้นตอนโดยไม่มีป้ายกำกับจากมนุษย์ หรือมีโมเดลที่แข็งแกร่งกว่าตัดสินโมเดลที่อ่อนแอกว่า คาดหวังให้ PRM ขับเคลื่อนการปรับแต่งการเรียนรู้แบบเสริมกำลัง ไม่ใช่แค่การจัดอันดับใหม่ และขยายขอบเขตไปไกลกว่าคณิตศาสตร์ไปสู่โค้ด การพิสูจน์ทางวิทยาศาสตร์ และการวางแผนแบบหลายขั้นตอนแบบตัวแทนซึ่งความถูกต้องระดับขั้นตอนมีความสำคัญ

การใช้งานจริงในโลกแห่งความเป็นจริง

ชุดข้อมูล PRM800K ของ OpenAI: ป้ายกำกับระดับขั้นตอนของมนุษย์ 800,000 รายการที่ใช้ในการฝึกอบรมผู้ตรวจสอบในเกณฑ์มาตรฐาน MATH

Math-Shepherd: ติดป้ายกำกับความถูกต้องของขั้นตอนโดยอัตโนมัติผ่านการเปิดตัว Monte Carlo เพื่อหลีกเลี่ยงการเพิ่มคำอธิบายประกอบโดยมนุษย์ซึ่งมีค่าใช้จ่ายสูง

การจัดอันดับใหม่ที่ดีที่สุด: สร้างโซลูชัน 256 รายการ และเลือกโซลูชันที่ PRM ได้คะแนนสูงสุดในทุกขั้นตอน

เครื่องมือการสอนที่ทำเครื่องหมายบรรทัดที่แน่นอนในโซลูชันการทำงานของนักเรียนที่เกิดข้อผิดพลาดเป็นครั้งแรก

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Process Supervision for Math Reasoning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การใช้เหตุผลแบบลูกโซ่แห่งความคิด

คำถามที่พบบ่อย

What is Process Supervision for Math Reasoning?

การควบคุมดูแลกระบวนการให้รางวัลแก่แบบจำลองสำหรับทุกขั้นตอนที่ถูกต้องในห่วงโซ่การให้เหตุผล ไม่ใช่แค่คำตอบสุดท้าย สำหรับคณิตศาสตร์ เมื่อการเคลื่อนไหวผิดเพียงครั้งเดียวจะทำลายทุกสิ่ง การให้คะแนนงานนั้นจะทำให้มีนักแก้ปัญหาที่เชื่อถือได้มากกว่ามาก

อะไรคือความแตกต่างที่สำคัญระหว่างการกำกับดูแลกระบวนการและการกำกับดูแลผลลัพธ์?

การควบคุมดูแลกระบวนการให้สัญญาณรางวัลในทุกขั้นตอนการให้เหตุผล ในขณะที่การควบคุมดูแลผลลัพธ์จะตรวจสอบเฉพาะคำตอบสุดท้ายเท่านั้น

เหตุใดการควบคุมดูแลเฉพาะผลลัพธ์อาจทำให้เข้าใจผิดกับปัญหาทางคณิตศาสตร์ได้

การให้รางวัลเฉพาะคำตอบสุดท้ายจะถือว่าโซลูชัน 'โชคดี' ซึ่งขั้นตอนกลางที่ไม่ถูกต้องทำให้เกิดผลลัพธ์ที่ถูกต้องโดยบังเอิญ

OpenAI เปิดตัวควบคู่ไปกับ "มายืนยันทีละขั้นตอน" บ้าง

PRM800K มีคำอธิบายประกอบของมนุษย์ประมาณ 800,000 รายการ ซึ่งระบุว่าขั้นตอนการให้เหตุผลแต่ละขั้นตอนถูกต้องหรือไม่ถูกต้อง

โดยทั่วไปแล้ว Process Reward Model จะใช้อย่างไรในเวลาอนุมาน

PRM จะให้คะแนนแต่ละขั้นตอนของโซลูชันผู้สมัครจำนวนมาก ช่วยให้สามารถเลือกห่วงโซ่การให้เหตุผลที่มีคะแนนสูงสุดได้ดีที่สุด

แนวทางใดช่วยลดความจำเป็นในการติดฉลากขั้นตอนของมนุษย์ที่มีราคาแพง

Math-Shepherd ประมาณการความถูกต้องของขั้นตอนด้วยการเปิดตัวการดำเนินการที่เสร็จสมบูรณ์ และวัดว่าคำตอบที่ถูกต้องบ่อยเพียงใด โดยหลีกเลี่ยงการติดป้ายกำกับด้วยตนเอง