คู่มือ AI ภาษา

ประมวลผลโมเดลรางวัล

โมเดลรางวัลกระบวนการ (PRM) จะให้คะแนนในแต่ละขั้นตอนของการให้เหตุผลของ AI ไม่ใช่แค่คำตอบสุดท้าย

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This matters because it catches faulty logic mid-stream, making models more reliable at math, coding, and multi-step reasoning.

เจาะลึก

โมเดลการให้รางวัลส่วนใหญ่เป็นโมเดล 'ผลลัพธ์' โดยจะพิจารณาคำตอบที่เสร็จแล้วและตัดสินว่าถูกหรือผิด แบบจำลองการให้รางวัลกระบวนการจะให้คะแนนทุกขั้นตอนในห่วงโซ่การให้เหตุผล โดยกำหนดคะแนนคุณภาพหรือความถูกต้องให้กับแต่ละบรรทัดของโซลูชัน ตัวอย่างที่มีชื่อเสียงคืองาน "มาตรวจสอบทีละขั้นตอน" ของ OpenAI ในปี 2023 โดยที่ PRM ฝึกฝนชุดข้อมูล PRM800K (ป้ายกำกับระดับขั้นตอนของมนุษย์ประมาณ 800,000 รายการในโซลูชันทางคณิตศาสตร์) มีประสิทธิภาพเหนือกว่าการควบคุมดูแลผลลัพธ์เพียงอย่างเดียวในเกณฑ์มาตรฐาน MATH อย่างมาก ข้อดีก็คือ คำตอบสุดท้ายสามารถถูกได้ด้วยความโชคดีในขณะที่การใช้เหตุผลผิดหรือผิดแม้ว่าขั้นตอนส่วนใหญ่จะถูกต้องก็ตาม ด้วยการให้รางวัลขั้นตอนกลางที่ถูกต้อง PRM จะให้ผลตอบรับที่เข้มข้นและตรงเป้าหมายมากขึ้น ซึ่งปรับปรุงทั้งการตรวจสอบ (การเลือกโซลูชันตัวอย่างที่ดีที่สุด) และการฝึกอบรมผ่านการเรียนรู้แบบเสริมกำลัง

ข้อมูลเชิงลึกทางเทคนิค

โดยทั่วไป PRM จะเป็นหม้อแปลงไฟฟ้าที่ส่งออกคะแนนสเกลาร์หลังจากขั้นตอนการให้เหตุผลแต่ละขั้นตอน โดยมักจะใช้โทเค็นตัวคั่นพิเศษ ในการเลือกคำตอบสุดท้ายจากกลุ่มตัวอย่างหลายๆ กลุ่ม คุณจะต้องรวมคะแนนขั้นตอน โดยทั่วไปโดยการใช้ความน่าจะเป็นของขั้นตอนขั้นต่ำ (ลูกโซ่จะแข็งแกร่งเท่ากับขั้นตอนที่อ่อนแอที่สุดเท่านั้น) หรือผลคูณ การรวบรวมป้ายกำกับขั้นตอนมีราคาแพง ดังนั้นวิธีการต่างๆ เช่น Math-Shepherd ติดป้ายกำกับอัตโนมัติให้กับขั้นตอนผ่านการเปิดตัวมอนติคาร์โล โดยประมาณค่าของขั้นตอนตามความถี่ที่นำไปสู่คำตอบที่ถูกต้อง

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของโมเดลรางวัลกระบวนการ

PRM เป็นศูนย์กลางของยุคโมเดลการใช้เหตุผล คาดหวังการติดป้ายกำกับขั้นตอนแบบอัตโนมัติมากขึ้นเพื่อลดต้นทุนคำอธิบายประกอบโดยมนุษย์, PRM เชิงสร้างสรรค์ที่วิจารณ์ขั้นตอนต่างๆ ในภาษาธรรมชาติ แทนที่จะปล่อยคะแนนเปล่าๆ และขยายขอบเขตที่นอกเหนือไปจากคณิตศาสตร์ไปสู่โค้ด การใช้เครื่องมือตัวแทน และการใช้เหตุผลทางวิทยาศาสตร์ นอกจากนี้ยังจับคู่อย่างเป็นธรรมชาติกับการคำนวณการค้นหาต้นไม้และการทดสอบเวลา โดยที่ตัวตรวจสอบจะแนะนำสาขาที่จะขยาย ความท้าทายที่เปิดกว้างที่สำคัญคือการให้รางวัลแก่การแฮ็ก: โมเดลการเรียนรู้ที่จะสร้างขั้นตอนที่ดูดีต่อ PRM โดยที่ไม่ถูกต้องอย่างแท้จริง

การใช้งานจริงในโลกแห่งความเป็นจริง

จัดอันดับวิธีแก้ปัญหาตัวอย่างหลายสิบรายการสำหรับปัญหาการแข่งขัน MATH ที่ยากลำบากตามคะแนนขั้นตอน จากนั้นส่งคืนห่วงโซ่ที่มีคะแนนสูงสุด

การค้นหาแผนผังต้นไม้ชี้นำในรูปแบบการให้เหตุผล ขยายเฉพาะโซลูชันบางส่วนที่มีขั้นตอนกลางที่มีอัตรา PRM สูง

การติดป้ายกำกับข้อมูลการฝึกอบรมอัตโนมัติด้วยการเปิดตัว Monte Carlo สไตล์ Math-Shepherd เพื่อให้สามารถฝึกอบรม PRM ได้โดยไม่ต้องใส่คำอธิบายประกอบโดยมนุษย์อย่างละเอียดถี่ถ้วน

การตรวจสอบการสร้างโค้ดทีละขั้นตอน โดยทำเครื่องหมายบรรทัดเฉพาะที่ตรรกะของฟังก์ชันแตกต่างจากข้อมูลจำเพาะ

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Process Reward Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โมเดลร่างการถอดรหัสเก็งกำไร

คำถามที่พบบ่อย

What is Process Reward Models?

โมเดลรางวัลกระบวนการ (PRM) จะให้คะแนนในแต่ละขั้นตอนของการให้เหตุผลของ AI ไม่ใช่แค่คำตอบสุดท้าย สิ่งนี้สำคัญเพราะมันจับตรรกะที่ผิดพลาดระหว่างสตรีม ทำให้โมเดลมีความน่าเชื่อถือมากขึ้นในด้านคณิตศาสตร์ การเขียนโค้ด และการให้เหตุผลแบบหลายขั้นตอน

อะไรที่ทำให้แบบจำลองการให้รางวัลกระบวนการแตกต่างจากแบบจำลองการให้รางวัลผลลัพธ์เป็นหลัก

PRM กำหนดคะแนนให้กับทุกขั้นตอนในห่วงโซ่การให้เหตุผล ในขณะที่แบบจำลองผลลัพธ์จะตัดสินเฉพาะผลลัพธ์สุดท้ายเท่านั้น

ชุดข้อมูลที่รู้จักกันดีของป้ายกำกับทางคณิตศาสตร์ระดับขั้นตอนของมนุษย์ใดที่เกี่ยวข้องกับการวิจัย PRM

PRM800K ซึ่งเปิดตัวพร้อมกับ "Let's Verify Step by Step" ของ OpenAI มีป้ายกำกับระดับขั้นตอนประมาณ 800,000 รายการเกี่ยวกับโซลูชันทางคณิตศาสตร์

เหตุใดสัญญาณรางวัลเฉพาะผลลัพธ์จึงอาจทำให้เข้าใจผิดได้

การให้คะแนนผลลัพธ์จะพลาดกรณีที่คำตอบถูกโดยโชคหรือผิด แม้ว่าจะมีการทำงานระหว่างกลางที่ดีก็ตาม ซึ่งการให้คะแนนระดับขั้นตอนจะจับได้

วิธี Math-Shepherd ใช้เพื่อติดป้ายกำกับขั้นตอนโดยอัตโนมัติอย่างไร

Math-Shepherd จะประมาณค่าของขั้นตอนโดยการสุ่มตัวอย่างความสำเร็จหลายๆ ครั้งจากจุดนั้น และวัดว่าขั้นตอนเหล่านั้นไปถึงคำตอบที่ถูกต้องบ่อยแค่ไหน

ความเสี่ยงใดที่เกี่ยวข้องเป็นพิเศษเมื่อฝึกอบรมโมเดลกับ PRM

โมเดลสามารถเรียนรู้ที่จะเล่นเกมผู้ตรวจสอบ โดยสร้างขั้นตอนที่ดูน่าเชื่อถือซึ่งให้คะแนนได้ดีแต่กลับไม่ใช่การให้เหตุผลที่ดีนัก