คู่มือ AI ภาษา

การสร้างแบบจำลองรางวัล

โมเดลการให้รางวัลคือโครงข่ายประสาทเทียมที่ได้รับการฝึกฝนเพื่อคาดการณ์ว่าการตอบสนองของ AI จะดีเพียงใด โดยทำหน้าที่เป็นระบบอัตโนมัติในการตัดสินของมนุษย์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันคือเครื่องมือให้คะแนนที่ทําให้การเรียนรู้แบบเสริมแรงจากฟีดแบคของมนุษย์เป็นไปได้ในระดับใหญ่

เจาะลึก

การสร้างแบบจำลองรางวัลช่วยแก้ปัญหาในทางปฏิบัติได้: มนุษย์ไม่สามารถให้คะแนนทุกๆ หนึ่งล้านของผลลัพธ์ที่แบบจำลองสร้างขึ้นระหว่างการฝึกอบรมได้ ผู้ติดป้ายกำกับจะเปรียบเทียบชุดคำตอบเล็กๆ แทน โดยมักจะเลือกว่าคำตอบใดจาก 2 คำตอบในข้อความเดียวกันจะดีกว่า จากนั้นโมเดลรางวัลจะได้รับการฝึกอบรมเกี่ยวกับการเปรียบเทียบเหล่านี้เพื่อให้ได้คะแนนสเกลาร์เดี่ยวสำหรับคู่ที่มีการตอบกลับทันที วัตถุประสงค์การฝึกอบรมมาตรฐานคือแบบจำลองของแบรดลีย์-เทอร์รี่ ซึ่งเปลี่ยนความชอบแบบคู่ให้กลายเป็นความน่าจะเป็นที่คำตอบหนึ่งจะมีคะแนนเหนือกว่าอีกคำตอบหนึ่ง เมื่อฝึกฝนแล้ว โมเดลรางวัลนี้สามารถประเมินผลลัพธ์ใหม่ได้อย่างไม่จำกัดในราคาถูก โดยให้สัญญาณว่าอัลกอริทึม เช่น PPO ใช้เพื่อปรับปรุงโมเดลภาษา โมเดลรางวัลยังถูกนำมาใช้ซ้ำในเวลาอนุมานสำหรับการสุ่มตัวอย่างที่ดีที่สุดของ N โดยจะมีการสร้างผู้สมัครจำนวนมากและผู้ที่ได้คะแนนสูงสุดจะถูกส่งกลับ

ข้อมูลเชิงลึกทางเทคนิค

โดยทั่วไปแล้ว โมเดลรางวัลจะเป็นโมเดลภาษาพื้นฐานที่มีส่วนหัวการทำนายโทเค็นแทนที่ด้วยเลเยอร์เชิงเส้นเดี่ยวที่ปล่อยสเกลาร์หนึ่งตัว การฝึกอบรมช่วยเพิ่มโอกาสบันทึกที่คะแนนการตอบสนองที่เลือกสูงกว่าคะแนนที่ถูกปฏิเสธ: loss = -log(sigmoid(r_chosen - r_rejected)) เฉพาะความแตกต่างสัมพัทธ์เท่านั้นที่สำคัญ ดังนั้นมาตราส่วนสัมบูรณ์จึงขึ้นอยู่กับอำเภอใจ คุณภาพขึ้นอยู่กับความสม่ำเสมอของฉลากและรูปแบบการตอบสนองที่ครอบคลุม

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการสร้างแบบจำลองรางวัล

การวิจัยกำลังจัดการกับจุดอ่อนที่ใหญ่ที่สุดของโมเดลการให้รางวัล กล่าวคือ พวกมันสามารถ 'ถูกแฮ็ก' ได้ (โมเดลใช้ประโยชน์จากลักษณะแปลกๆ เช่น ชอบความยาว) และพวกมันก็หลุดออกจากการแจกจ่ายเมื่อนโยบายดีขึ้น แนวทางที่น่าหวัง ได้แก่ โมเดลการให้รางวัลกระบวนการที่ให้คะแนนแต่ละขั้นตอนการใช้เหตุผล การประมาณการทั้งหมดและการประมาณการความไม่แน่นอนเพื่อต่อต้านการแฮ็ก ป้ายการตั้งค่าที่ AI สร้างขึ้น (RLAIF) และโมเดลการให้รางวัลแบบกำเนิดที่สร้างคำวิจารณ์และเหตุผลแทนที่จะเป็นตัวเลขเปล่า

การใช้งานจริงในโลกแห่งความเป็นจริง

ขับเคลื่อน RLHF สำหรับผู้ช่วยเช่น ChatGPT และ Claude โดยการให้คะแนนคำตอบของผู้สมัครระหว่างการฝึกอบรม PPO

การสุ่มตัวอย่างแบบ Best-of-N โดยที่โมเดลจะสร้างคำตอบได้มากมาย และโมเดลรางวัลจะเลือกสิ่งที่ดีที่สุดสำหรับผู้ใช้

'ตัวตรวจสอบ' ทางคณิตศาสตร์และการเข้ารหัสหรือกระบวนการให้รางวัลแบบจำลองที่ให้คะแนนขั้นตอนการให้เหตุผลระดับกลางเพื่อปรับปรุงการแก้ปัญหา

จัดอันดับและกรองข้อมูลการฝึกแบบสังเคราะห์ โดยเก็บเฉพาะรุ่นที่มีคะแนนสูงไว้เพื่อการปรับแต่งเพิ่มเติม

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างแบบจำลองรางวัลแบรดลีย์-เทอร์รี่

คำถามที่พบบ่อย

การสร้างแบบจําลองรางวัล (Reward Modeling) คืออะไร?

โมเดลการให้รางวัลคือโครงข่ายประสาทเทียมที่ได้รับการฝึกฝนเพื่อคาดการณ์ว่าการตอบสนองของ AI จะดีเพียงใด โดยทำหน้าที่เป็นระบบอัตโนมัติในการตัดสินของมนุษย์ เป็นเครื่องมือให้คะแนนที่ทำให้การเรียนรู้แบบเสริมกำลังจากผลตอบรับของมนุษย์เป็นไปได้ในวงกว้าง

ผลลัพธ์หลักของโมเดลการให้รางวัลสำหรับคู่ที่มีการตอบกลับพร้อมท์ที่กำหนดคืออะไร

โมเดลการให้รางวัลจะแมปการตอบสนองและการตอบสนองต่อตัวเลขสเกลาร์หนึ่งตัวที่แสดงถึงคุณภาพที่คาดการณ์ไว้หรือความชอบของมนุษย์

ข้อมูลมนุษย์ประเภทใดที่มักใช้ในการฝึกโมเดลการให้รางวัล?

โดยทั่วไปผู้ติดป้ายกำกับจะเปรียบเทียบสองคำตอบกับพร้อมท์เดียวกัน และเลือกอันที่ดีกว่า แบบจำลองแบรดลีย์-เทอร์รี่แปลงสิ่งเหล่านี้ให้เป็นรางวัลสเกลาร์

การสูญเสียแบบจำลองรางวัลมาตรฐานปรับให้เหมาะสมอย่างไร

การสูญเสียของแบรดลีย์-เทอร์รี่ -log(sigmoid(r_chosen - r_rejected)) ให้ความสำคัญกับการจัดลำดับแบบสัมพันธ์เท่านั้น ดังนั้นขนาดที่แน่นอนจึงขึ้นอยู่กับอำเภอใจ

'การแฮ็กรางวัล' คืออะไร?

การแฮ็กรางวัลเกิดขึ้นเมื่อโมเดลพบทางลัด (เช่น ยาวเกินไปหรือคำเยินยอ) ซึ่งโมเดลรางวัลที่ไม่สมบูรณ์ให้คะแนนสูง แต่มนุษย์ไม่ทำเช่นนั้น

โมเดลรางวัลได้รับมาจากสถาปัตยกรรมจากโมเดลภาษาอย่างไร

โดยทั่วไป โมเดลการให้รางวัลจะนำแกนหลัก LM มาใช้ซ้ำ แต่สลับเลเยอร์สุดท้ายกับเลเยอร์ที่ให้ผลลัพธ์เป็นรางวัลสเกลาร์เดียว