คู่มือพื้นฐาน

การทำให้รางวัลเป็นมาตรฐานแบบกลุ่มใน RLHF

การทำให้รางวัลเป็นมาตรฐานแบบกลุ่มจะสร้างมาตรฐานรางวัลของโมเดลภายในชุดของการตอบสนองต่อข้อความแจ้งเดียวกัน โดยเปลี่ยนคะแนนที่มีเสียงดังให้เป็นสัญญาณการฝึกที่เสถียร

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

เจาะลึก

ในการเรียนรู้แบบเสริมแรงจากผลตอบรับของมนุษย์ (RLHF) แบบจำลองจะสร้างการตอบสนองและแบบจำลองการให้รางวัลจะให้คะแนน แต่ผลตอบแทนดิบจะมีเสียงดังและแตกต่างกันอย่างมากตามคำแนะนำ การทำให้รางวัลเป็นมาตรฐานแบบกลุ่มจะแก้ไขปัญหานี้โดยการสุ่มตัวอย่างกลุ่มของการตอบกลับหลายรายการในข้อความแจ้งเดียวกัน จากนั้นทำให้รางวัลแต่ละรายการเป็นมาตรฐานโดยการลบค่าเฉลี่ยของกลุ่มแล้วหารด้วยค่าเบี่ยงเบนมาตรฐานของกลุ่ม คะแนน z นี้จะกลายเป็นข้อได้เปรียบ แนวทางนี้เป็นศูนย์กลางของ Group Relative Policy Optimization (GRPO) ซึ่งแนะนำโดย DeepSeek ซึ่งมีชื่อเสียงในการขับเคลื่อนการใช้เหตุผลของ DeepSeek-R1 สิ่งสำคัญที่สุดคือ GRPO จะกำจัดเครือข่ายคุณค่าที่แยกจากกัน (นักวิจารณ์) ที่ใช้โดย PPO เนื่องจากค่าเฉลี่ยของกลุ่มทำหน้าที่เป็นเส้นฐาน ทำให้การฝึกง่ายขึ้น ถูกกว่า และมีประสิทธิภาพด้านหน่วยความจำมากขึ้น ขณะเดียวกันก็รักษาสัญญาณการไล่ระดับสีให้มีขนาดที่เหมาะสม

ข้อมูลเชิงลึกทางเทคนิค

สำหรับกลุ่มของเอาต์พุตที่มีรางวัล r_1...r_G ข้อดีคือ A_i = (r_i − mean(r)) / std(r) การตอบสนองที่ดีกว่าค่าเฉลี่ยของกลุ่มจะได้รับประโยชน์เชิงบวกและได้รับการเสริมกำลัง สิ่งที่แย่กว่าค่าเฉลี่ยจะถูกกดลง เนื่องจากการเปรียบเทียบมีความสัมพันธ์กันภายในการแจ้ง ระดับรางวัลสัมบูรณ์และความยากลำบากต่อการแจ้งเตือนจะถูกยกเลิก ช่วยลดความแปรปรวน GRPO เก็บวัตถุประสงค์ที่ถูกตัดของ PPO และการลงโทษ KL ไว้กับนโยบายอ้างอิงเพื่อป้องกันไม่ให้โมเดลลอยไปไกลเกินไป

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของการทำให้รางวัลเป็นมาตรฐานแบบกลุ่มใน RLHF

การทำให้เป็นมาตรฐานแบบกลุ่มกำลังกระตุ้นให้เกิดการเติบโตของโมเดลการใช้เหตุผล โดยที่โมเดลจะเรียนรู้จากรางวัลที่ตรวจสอบได้ เช่น คำตอบทางคณิตศาสตร์ที่ถูกต้องโดยไม่ต้องอาศัยผู้วิจารณ์ การวิจัยกำลังปรับปรุงให้ดีขึ้น: การถกเถียงว่าจะหารด้วยส่วนเบี่ยงเบนมาตรฐานหรือไม่ การจัดการกลุ่มที่ถูกทั้งหมดหรือผิดทั้งหมดที่สร้างข้อได้เปรียบเป็นศูนย์ และการขยายขนาดกลุ่ม คาดว่าวิธีการจัดกลุ่มและปราศจากคำวิจารณ์จะแพร่กระจายไปยังการใช้เครื่องมือเอเจนต์และการสร้างโค้ด โดยที่ตัวตรวจสอบอัตโนมัติจะส่งสัญญาณรางวัลราคาถูกและมากมาย

การใช้งานจริงในโลกแห่งความเป็นจริง

ฝึกอบรมแบบจำลองการใช้เหตุผลทางคณิตศาสตร์โดยการสุ่มตัวอย่างวิธีแก้ปัญหา 16 แบบต่อปัญหา และให้รางวัลแก่วิธีแก้ปัญหาที่สูงกว่าค่าเฉลี่ยของกลุ่ม

ปรับแต่งประโยชน์ของแชทบอทอย่างละเอียดโดยการปรับคะแนนโมเดลรางวัลให้เป็นมาตรฐานจากการตอบกลับของผู้สมัครหลายรายต่อการแจ้งเตือนของผู้ใช้แต่ละคน

การปรับปรุงผู้ช่วยเขียนโค้ดโดยให้คะแนนโซลูชันตัวอย่างแต่ละรายการโดยพิจารณาว่าผ่านการทดสอบหน่วยหรือไม่ จากนั้นจึงทำให้เป็นมาตรฐานภายในกลุ่ม

การลดหน่วยความจำ GPU ในไปป์ไลน์ RLHF โดยทิ้งเครือข่ายวิจารณ์ PPO และใช้ค่าเฉลี่ยกลุ่มเป็นข้อมูลพื้นฐานแทน

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่การช่วยเหลือการทำให้รางวัลเป็นมาตรฐานแบบกลุ่มใน RLHF และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การทำให้เป็นมาตรฐานความยาวในการเพิ่มประสิทธิภาพการตั้งค่า

คำถามที่พบบ่อย

What is Grouped Reward Normalization in RLHF?

การทำให้รางวัลเป็นมาตรฐานแบบกลุ่มจะสร้างมาตรฐานรางวัลของโมเดลภายในชุดของการตอบสนองต่อข้อความแจ้งเดียวกัน โดยเปลี่ยนคะแนนที่มีเสียงดังให้เป็นสัญญาณการฝึกที่เสถียร นี่คือเคล็ดลับหลักเบื้องหลัง GRPO ซึ่งเป็นอัลกอริธึมที่ขับเคลื่อนโมเดลการให้เหตุผลสมัยใหม่มากมาย

ในการทำให้รางวัลเป็นมาตรฐานแบบกลุ่ม รางวัลของแต่ละคำตอบเทียบกับอะไร?

รางวัลแต่ละรายการจะถูกแปลงเป็นคะแนน z โดยใช้ค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของกลุ่มการตอบกลับในข้อความแจ้งเดียวกัน

อัลกอริทึมใดที่เกี่ยวข้องกับการทำให้รางวัลเป็นมาตรฐานแบบกลุ่มมากที่สุด

GRPO ซึ่งเปิดตัวโดย DeepSeek และใช้ใน DeepSeek-R1 สร้างขึ้นจากการปรับรางวัลให้เป็นมาตรฐานภายในกลุ่ม

GRPO กำจัดองค์ประกอบใดของ PPO มาตรฐานออกไปอย่างชัดเจน

ด้วยการใช้ค่าเฉลี่ยกลุ่มเป็นพื้นฐาน GRPO จะละทิ้งคำวิจารณ์ที่ได้เรียนรู้ ซึ่งช่วยประหยัดหน่วยความจำและการคำนวณ

จะเกิดอะไรขึ้นกับคำตอบที่ได้รับรางวัลต่ำกว่าค่าเฉลี่ยของกลุ่ม?

การลบค่าเฉลี่ยกลุ่มจะทำให้คำตอบที่ต่ำกว่าค่าเฉลี่ยมีข้อได้เปรียบเชิงลบ และผลักนโยบายออกไป

เหตุใดการทำให้เป็นมาตรฐานภายในกลุ่มจึงลดความแปรปรวนในการฝึกอบรม

เนื่องจากการเปรียบเทียบมีความสัมพันธ์กันในแต่ละพร้อมท์ ความแตกต่างในระดับสัมบูรณ์และความยากง่ายในทันทีจึงถูกชะล้างออกไป