คู่มือทางเทคนิค

การเพิ่มประสิทธิภาพนโยบายสัมพันธ์กลุ่ม

Group Relative Policy Optimization (GRPO) เป็นวิธีการเรียนรู้แบบเสริมกำลังสำหรับการปรับแต่งโมเดลภาษาอย่างละเอียด ซึ่งจะตัดสินแต่ละคำตอบกับกลุ่มคำตอบพี่น้องในพร้อมต์เดียวกัน โดยกำจัดเครือข่ายค่าที่แยกจากกันที่ใช้โดย PPO

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It became famous as the core training trick behind DeepSeek's reasoning models.

เจาะลึก

GRPO เป็นตัวแปรหนึ่งของการเรียนรู้การเสริมแรงแบบไล่ระดับนโยบายที่ออกแบบมาเพื่อทำให้การปรับแต่ง RL อย่างละเอียดของโมเดลภาษาขนาดใหญ่ถูกลงและมีเสถียรภาพมากขึ้น PPO มาตรฐานจำเป็นต้องมี 'นักวิจารณ์' ที่เรียนรู้ (แบบจำลองคุณค่า) ซึ่งมีขนาดใหญ่พอๆ กับนโยบาย เพื่อประเมินว่าโทเค็นแต่ละอันนั้นดีเพียงใด GRPO จะลบคำวิจารณ์นั้นออกไปโดยสิ้นเชิง สำหรับการแจ้งเตือนแต่ละครั้ง ระบบจะสุ่มตัวอย่างกลุ่มของความสำเร็จ (เช่น 8-64) ให้คะแนนทั้งหมดด้วยสัญญาณรางวัล จากนั้นคำนวณข้อได้เปรียบของความสำเร็จแต่ละครั้งโดยกำหนดมาตรฐานรางวัลโดยเทียบกับค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของกลุ่ม คำตอบที่สูงกว่าค่าเฉลี่ยจะได้รับการเสริมกำลัง และคำตอบที่ต่ำกว่าค่าเฉลี่ยจะถูกระงับ คำศัพท์ KL-divergence ทำให้โมเดลใกล้เคียงกับนโยบายอ้างอิง เปิดตัวโดย DeepSeek โดยขับเคลื่อน DeepSeekMath และโมเดลการใช้เหตุผล DeepSeek-R1

ข้อมูลเชิงลึกทางเทคนิค

แนวคิดหลักคือการแทนที่พื้นฐานคุณค่าที่เรียนรู้ของ PPO ด้วยพื้นฐานกลุ่มมอนติคาร์โล สำหรับกลุ่มของเอาต์พุตที่มีรางวัล r_i ข้อดีแต่ละข้อคือ A_i = (r_i - meme(r)) / std(r) คะแนนมาตรฐานนั้นจะคูณอัตราส่วนความน่าจะเป็นที่ถูกตัด เหมือนกับใน PPO ทุกประการ และค่าปรับของ KL เทียบกับการควบคุมการเบี่ยงเบนของโมเดลอ้างอิงที่ค้าง เนื่องจากไม่มีการฝึกฝนนักวิจารณ์ หน่วยความจำและการประมวลผลจึงลดลงประมาณครึ่งหนึ่ง และการทำให้เป็นมาตรฐานตามเวลาพร้อมท์จะให้ข้อได้เปรียบที่ปรับขนาดได้ตามธรรมชาติและมีความแปรปรวนต่ำ

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการเพิ่มประสิทธิภาพนโยบายสัมพัทธ์กลุ่ม

GRPO กลายเป็นสูตรเริ่มต้นอย่างรวดเร็วสำหรับการฝึกแบบจำลองการใช้เหตุผลแบบเปิด และห้องทดลองกำลังทำซ้ำจุดอ่อน นักวิจัยกำลังสำรวจการแก้ไขอคติด้านความยาวและความยาก (เช่น Dr. GRPO) ระดับโทเค็นมากกว่าการทำให้เป็นมาตรฐานระดับลำดับ และการลบหรือปรับรูปแบบคำศัพท์ KL ใหม่ คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับรางวัลที่ตรวจสอบได้ (คณิตศาสตร์ โค้ด การใช้เครื่องมือ) การจัดการสัญญาณกระจัดกระจายที่ดีขึ้น และแบบผสมที่รวมเส้นฐานกลุ่มเข้ากับการวิจารณ์แบบเบาสำหรับงานเอเจนต์ที่มีหลายขั้นตอน

การใช้งานจริงในโลกแห่งความเป็นจริง

การฝึกอบรม DeepSeek-R1 และ DeepSeekMath เพื่อสร้างการให้เหตุผลแบบลูกโซ่ทางความคิดแบบยาวโดยใช้รางวัลความถูกต้องตามกฎเกณฑ์สำหรับปัญหาทางคณิตศาสตร์

การปรับแต่งโมเดลการสร้างโค้ดอย่างละเอียด โดยแต่ละโซลูชันตัวอย่างจะได้รับคะแนนจากการผ่านการทดสอบหน่วยหรือไม่ และกลุ่มจะได้รับการปรับให้เป็นมาตรฐานเพื่อเลือกผู้ชนะ

ไปป์ไลน์ RLHF แบบโอเพนซอร์ส (เช่น ในไลบรารี TRL และ verl) โดยใช้ GRPO เพื่อจัดรูปแบบการแชทโดยไม่ต้องจ่ายเงินสำหรับเครือข่ายค่าที่แยกจากกัน

การปรับปรุงการปฏิบัติตามคำสั่งหรือพฤติกรรมด้านความปลอดภัยโดยการสุ่มตัวอย่างหลายคำตอบต่อการแจ้งเตือนและให้รางวัลแบบจำลองการให้รางวัลที่มีอัตราสูงสุดเมื่อเทียบกับเพื่อนของพวกเขา

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเพิ่มประสิทธิภาพนโยบายที่ใกล้เคียง

คำถามที่พบบ่อย

What is Group Relative Policy Optimization?

Group Relative Policy Optimization (GRPO) เป็นวิธีการเรียนรู้แบบเสริมกำลังสำหรับการปรับแต่งโมเดลภาษาอย่างละเอียด ซึ่งจะตัดสินแต่ละคำตอบกับกลุ่มคำตอบพี่น้องในพร้อมต์เดียวกัน โดยกำจัดเครือข่ายค่าที่แยกจากกันที่ใช้โดย PPO มันมีชื่อเสียงในฐานะเคล็ดลับการฝึกอบรมหลักที่อยู่เบื้องหลังโมเดลการใช้เหตุผลของ DeepSeek

GRPO กำจัดองค์ประกอบหลักอะไรของ PPO?

การเปลี่ยนแปลงลายเซ็นของ GRPO กำลังทิ้งคุณค่าการเรียนรู้/แบบจำลองการวิจารณ์ของ PPO ซึ่งโดยปกติจะมีขนาดใกล้เคียงกับนโยบาย ซึ่งช่วยประหยัดหน่วยความจำและการประมวลผลได้มาก

GRPO คำนวณข้อได้เปรียบสำหรับความสำเร็จที่กำหนดอย่างไร

ข้อดีของการสำเร็จแต่ละครั้งคือ (รางวัล - ค่าเฉลี่ยกลุ่ม) / ส่วนเบี่ยงเบนมาตรฐานของกลุ่ม ดังนั้นกลุ่มของคำตอบในข้อความเดียวกันจึงทำหน้าที่เป็นพื้นฐาน

รุ่นไหนที่ทำให้ GRPO เป็นที่รู้จัก?

GRPO ได้รับการแนะนำและเผยแพร่โดย DeepSeek โดยเฉพาะอย่างยิ่งใน DeepSeekMath และเป็นเครื่องมือ RL ที่อยู่เบื้องหลังโมเดลการให้เหตุผล DeepSeek-R1

คำว่า KL-divergence มีบทบาทอย่างไรใน GRPO

การลงโทษ KL ต่อโมเดลอ้างอิง (โดยปกติคือ pre-RL) จะทำให้การฝึกอบรมเป็นปกติ ดังนั้นนโยบายจึงปรับปรุงโดยไม่ยุบหรือเบี่ยงเบนไปสู่เอาต์พุตที่เสื่อมถอย

เหตุใด GRPO จึงน่าสนใจเป็นพิเศษในการฝึกอบรมโมเดลการใช้เหตุผลทางคณิตศาสตร์หรือโค้ด

สุ่มตัวอย่างโซลูชันจำนวนมากและให้คะแนนด้วยการตรวจสอบความถูกต้องอัตโนมัติ จับคู่กับข้อได้เปรียบแบบกลุ่มของ GRPO อย่างชัดเจน โดยไม่จำเป็นต้องวิจารณ์