คู่มือ AI ภาษา

การเพิ่มประสิทธิภาพนโยบายที่ใกล้เคียง

Proximal Policy Optimization (PPO) เป็นอัลกอริธึมการเรียนรู้แบบเสริมแรงที่เกี่ยวข้องกับการปรับแต่งโมเดลภาษาอย่างละเอียดจากความคิดเห็นของมนุษย์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

เจาะลึก

PPO เปิดตัวโดย OpenAI ในปี 2017 และกลายเป็นผู้อยู่เบื้องหลัง RLHF สำหรับระบบอย่าง InstructGPT และ ChatGPT ความท้าทายหลักในการไล่ระดับนโยบาย RL คือการอัปเดตขนาดใหญ่เกินไปเพียงครั้งเดียวอาจทำให้ประสิทธิภาพลดลงได้ PPO จัดการกับสิ่งนี้ด้วย 'วัตถุประสงค์ตัวแทนที่ถูกตัดออก': โดยจะวัดว่ามีแนวโน้มว่าจะมีการดำเนินการเกิดขึ้นมากน้อยเพียงใดเมื่อเทียบกับนโยบายเก่า คูณอัตราส่วนนั้นด้วยความได้เปรียบ (การดำเนินการนั้นดีกว่าที่คาดไว้มากน้อยเพียงใด) และตัดอัตราส่วนให้อยู่ในช่วงเล็ก ๆ เช่น 0.8 ถึง 1.2 ซึ่งจะจำกัดว่านโยบายสามารถเคลื่อนไหวได้มากเพียงใดต่อการอัปเดต ทำให้การเรียนรู้มีความเสถียรในขณะที่ยังคงสามารถปรับปรุงได้อย่างต่อเนื่อง ในโมเดลภาษา RLHF นั้น 'การกระทำ' กำลังสร้างโทเค็นหรือการตอบกลับ รางวัลมาจากโมเดลรางวัล และการลงโทษ KL-divergence ทำให้โมเดลไม่ลอยไปไกลจากพฤติกรรมดั้งเดิมมากเกินไป

ข้อมูลเชิงลึกทางเทคนิค

PPO เพิ่มวัตถุประสงค์ที่ถูกตัดให้สูงสุด: นาที (อัตราส่วน * ความได้เปรียบ, คลิป (อัตราส่วน, 1-eps, 1+eps) * ความได้เปรียบ) โดยที่อัตราส่วนคือความน่าจะเป็นของการกระทำที่ใหม่กว่าเก่า โดยปกติแล้วข้อดีจะถูกประเมินด้วยการประมาณค่าความได้เปรียบทั่วไปและเครือข่ายคุณค่าที่เรียนรู้ (นักวิจารณ์) ใน RLHF รางวัลทั้งหมดจะรวมคะแนนโมเดลรางวัลเข้ากับการลงโทษ KL ต่อโทเค็นเทียบกับนโยบายอ้างอิง สร้างสมดุลของรางวัลที่ได้รับเทียบกับการคงไว้ใกล้กับโมเดลดั้งเดิม

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการเพิ่มประสิทธิภาพนโยบายใกล้เคียง

PPO ยังคงแข็งแกร่งแต่ก็ยุ่งวุ่นวายอย่างฉาวโฉ่: มันต้องการเครือข่ายค่าที่แยกจากกัน การปรับแต่งไฮเปอร์พารามิเตอร์อย่างระมัดระวัง และการประมวลผลจำนวนมาก ทางเลือกที่ง่ายกว่ากำลังได้รับความนิยม รวมถึง DPO (ไม่มี RL เลย) และ GRPO ซึ่งลดเครือข่ายคุณค่าลงโดยการประมาณข้อได้เปรียบจากกลุ่มของคำตอบที่สุ่มตัวอย่าง และได้ขับเคลื่อนแบบจำลองการให้เหตุผลล่าสุด PPO จะยังคงดำเนินต่อไปในกรณีที่การสำรวจตามนโยบายช่วยได้อย่างแท้จริง แต่สาขานี้กำลังแลกเปลี่ยนความซับซ้อนบางส่วนอย่างแข็งขันสำหรับวิธีการที่ถูกกว่า

การใช้งานจริงในโลกแห่งความเป็นจริง

การปรับแต่ง InstructGPT และ ChatGPT อย่างละเอียดเพื่อปฏิบัติตามคำแนะนำและการตั้งค่าของมนุษย์ผ่าน RLHF

ฝึกอบรมตัวแทนการควบคุมการเล่นเกมและหุ่นยนต์ โดเมนดั้งเดิมของ PPO ก่อนโมเดลภาษา

ลดความเป็นพิษหรือปรับปรุงความช่วยเหลือโดยการเพิ่มคะแนนโมเดลรางวัลสูงสุดภายใต้ข้อจำกัด KL

การปรับพฤติกรรมการใช้เครื่องมือหรือเอเจนต์หลายขั้นตอนให้เหมาะสม โดยที่โมเดลจะได้รับรางวัลจากการทำงานให้เสร็จสิ้นอย่างถูกต้อง

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเพิ่มประสิทธิภาพนโยบายสัมพันธ์กลุ่ม

คำถามที่พบบ่อย

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) เป็นอัลกอริธึมการเรียนรู้แบบเสริมแรงที่เกี่ยวข้องกับการปรับแต่งโมเดลภาษาอย่างละเอียดจากความคิดเห็นของมนุษย์ โดยจะปรับปรุงนโยบายด้วยขั้นตอนเล็กๆ อย่างระมัดระวัง เพื่อหลีกเลี่ยงความไม่เสถียรที่รบกวนวิธีการไล่ระดับนโยบายที่ไร้เดียงสา

'การตัด' ของ PPO แก้ไขปัญหาอะไรเป็นหลัก

การตัดอัตราส่วนความน่าจะเป็นจะป้องกันไม่ให้การอัปเดตเพียงครั้งเดียวย้ายนโยบายไปไกลเกินไป ซึ่งเป็นสาเหตุหลักของความไม่เสถียรในวิธีการไล่ระดับนโยบาย

ในรูปแบบภาษา RLHF ที่มี PPO สัญญาณรางวัลมักจะมาจากไหน

โมเดลการให้รางวัลจะให้รางวัลสเกลาร์สำหรับการตอบสนองที่สร้างขึ้น เนื่องจากการที่มนุษย์ให้คะแนนทุกเอาท์พุตระหว่าง RL นั้นเป็นไปไม่ได้

การลงโทษ KL-divergence ทำอะไรใน RLHF ที่ใช้ PPO

การลงโทษ KL ต่อโทเค็นต่อนโยบายดั้งเดิม (อ้างอิง) ทำให้โมเดลไม่เปลี่ยนแปลงพฤติกรรมอย่างรุนแรงเกินไปในขณะที่ไล่ตามรางวัล

บทบาทของเครือข่ายคุณค่า (นักวิจารณ์) ใน PPO คืออะไร?

PPO เป็นวิธีการที่ใช้นักแสดงและนักวิจารณ์ เครือข่ายคุณค่าจะประมาณผลตอบแทนที่คาดหวัง ทำให้สามารถประมาณความได้เปรียบ (มักผ่าน GAE) ซึ่งจะช่วยลดความแปรปรวน

'ข้อได้เปรียบ' แสดงถึงอะไรใน PPO

ข้อได้เปรียบจะวัดว่าการกระทำที่เลือกดีกว่า (หรือแย่กว่านั้น) มากน้อยเพียงใดเมื่อเทียบกับค่าประมาณ โดยบอกนโยบายว่าควรเสริมการดำเนินการใด