Tối ưu hóa chính sách gần nhất
Tối ưu hóa chính sách gần nhất (PPO) là thuật toán học tăng cường được liên kết nhiều nhất với các mô hình ngôn ngữ tinh chỉnh từ phản hồi của con người.
Tổng quan
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Lặn sâu
PPO được OpenAI giới thiệu vào năm 2017 và trở thành công cụ hỗ trợ đằng sau RLHF cho các hệ thống như InstructGPT và ChatGPT. Thách thức cốt lõi trong RL theo độ dốc chính sách là một bản cập nhật quá lớn có thể làm giảm hiệu suất. PPO giải quyết vấn đề này bằng 'mục tiêu thay thế được cắt bớt': nó đo lường mức độ nhiều hơn (hoặc ít hơn) khả năng một hành động sẽ trở thành so với chính sách cũ, nhân tỷ lệ đó với lợi thế (hành động tốt hơn mong đợi bao nhiêu) và cắt tỷ lệ đó xuống một phạm vi nhỏ như 0,8 đến 1,2. Điều này giới hạn khoảng cách mà chính sách có thể thực hiện cho mỗi lần cập nhật, giúp duy trì hoạt động học tập ổn định trong khi vẫn cho phép cải thiện ổn định. Trong RLHF mô hình ngôn ngữ, 'hành động' đang tạo ra mã thông báo hoặc phản hồi, phần thưởng đến từ mô hình phần thưởng và hình phạt phân kỳ KL giúp mô hình không bị trôi quá xa so với hành vi ban đầu của nó.
Hiểu biết kỹ thuật
PPO tối đa hóa mục tiêu bị cắt bớt: tối thiểu (tỷ lệ * lợi thế, clip (tỷ lệ, 1-eps, 1+eps) * lợi thế), trong đó tỷ lệ là xác suất hành động mới trên cũ. Ưu điểm thường được ước tính bằng Ước tính lợi thế tổng quát và mạng giá trị học được (quan trọng). Trong RLHF, tổng phần thưởng kết hợp điểm số của mô hình phần thưởng với hình phạt KL cho mỗi mã thông báo so với chính sách tham chiếu, cân bằng giữa phần thưởng nhận được với việc duy trì gần với mô hình ban đầu.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của việc tối ưu hóa chính sách gần nhất
PPO vẫn mạnh nhưng nổi tiếng là khó sử dụng: nó cần một mạng giá trị riêng biệt, điều chỉnh siêu tham số cẩn thận và tính toán rất nhiều. Các lựa chọn thay thế đơn giản hơn đang có chỗ đứng, bao gồm DPO (hoàn toàn không có RL) và GRPO, loại bỏ mạng giá trị bằng cách ước tính lợi ích từ các nhóm phản hồi được lấy mẫu và hỗ trợ các mô hình lý luận gần đây. PPO sẽ tiếp tục tồn tại khi việc khám phá chính sách thực sự hữu ích, nhưng lĩnh vực này đang tích cực đánh đổi một số tính phức tạp của nó để lấy các phương pháp rẻ hơn.
Triển khai trong thế giới thực
Tinh chỉnh Hướng dẫnGPT và ChatGPT làm theo hướng dẫn và tùy chọn của con người thông qua RLHF
Đào tạo các tác nhân điều khiển trò chơi và robot, miền gốc của PPO trước các mô hình ngôn ngữ
Giảm độc tính hoặc cải thiện tính hữu ích bằng cách tối đa hóa điểm mô hình phần thưởng theo ràng buộc KL
Tối ưu hóa việc sử dụng công cụ hoặc hành vi của tác nhân nhiều bước trong đó mô hình được khen thưởng vì hoàn thành nhiệm vụ một cách chính xác
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tối ưu hóa chính sách tương đối của nhóm
Câu hỏi thường gặp
What is Proximal Policy Optimization?
Tối ưu hóa chính sách gần nhất (PPO) là thuật toán học tăng cường được liên kết nhiều nhất với các mô hình ngôn ngữ tinh chỉnh từ phản hồi của con người. Nó cải thiện chính sách theo từng bước nhỏ, cẩn thận để tránh sự mất ổn định gây khó khăn cho các phương pháp chuyển đổi chính sách ngây thơ.
Việc 'cắt' của PPO chủ yếu giải quyết vấn đề gì?
Việc cắt giảm tỷ lệ xác suất sẽ ngăn không cho bất kỳ cập nhật đơn lẻ nào đưa chính sách đi quá xa, đây là nguyên nhân chính gây mất ổn định trong các phương pháp điều chỉnh chính sách.
Trong mô hình ngôn ngữ RLHF với PPO, tín hiệu khen thưởng thường đến từ đâu?
Mô hình phần thưởng cung cấp phần thưởng vô hướng cho các phản hồi được tạo ra, vì việc con người chấm điểm mọi đầu ra trong RL là không khả thi.
Hình phạt phân kỳ KL có tác dụng gì trong RLHF dựa trên PPO?
Hình phạt KL trên mỗi mã thông báo đối với chính sách (tham khảo) ban đầu không khuyến khích mô hình thay đổi hành vi quá mạnh mẽ trong khi theo đuổi phần thưởng.
Vai trò của mạng giá trị (phê bình) trong PPO là gì?
PPO là một phương pháp phê bình tác nhân; mạng giá trị ước tính phần thưởng dự kiến, cho phép ước tính lợi thế (thường thông qua GAE) giúp giảm sai lệch.
'Lợi thế' thể hiện điều gì trong PPO?
Lợi thế đo lường mức độ tốt hơn (hoặc tệ hơn) của một hành động được chọn so với ước tính giá trị, cho chính sách biết hành động nào cần củng cố.