Học tăng cường từ phản hồi của con người
RLHF là kỹ thuật biến mô hình ngôn ngữ thô thành một trợ lý lịch sự, hữu ích bằng cách đào tạo nó theo sở thích của con người.
Tổng quan
It matters because it aligns model behavior with what people actually want, not just what is statistically likely.
Lặn sâu
Mô hình ngôn ngữ được huấn luyện trước sẽ dự đoán văn bản hợp lý nhưng hợp lý không đồng nghĩa với việc hữu ích, trung thực hoặc an toàn. RLHF sửa lỗi này theo từng giai đoạn. Đầu tiên, việc tinh chỉnh có giám sát sẽ hướng dẫn mô hình làm theo hướng dẫn bằng cách sử dụng các câu trả lời mẫu do con người viết. Tiếp theo, con người so sánh các cặp phản hồi của mô hình với cùng một lời nhắc và chọn câu trả lời tốt hơn; những so sánh này đào tạo một mô hình phần thưởng riêng biệt để ghi điểm bất kỳ phản hồi nào. Cuối cùng, mô hình ngôn ngữ được tối ưu hóa với phương pháp học tăng cường để tạo ra phản hồi có tỷ lệ mô hình khen thưởng cao. Một hình phạt giúp nó không trôi quá xa so với mô hình ban đầu để nó vẫn trôi chảy và không khai thác những điểm kỳ quặc của mô hình phần thưởng. RLHF là trọng tâm giúp trợ lý kiểu ChatGPT có thể sử dụng được.
Hiểu biết kỹ thuật
Mô hình phần thưởng thường được huấn luyện theo các cặp ưu tiên theo phong cách Bradley-Terry, học cách đưa ra câu trả lời ưa thích của con người với số điểm vô hướng cao hơn. Sau đó, chính sách này được cập nhật bằng PPO (Tối ưu hóa chính sách gần nhất), giúp tối đa hóa phần thưởng trong khi hình phạt phân kỳ KL so với mô hình tham chiếu ngăn chặn việc tối ưu hóa quá mức và 'hack phần thưởng'. Vì PPO khó sử dụng nên các phương pháp mới hơn như DPO (Tối ưu hóa ưu tiên trực tiếp) bỏ qua mô hình phần thưởng rõ ràng và vòng lặp tăng cường, tối ưu hóa chính sách trực tiếp từ các cặp ưu tiên.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của việc học tăng cường từ phản hồi của con người
RLHF đang được sắp xếp hợp lý và tự động hóa một phần. DPO và các phương pháp ưu tiên trực tiếp có liên quan đang thay thế quy trình PPO nặng nề cho nhiều nhóm và RLAIF sử dụng phản hồi do AI tạo ra (như trong AI Hiến pháp) để cắt giảm chi phí ghi nhãn. Nghiên cứu đang giải quyết vấn đề hack phần thưởng, thành kiến của người chú thích và khó khăn trong việc đánh giá các câu trả lời dài hoặc của chuyên gia bằng các kỹ thuật như giám sát quy trình và tranh luận. Mong đợi sự liên kết để kết hợp phản hồi của con người và AI, tín hiệu phần thưởng phong phú hơn ngoài một lượt thích và sự giám sát ngày càng tăng về người cung cấp các tùy chọn và giá trị nào họ mã hóa.
Triển khai trong thế giới thực
Điều chỉnh trợ lý trò chuyện để nó từ chối các yêu cầu có hại và đưa ra các câu trả lời hữu ích, có cấu trúc tốt thay vì chỉ là văn bản hợp lý.
Xếp hạng các cặp tóm tắt theo sở thích của con người để đào tạo một mô hình viết các bản tóm tắt mà mọi người thực sự thấy hữu ích.
Giảm kết quả đầu ra độc hại hoặc thiên vị bằng cách khen thưởng những phản hồi mà người đánh giá đánh giá là tôn trọng và an toàn.
Sử dụng DPO trên tập dữ liệu gồm các câu trả lời ưu tiên và bị từ chối để căn chỉnh mô hình nguồn mở mà không cần chạy vòng lặp PPO đầy đủ.
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Học tăng cường
Câu hỏi thường gặp
What is Reinforcement Learning From Human Feedback?
RLHF là kỹ thuật biến mô hình ngôn ngữ thô thành một trợ lý lịch sự, hữu ích bằng cách đào tạo nó theo sở thích của con người. Nó quan trọng vì nó điều chỉnh hành vi của mô hình với những gì mọi người thực sự muốn chứ không chỉ những gì có thể xảy ra về mặt thống kê.
Mục đích chính của RLHF cho mô hình ngôn ngữ là gì?
RLHF hướng mô hình theo hướng phản hồi mà con người mong muốn, làm cho mô hình trở nên hữu ích, trung thực và an toàn hơn thay vì chỉ hợp lý.
Mô hình phần thưởng trong RLHF thực sự học để làm gì?
Mô hình khen thưởng được huấn luyện dựa trên sự so sánh sở thích của con người để ghi điểm phản hồi, cung cấp tín hiệu mà chính sách tối ưu hóa.
Tại sao hình phạt phân kỳ KL so với mô hình ban đầu được sử dụng trong bước RL?
Hình phạt KL giữ cho chính sách được tối ưu hóa gần với mô hình tham chiếu, bảo vệ khỏi việc hack phần thưởng và mất tính trôi chảy.
Dữ liệu ưu tiên thường được thu thập cho mô hình phần thưởng như thế nào?
Người chú thích chọn phản hồi ưa thích trong so sánh theo cặp, huấn luyện mô hình phần thưởng thông qua kiểu mất mát kiểu Bradley-Terry.
DPO (Tối ưu hóa tùy chọn trực tiếp) mang lại lợi thế gì so với quy trình RLHF cổ điển?
DPO lấy mục tiêu trực tiếp từ sở thích, tránh mô hình khen thưởng riêng biệt và bước học tập củng cố cầu kỳ.