Mô hình phần thưởng
Mô hình phần thưởng là một mạng lưới thần kinh được đào tạo để dự đoán mức độ phản hồi của AI, hoạt động như một cơ quan thay thế tự động cho phán đoán của con người.
Tổng quan
It is the scoring engine that makes reinforcement learning from human feedback possible at scale.
Lặn sâu
Mô hình khen thưởng giải quyết một vấn đề thực tế: con người không thể đánh giá từng kết quả trong số hàng triệu kết quả đầu ra mà mô hình tạo ra trong quá trình đào tạo. Thay vào đó, người gắn nhãn so sánh một nhóm nhỏ các câu trả lời, thường chọn câu trả lời nào trong hai câu trả lời cho cùng một lời nhắc sẽ tốt hơn. Sau đó, mô hình phần thưởng sẽ được huấn luyện dựa trên những so sánh này để đưa ra một điểm vô hướng duy nhất cho bất kỳ cặp phản hồi nhanh chóng nào. Mục tiêu đào tạo tiêu chuẩn là mô hình Bradley-Terry, biến các sở thích theo cặp thành xác suất để một câu trả lời vượt qua câu trả lời khác. Sau khi được đào tạo, mô hình phần thưởng này có thể đánh giá các kết quả đầu ra mới không giới hạn với chi phí thấp, cung cấp tín hiệu mà các thuật toán như PPO sử dụng để cải thiện mô hình ngôn ngữ. Các mô hình phần thưởng cũng được sử dụng lại tại thời điểm suy luận để lấy mẫu best-of-N, trong đó nhiều ứng cử viên được tạo ra và kết quả có điểm cao nhất được trả về.
Hiểu biết kỹ thuật
Mô hình phần thưởng thường là mô hình ngôn ngữ cơ sở với phần đầu dự đoán mã thông báo được thay thế bằng một lớp tuyến tính duy nhất phát ra một đại lượng vô hướng. Quá trình đào tạo tối đa hóa khả năng ghi nhật ký mà phản hồi được chọn đạt điểm cao hơn phản hồi bị từ chối: loss = -log(sigmoid(r_chosen - r_rejected)). Chỉ có sự khác biệt tương đối mới quan trọng, vì vậy thang đo tuyệt đối là tùy ý. Chất lượng phụ thuộc vào tính nhất quán của nhãn và mức độ bao phủ rộng rãi của các kiểu phản hồi.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của mô hình khen thưởng
Nghiên cứu đang giải quyết điểm yếu lớn nhất của mô hình phần thưởng: chúng có thể bị 'tấn công' (các mô hình khai thác những điểm kỳ quặc như ưu tiên độ dài) và chúng không còn được phân phối khi chính sách được cải thiện. Các hướng đi đầy hứa hẹn bao gồm các mô hình khen thưởng quy trình chấm điểm từng bước lý luận, các ước tính tổng thể và độ không chắc chắn để chống lại hành vi hack, nhãn ưu tiên do AI tạo ra (RLAIF) và các mô hình phần thưởng tổng quát tạo ra các lời phê bình và lý do thay vì một con số trần.
Triển khai trong thế giới thực
Hỗ trợ RLHF cho các trợ lý như ChatGPT và Claude bằng cách chấm điểm các câu trả lời của ứng viên trong quá trình đào tạo PPO
Lấy mẫu tốt nhất trong số N, trong đó một mô hình tạo ra nhiều câu trả lời và mô hình phần thưởng chọn ra câu trả lời tốt nhất cho người dùng
'Trình xác minh' toán học và mã hóa hoặc các mô hình khen thưởng quy trình chấm điểm các bước suy luận trung gian để cải thiện khả năng giải quyết vấn đề
Xếp hạng và lọc dữ liệu đào tạo tổng hợp, chỉ giữ lại các thế hệ có điểm cao để tinh chỉnh thêm
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình phần thưởng Bradley-Terry
Câu hỏi thường gặp
What is Reward Modeling?
Mô hình phần thưởng là một mạng lưới thần kinh được đào tạo để dự đoán mức độ phản hồi của AI, hoạt động như một cơ quan thay thế tự động cho phán đoán của con người. Đây là công cụ tính điểm giúp việc học tăng cường từ phản hồi của con người có thể thực hiện được trên quy mô lớn.
Đầu ra chính của mô hình khen thưởng cho một cặp phản hồi nhanh chóng nhất định là gì?
Mô hình phần thưởng ánh xạ lời nhắc và phản hồi tới một số vô hướng biểu thị chất lượng dự đoán hoặc sở thích của con người.
Loại dữ liệu nào của con người được sử dụng phổ biến nhất để đào tạo các mô hình khen thưởng?
Người gắn nhãn thường so sánh hai câu trả lời cho cùng một lời nhắc và chọn câu trả lời tốt hơn; mô hình Bradley-Terry chuyển đổi những thứ này thành phần thưởng vô hướng.
Việc mất mô hình phần thưởng tiêu chuẩn tối ưu hóa điều gì?
Mất Bradley-Terry, -log(sigmoid(r_chosen - r_rejected)), chỉ quan tâm đến thứ tự tương đối, vì vậy tỷ lệ tuyệt đối là tùy ý.
'hack phần thưởng' là gì?
Việc hack phần thưởng xảy ra khi mô hình tìm thấy các lối tắt (như độ dài quá mức hoặc lời tâng bốc) mà mô hình phần thưởng không hoàn hảo đánh giá cao nhưng con người thì không.
Mô hình phần thưởng có nguồn gốc kiến trúc từ mô hình ngôn ngữ như thế nào?
Mô hình phần thưởng thường sử dụng lại đường trục LM nhưng hoán đổi lớp cuối cùng lấy lớp tạo ra phần thưởng vô hướng duy nhất.