HƯỚNG DẪN cơ bản

Mô hình phần thưởng Bradley-Terry

Mô hình Bradley-Terry là một phương pháp thống kê có tuổi đời hàng thế kỷ để biến các so sánh theo cặp (A nhịp B) thành điểm số.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Lặn sâu

Bradley-Terry, được giới thiệu vào năm 1952, giả định mọi vật phẩm đều có điểm sức mạnh tiềm ẩn và xác suất vật phẩm A đánh bại vật phẩm B là hàm logistic của chênh lệch điểm số của chúng. Trong quá trình căn chỉnh AI, điều này ánh xạ gọn gàng vào dữ liệu ưu tiên: người gắn nhãn nhìn thấy hai phản hồi mô hình và chọn phản hồi tốt hơn thay vì đưa ra xếp hạng tuyệt đối khó hiệu chỉnh. Một mô hình phần thưởng, thường là mô hình ngôn ngữ có đầu ra vô hướng, được đào tạo để phản hồi mà con người ưa thích sẽ nhận được phần thưởng vô hướng cao hơn. Phần thua là khả năng ghi nhật ký âm của xác suất Bradley-Terry: tối đa hóa log-sigmoid của (phần thưởng của phần thưởng được chọn trừ phần thưởng của phần bị từ chối). Sau đó, mô hình phần thưởng thu được sẽ cho điểm các kết quả đầu ra tùy ý, cung cấp tín hiệu cho thấy các thuật toán học tăng cường như PPO sẽ tối ưu hóa để làm cho các mô hình trở nên hữu ích và phù hợp hơn.

Hiểu biết kỹ thuật

Tổn thất huấn luyện cho phép so sánh chỉ đơn giản là trừ log-sigmoid của (r_chosen − r_rejected), do đó mô hình chỉ học được những khác biệt tương đối. Điều này có nghĩa là phần thưởng chỉ có thể được xác định khi có hằng số cộng; quy mô tuyệt đối là tùy ý. Vì việc so sánh đối với con người dễ dàng và nhất quán hơn so với điểm số từ 1 đến 10 nên dữ liệu của Bradley-Terry ít nhiễu hơn. Tối ưu hóa tùy chọn trực tiếp sau đó cho thấy bạn có thể bỏ qua mô hình phần thưởng riêng biệt và tối ưu hóa mục tiêu Bradley-Terry trực tiếp trên chính sách.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của mô hình phần thưởng Bradley-Terry

Bradley-Terry giả định một thứ hạng nhất quán duy nhất và các sở thích bắc cầu, sẽ bị phá vỡ khi con người không đồng ý hoặc theo chu kỳ sở thích. Nghiên cứu đang hướng tới các mô hình nắm bắt sự phân bổ sở thích, phần thưởng đa chiều (sự hữu ích, an toàn, trung thực được tính điểm riêng) và các phương pháp như Nash học hỏi từ phản hồi của con người loại bỏ giả định về một điểm số. DPO và các biến thể của nó ngày càng đưa mục tiêu Bradley-Terry trực tiếp vào đào tạo chính sách. Mong đợi các kế hoạch so sánh phong phú hơn, bao gồm thứ hạng của nhiều hơn hai mục và các ưu tiên dựa trên mức độ tin cậy, để giảm việc hack phần thưởng.

Triển khai trong thế giới thực

Huấn luyện mô hình phần thưởng trong RLHF để xếp hạng hai phản hồi của chatbot và cung cấp tín hiệu tốt hơn-xấu hơn để tinh chỉnh PPO.

Tối ưu hóa tùy chọn trực tiếp tinh chỉnh mô hình trực tiếp trên các cặp câu trả lời được chọn so với bị từ chối bằng cách sử dụng mất log-sigmoid Bradley-Terry.

Xếp hạng người chơi cờ vua hoặc thể thao điện tử thông qua Elo, về mặt toán học, mô hình này gần giống với mô hình Bradley-Terry về kết quả trò chơi.

Xây dựng trình xếp hạng đề xuất nội dung từ dữ liệu nhấp chuột 'người dùng ưa thích A hơn B' thay vì xếp hạng theo sao tuyệt đối.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu về nơi mà Mô hình phần thưởng Bradley-Terry hữu ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình phần thưởng

Câu hỏi thường gặp

What is Bradley-Terry Reward Modeling?

Mô hình Bradley-Terry là một phương pháp thống kê có tuổi đời hàng thế kỷ để biến các so sánh theo cặp (A nhịp B) thành điểm số. Trong AI hiện đại, nó hỗ trợ các mô hình khen thưởng tìm hiểu sở thích của con người từ 'câu trả lời nào tốt hơn?' nhãn, xương sống của RLHF.

Mô hình Bradley-Terry chuyển đổi thành điểm số như thế nào?

Bradley-Terry thực hiện các so sánh theo cặp 'A đánh bại B' và suy ra điểm sức mạnh tiềm ẩn cho từng mục, đó là lý do tại sao nó rất phù hợp với việc dán nhãn sở thích của con người.

Trong Bradley-Terry, xác suất để A thắng B là hàm số của cái gì?

Mô hình đặt P(A thắng B) bằng logistic (sigmoid) của sự khác biệt giữa điểm sức mạnh tiềm ẩn của A và B.

Tại sao phần thưởng Bradley-Terry chỉ có thể được xác định bằng một hằng số cộng?

Việc mất huấn luyện chỉ sử dụng sự khác biệt giữa phần thưởng được chọn và bị từ chối, do đó, việc dịch chuyển tất cả các điểm theo cùng một hằng số sẽ khiến cho tổn thất không thay đổi; quy mô tuyệt đối là tùy ý.

Mức tổn thất tiêu chuẩn cho một so sánh ưu tiên duy nhất trong mô hình phần thưởng là bao nhiêu?

Khả năng ghi nhật ký âm của Bradley-Terry giảm xuống mức âm log-sigmoid của chênh lệch phần thưởng được chọn-trừ-bị từ chối, đẩy phần thưởng của phản hồi đã chọn lên cao hơn.

Phương pháp nào bỏ qua mô hình khen thưởng riêng bằng cách tối ưu hóa mục tiêu Bradley-Terry trực tiếp trên chính sách?

DPO định dạng lại mục tiêu ưu tiên Bradley-Terry để có thể áp dụng trực tiếp vào mô hình chính sách, loại bỏ nhu cầu đào tạo và truy vấn mô hình phần thưởng độc lập.