Tinh chỉnh lấy mẫu từ chối
Tinh chỉnh lấy mẫu từ chối (RFT) tạo ra nhiều câu trả lời ứng viên, chỉ giữ lại những câu trả lời có điểm cao nhất và đào tạo lại mô hình về những câu trả lời chiến thắng đó.
Tổng quan
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Lặn sâu
Tinh chỉnh lấy mẫu từ chối, đôi khi được gọi là tinh chỉnh tốt nhất trong số N, là thành phần quan trọng trong cách căn chỉnh các mô hình như Llama 2 và Llama 3 của Meta. Công thức rất đơn giản: đối với mỗi lời nhắc, hãy lấy mẫu một số câu trả lời (ví dụ từ 4 đến 64) từ mô hình hiện tại, cho điểm từng câu trả lời bằng mô hình phần thưởng hoặc công cụ kiểm tra tự động, sau đó loại bỏ ('từ chối') tất cả trừ kết quả đầu ra được xếp hạng cao nhất. Các mẫu chất lượng cao còn sót lại sẽ trở thành một tập dữ liệu tinh chỉnh mới được giám sát và mô hình được huấn luyện trên chúng với tình trạng mất mã thông báo tiếp theo thông thường. Việc lặp đi lặp lại vòng lặp này sẽ thúc đẩy mô hình tự tạo ra các câu trả lời tốt hơn. Vì mô hình học hỏi từ các kết quả đầu ra được lọc của chính nó nên RFT tránh được tình trạng mất ổn định và đau đầu khi điều chỉnh RL theo độ dốc chính sách trong khi vẫn tận dụng tín hiệu khen thưởng.
Hiểu biết kỹ thuật
RFT khai thác thực tế rằng việc lấy mẫu nhiều lần và giữ phản hồi có phần thưởng tối đa gần giống với việc chọn từ một bản phân phối chất lượng cao hơn, sắc nét hơn. Việc đào tạo những người chiến thắng đó thông qua entropy chéo tiêu chuẩn sẽ chắt lọc một cách hiệu quả hành vi tốt nhất trong N trở lại đầu ra mẫu đơn của mô hình. Đối với các lĩnh vực có thể xác minh được như toán học hoặc mã, 'phần thưởng' có thể chỉ đơn giản là liệu câu trả lời cuối cùng hoặc bài kiểm tra đơn vị có vượt qua hay không, loại bỏ hoàn toàn nhu cầu về mô hình phần thưởng đã học.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của tinh chỉnh lấy mẫu từ chối
RFT là trọng tâm của quá trình đào tạo sau hiện đại, thường được sử dụng trước hoặc cùng với các phương pháp RL như PPO và DPO. Sự hấp dẫn của nó ngày càng tăng nhờ khả năng suy luận rẻ và trình xác minh tự động mạnh mẽ: khi các mô hình trở nên tự tạo và tự kiểm tra tốt hơn, việc lấy mẫu từ chối lặp lại sẽ hỗ trợ các vòng lặp dữ liệu tổng hợp và tự cải tiến. Mong đợi sự tích hợp chặt chẽ hơn với các mô hình lý luận tạo ra chuỗi suy nghĩ có thể kiểm chứng được và nghiên cứu liên tục về cách tránh bị hack phần thưởng và sụp đổ tính đa dạng khi đào tạo liên tục về kết quả đầu ra của chính mô hình.
Triển khai trong thế giới thực
Căn chỉnh các mô hình kiểu Llama bằng cách lấy mẫu nhiều câu trả lời cho mỗi lời nhắc, giữ điểm mô hình phần thưởng cao nhất, sau đó là SFT trên các câu trả lời đó
Cải thiện trình giải toán bằng cách tạo ra nhiều lời giải và chỉ giữ lại những câu trả lời đúng, có thể kiểm tra được
Tạo mã trong đó các ứng viên chỉ được lưu giữ nếu họ vượt qua các bài kiểm tra đơn vị, sau đó được sử dụng làm dữ liệu đào tạo
Xây dựng tập dữ liệu hướng dẫn tổng hợp bằng cách lọc các phản hồi tự tạo tốt nhất của mô hình cho vòng đào tạo tiếp theo
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
QLoRA và tinh chỉnh 4 bit
Câu hỏi thường gặp
What is Rejection Sampling Fine-Tuning?
Tinh chỉnh lấy mẫu từ chối (RFT) tạo ra nhiều câu trả lời ứng viên, chỉ giữ lại những câu trả lời có điểm cao nhất và đào tạo lại mô hình về những câu trả lời chiến thắng đó. Điều này quan trọng vì nó mang lại nhiều lợi ích của RLHF khi sử dụng phương pháp học có giám sát đơn giản thay vì học tăng cường phức tạp.
Ý tưởng cốt lõi của Tinh chỉnh lấy mẫu từ chối là gì?
RFT lấy mẫu nhiều câu trả lời, lọc ra những câu trả lời có điểm cao nhất và tinh chỉnh mô hình dựa trên những câu trả lời chiến thắng đó.
Trong các lĩnh vực có thể xác minh được như toán học hoặc mã, phần thưởng có thể là gì?
Đối với các nhiệm vụ có thể kiểm tra, RFT có thể sử dụng độ chính xác chính xác hoặc vượt qua các bài kiểm tra đơn vị, tránh mô hình phần thưởng đã học.
Dòng mô hình nào nổi tiếng đã sử dụng phương pháp lấy mẫu từ chối trong quá trình căn chỉnh?
Meta đã mô tả việc sử dụng lấy mẫu từ chối như một phần của công thức đào tạo sau cho mô hình Llama 2 và Llama 3.
Tại sao các nhóm có thể thích RFT hơn RL theo độ dốc chính sách như PPO?
RFT đào tạo lại với tính năng mất mã thông báo tiếp theo tiêu chuẩn trên các mẫu được lọc, loại bỏ độ khó điều chỉnh và tính không ổn định của các phương pháp chuyển đổi chính sách.
Đào tạo về các mẫu phần thưởng tối đa có hiệu quả gì?
Bằng cách học hỏi từ các phản hồi được lọc hàng đầu, mô hình sẽ tiếp thu hành vi chất lượng cao hơn trong một thế hệ.