Chuẩn hóa độ dài trong Tối ưu hóa tùy chọn
Chuẩn hóa độ dài sẽ điều chỉnh các mục tiêu điều chỉnh tùy chọn để các mô hình ngừng giành được sự phê duyệt chỉ bằng cách viết các câu trả lời dài hơn.
Tổng quan
It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.
Lặn sâu
Khi các mô hình được căn chỉnh theo các phương pháp như RLHF hoặc DPO, chúng sẽ học hỏi từ những so sánh trong đó con người (hoặc mô hình phần thưởng) đã chọn câu trả lời 'tốt hơn' trong hai câu trả lời. Một lỗi dai dẳng là các câu trả lời dài hơn có xu hướng được ưu tiên ngay cả khi chúng không thực sự tốt hơn, vì vậy mô hình học được lối tắt: nói nhiều lời. Bình thường hóa độ dài chống lại điều này. Trong DPO, phần thưởng tiềm ẩn là tổng chênh lệch về xác suất nhật ký trên mỗi mã thông báo, phần thưởng này tăng lên một cách máy móc theo độ dài. Các biến thể như DPO và SimPO được chuẩn hóa theo chiều dài sẽ chia phần thưởng đó cho số lượng mã thông báo, thay vào đó tính điểm theo mức trung bình trên mỗi mã thông báo. Kết quả là các mô hình luôn ngắn gọn và đúng trọng tâm thay vì thổi phồng các phản hồi để đạt được mục tiêu.
Hiểu biết kỹ thuật
Phần thưởng tiềm ẩn của DPO là tỷ lệ nhật ký giữa chính sách được điều chỉnh và chính sách tham chiếu, được tổng hợp trên mỗi mã thông báo trong phản hồi. Bởi vì mỗi mã thông báo thêm một thuật ngữ khác (thường là tích cực), phần thưởng thô sẽ tăng theo độ dài chuỗi, tối ưu hóa thiên về thời gian hoàn thành dài hơn. SimPO loại bỏ mô hình tham chiếu và sử dụng xác suất ghi nhật ký trung bình trên mỗi mã thông báo làm phần thưởng, cộng với tỷ lệ phần thưởng mục tiêu. Việc chia theo độ dài sẽ loại bỏ lợi thế về độ dài cơ học, do đó độ dốc ưu tiên phản ánh chất lượng hơn là số từ.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của việc chuẩn hóa độ dài trong tối ưu hóa ưu tiên
Mong đợi việc kiểm soát độ dài sẽ trở thành một núm vặn tiêu chuẩn thay vì phải suy nghĩ lại. Các nhà nghiên cứu đang kết hợp việc chuẩn hóa độ dài với các hình phạt về độ dài rõ ràng, phần thưởng có điều kiện về độ dài và bộ đánh giá giữ độ dài câu trả lời không đổi để đo lường mức tăng chất lượng thực sự. Khi các mô hình phần thưởng trở nên tốt hơn trong việc phát hiện xu hướng chi tiết, các quy trình căn chỉnh có thể sẽ báo cáo tỷ lệ thắng không thiên vị theo độ dài theo mặc định và người dùng sẽ có quyền kiểm soát tốt hơn đối với mức độ ngắn gọn hoặc chi tiết của câu trả lời của mô hình.
Triển khai trong thế giới thực
Điều chỉnh trợ lý hỗ trợ khách hàng bằng SimPO để nó đưa ra những câu trả lời rõ ràng, chính xác thay vì những đoạn văn dài dòng chỉ nhìn kỹ lưỡng.
Báo cáo 'tỷ lệ thắng được kiểm soát theo độ dài' trên AlpacaEval 2 để hiển thị một mô hình được cải thiện thực sự thay vì chỉ trở nên nhảm nhí hơn.
Thêm tính năng chuẩn hóa độ dài vào DPO khi tinh chỉnh mô hình mã hóa để nó trả về các đoạn mã chính xác ở mức tối thiểu, không phải bản soạn sẵn cồng kềnh.
Chẩn đoán một mô hình khen thưởng giúp chấm điểm các bài luận dài hơn một cách có hệ thống, sau đó loại bỏ nó trước khi sử dụng nó để sắp xếp một trợ lý viết.
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Tài liệu giúp ích cho việc Chuẩn hóa độ dài trong Tối ưu hóa tùy chọn và nơi các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Length Normalization in Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tối ưu hóa ưu tiên tỷ lệ cược
Câu hỏi thường gặp
What is Length Normalization in Preference Optimization?
Chuẩn hóa độ dài sẽ điều chỉnh các mục tiêu điều chỉnh tùy chọn để các mô hình ngừng giành được sự phê duyệt chỉ bằng cách viết các câu trả lời dài hơn. Điều này quan trọng bởi vì các tín hiệu khen thưởng không được điều chỉnh sẽ đẩy các chatbot hướng tới các phản hồi dài dòng, có phần đệm thay vì những phản hồi thực sự tốt hơn.
Việc chuẩn hóa độ dài trong DPO chủ yếu nhằm mục đích ngăn chặn hành vi không mong muốn nào?
Phần thưởng tiềm ẩn của DPO tăng lên theo số lượng mã thông báo, do đó, nếu không chuẩn hóa, các mô hình sẽ biết rằng chỉ cần dài dòng hơn sẽ có xu hướng giành được sự so sánh ưu tiên.
Tại sao phần thưởng tiềm ẩn của DPO tiêu chuẩn có xu hướng tăng theo thời lượng phản hồi?
Phần thưởng ngầm tổng hợp các tỷ lệ log-xác suất trên mỗi mã thông báo, do đó, nhiều mã thông báo hơn thường có nghĩa là tổng phần thưởng lớn hơn.
SimPO giải quyết vấn đề sai lệch về độ dài như thế nào?
SimPO chấm điểm các phản hồi bằng xác suất ghi nhật ký trung bình (chuẩn hóa độ dài) của chúng và thêm tỷ lệ phần thưởng mục tiêu, loại bỏ lợi thế về độ dài cơ học.
Thực tiễn đánh giá nào giúp xác nhận một mô hình được cải thiện về chất lượng thay vì chỉ về độ dài?
Tỷ lệ thắng được kiểm soát độ dài (như trên AlpacaEval 2) điều chỉnh độ dài câu trả lời để mức tăng phản ánh chất lượng chứ không phải mức độ dài dòng.