HƯỚNG DẪN AI về ngôn ngữ

Giám sát quá trình lập luận toán học

Giám sát quy trình khen thưởng mô hình cho mỗi bước đúng trong chuỗi lý luận chứ không chỉ là câu trả lời cuối cùng.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

For math, where one wrong move ruins everything, grading the work itself produces far more reliable solvers.

Lặn sâu

Hầu hết các mô hình khen thưởng chỉ chấm điểm cho câu trả lời cuối cùng (giám sát kết quả). Điều đó cho phép một mô hình 'gặp may mắn' - đạt đúng con số thông qua các bước thiếu sót sẽ bị loại bỏ. Thay vào đó, giám sát quy trình đào tạo Mô hình khen thưởng quy trình (PRM) trên nhãn con người hoặc AI để đánh dấu từng bước trung gian là đúng, không chính xác hoặc trung tính. Bài báo 'Hãy xác minh từng bước' năm 2023 của OpenAI đã phát hành PRM800K, khoảng 800.000 nhãn cấp độ về các bài toán MATH và cho thấy trình xác minh được giám sát theo quy trình đã giải quyết được 78% tập hợp con thử nghiệm so với đường cơ sở chỉ dựa vào kết quả yếu hơn. PRM được sử dụng khi suy luận để xếp hạng nhiều giải pháp được lấy mẫu, chọn chuỗi có điểm bước tối thiểu cao nhất. Nó cũng đưa ra phản hồi có thể hiểu được: bạn có thể thấy chính xác lý do bị phá vỡ ở đâu.

Hiểu biết kỹ thuật

Tại thời điểm thử nghiệm, mô hình sẽ lấy mẫu nhiều giải pháp ứng cử viên; điểm PRM cho mỗi bước và điểm tổng thể của giải pháp thường là tích (hoặc tối thiểu) của xác suất đúng của mỗi bước. 'Best-of-N' sau đó chọn chuỗi có điểm cao nhất. Bởi vì tín chỉ được chỉ định cục bộ nên tín hiệu đào tạo dày đặc hơn và ít nhiễu hơn so với một phần thưởng cuối chuỗi, điều này làm giảm việc hack phần thưởng khi các bước sai ngẫu nhiên mang lại câu trả lời đúng.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của việc giám sát quy trình cho lý luận toán học

Ghi nhãn bước thủ công rất tốn kém, vì vậy nghiên cứu đang chuyển sang giám sát quy trình tự động — sử dụng triển khai Monte Carlo (Math-Shepherd) để ước tính giá trị của từng bước mà không cần nhãn của con người hoặc sử dụng các mô hình mạnh hơn để đánh giá những bước yếu hơn. Mong đợi PRM sẽ thúc đẩy tinh chỉnh hoạt động học tập tăng cường, không chỉ xếp hạng lại và mở rộng ra ngoài toán học thành mã, bằng chứng khoa học và lập kế hoạch nhiều bước tác nhân trong đó tính chính xác ở cấp độ bước là quan trọng.

Triển khai trong thế giới thực

Tập dữ liệu PRM800K của OpenAI: 800K nhãn cấp độ con người được sử dụng để đào tạo người xác minh theo điểm chuẩn MATH

Math-Shepherd: tự động gắn nhãn tính chính xác của bước thông qua triển khai Monte Carlo để tránh chú thích tốn kém của con người

Xếp hạng lại tốt nhất trong số N: tạo ra 256 giải pháp và chọn giải pháp có điểm PRM cao nhất ở mỗi bước

Các công cụ dạy kèm đánh dấu dòng chính xác trong giải pháp đã làm của học sinh nơi lỗi xuất hiện lần đầu tiên

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Process Supervision for Math Reasoning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Lý luận theo chuỗi suy nghĩ

Câu hỏi thường gặp

What is Process Supervision for Math Reasoning?

Giám sát quy trình khen thưởng mô hình cho mỗi bước đúng trong chuỗi lý luận chứ không chỉ là câu trả lời cuối cùng. Đối với môn toán, khi một động tác sai sẽ phá hỏng mọi thứ, thì việc chấm điểm bài làm sẽ tạo ra những cách giải đáng tin cậy hơn nhiều.

Sự khác biệt chính giữa giám sát quá trình và giám sát kết quả là gì?

Giám sát quy trình cung cấp tín hiệu khen thưởng ở mỗi bước suy luận, trong khi giám sát kết quả chỉ kiểm tra câu trả lời cuối cùng.

Tại sao việc giám sát chỉ chú trọng đến kết quả có thể gây nhầm lẫn cho các bài toán?

Chỉ khen thưởng cho câu trả lời cuối cùng ghi nhận các giải pháp 'may mắn' trong đó các bước trung gian không chính xác tình cờ tạo ra kết quả chính xác.

OpenAI đã phát hành gì cùng với 'Hãy xác minh từng bước'?

PRM800K chứa khoảng 800.000 chú thích của con người đánh dấu các bước suy luận riêng lẻ là đúng hoặc sai.

Mô hình Phần thưởng Quy trình thường được sử dụng như thế nào tại thời điểm suy luận?

PRM chấm điểm từng bước của nhiều giải pháp ứng cử viên, cho phép lựa chọn tốt nhất trong N chuỗi suy luận có điểm cao nhất.

Cách tiếp cận nào làm giảm nhu cầu về nhãn bước đắt tiền của con người?

Math-Shepherd ước tính độ chính xác của từng bước bằng cách triển khai các lần hoàn thành và đo lường tần suất chúng đạt được câu trả lời đúng, tránh việc gắn nhãn thủ công.