Chuyện gì đã xảy ra
Bảy nhà nghiên cứu đã đăng một bản in trước trên arXiv lập luận rằng việc học tăng cường sau đào tạo sẽ làm giảm tính đa dạng trong các câu trả lời của mô hình ngôn ngữ và các chiến lược tiến hóa — tối ưu hóa trực tiếp trong không gian trọng số thông qua các nhiễu loạn ngẫu nhiên — duy trì sự đa dạng đó và nâng cao pass@k. Bài báo được gửi vào ngày 13 tháng 8 năm 2026 và chưa được bình duyệt. Bản tóm tắt hiển thị công khai không chứa tên điểm chuẩn, kích thước mô hình hoặc số liệu đo được.
Một bản in trước có tiêu đề "Vượt xa dự đoán tốt nhất: Cải thiện phạm vi áp dụng giải pháp LLM bằng các chiến lược tiến hóa" đã được gửi tới arXiv vào ngày 13 tháng 8 năm 2026 và được phân loại theo trí tuệ nhân tạo (cs.AI) với danh sách phụ về điện toán thần kinh và tiến hóa (cs.NE). Nó được ghi nhận bởi bảy tác giả - Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen và Xin Qiu. Bản ghi arXiv không liệt kê các chi nhánh của tổ chức và báo cáo này không quy tác phẩm cho bất kỳ tổ chức nào.
Khung của bài viết bắt đầu từ cách các mô hình ngôn ngữ thường được sử dụng trong môi trường khám phá như toán học và khoa học: một vấn đề được trình bày và câu trả lời duy nhất của mô hình được coi là giải pháp đề xuất. Các tác giả lập luận rằng chế độ "dự đoán tốt nhất" này để lại giá trị trên bảng, bởi vì việc tính toán bổ sung trong thời gian thử nghiệm có thể được sử dụng để tạo ra nhiều giải pháp ứng viên thay vì một giải pháp. Chế độ đó thường được đo bằng pass@k, một thước đo tính một vấn đề được giải quyết nếu ít nhất một trong k lần thử được lấy mẫu là chính xác.
Yêu cầu chính là chẩn đoán tác dụng phụ trong thực tế hiện nay. Các tác giả viết rằng việc đào tạo sau một mô hình bằng phương pháp học tăng cường sẽ thu hẹp phân bổ đầu ra của mô hình xung quanh các đầu ra có giá trị cao - và việc thu hẹp đó khiến phạm vi giải pháp bị thu hẹp. Nói cách khác, RL có thể làm cho câu trả lời đầu tiên tốt hơn trong khi làm cho tập hợp các câu trả lời riêng biệt nhỏ hơn, điều này đặc biệt gây bất lợi cho chế độ pass@k mà các tác giả quan tâm.
Để thay thế, bài báo đề xuất các chiến lược tiến hóa: phương pháp đào tạo sau không có độ dốc dựa trên dân số, tối ưu hóa trực tiếp trong không gian trọng lượng bằng cách áp dụng nhiễu loạn ngẫu nhiên cho các tham số mô hình và chọn kết quả, thay vì truyền ngược tín hiệu phần thưởng. Bản tóm tắt nêu rõ rằng ES đạt được pass@k cao hơn một cách nhất quán so với RL, tạo ra mức phân bổ đầu ra rộng hơn với phạm vi giải pháp lớn hơn và phạm vi bao phủ này lần lượt chuyển thành kết quả tốt hơn trên các điểm chuẩn toán học tiêu chuẩn.
Phần tóm tắt không cung cấp được hầu hết bằng chứng. Nó không nêu tên họ mô hình hoặc số lượng tham số, không có điểm chuẩn cụ thể, không có giá trị k, không có thuật toán RL cơ bản và không có kết quả bằng số - các từ "cao hơn một cách nhất quán" và "kết quả tốt hơn" là những đặc điểm duy nhất được đưa ra. Bài gửi có kích thước 449 KB và toàn văn có sẵn dưới dạng PDF và HTML thử nghiệm, vì vậy những chi tiết đó có thể có trên báo; chúng chỉ đơn giản là vắng mặt trong hồ sơ được đánh giá ở đây. Đây là bản in sẵn của phiên bản một không có dấu hiệu đánh giá ngang hàng, không có mã hoặc liên kết dữ liệu hiển thị và không có bản sao độc lập.
Tại sao nó quan trọng
Trong các lĩnh vực mà câu trả lời của ứng viên có thể được kiểm tra - bằng chứng, mã, giả thuyết khoa học - mức trần hữu ích không phải là liệu dự đoán đầu tiên của mô hình có đúng hay không mà là liệu câu trả lời đúng có xuất hiện ở bất kỳ đâu trong một loạt lần thử hay không. Nếu quá trình đào tạo sau RL thu hẹp nhóm đó một cách có hệ thống thì công thức liên kết thống trị của ngành có thể đang đánh đổi chính xác thuộc tính mà việc khám phá và tìm kiếm tác nhân phụ thuộc vào.
Sự khác biệt mà bài viết rút ra - giữa câu trả lời duy nhất hay nhất của một mô hình và phạm vi rộng của những gì nó có thể tạo ra trên nhiều mẫu - không mang tính học thuật. Ngày càng có nhiều công việc AI có giá trị cao chạy theo vòng lặp tạo-rồi-xác minh: đề xuất nhiều chương trình ứng viên và chạy bộ thử nghiệm, đề xuất nhiều bước chứng minh và kiểm tra chúng một cách máy móc, đề xuất nhiều giả thuyết và sàng lọc chúng. Trong tất cả các cài đặt đó, người xác minh sẽ quyết định ứng cử viên nào đúng, do đó, ràng buộc ràng buộc là liệu một ứng cử viên chính xác có từng được tạo hay không. Mức độ bao phủ là mức trần và độ chính xác trong lần thử đầu tiên chỉ kém mức đó một điểm.
Điều đó làm cho việc chẩn đoán có khả năng mang lại kết quả cho công thức chủ đạo sau đào tạo. Học tăng cường từ các tín hiệu khen thưởng là cách mà hầu hết các mô hình biên giới hiện tại được định hình sau khi huấn luyện trước và việc làm sắc nét phân phối đầu ra gần với mục đích của bài tập. Nếu việc tăng cường chi phí một cách đáng tin cậy thì quy trình tiêu chuẩn có thể tối ưu hóa cho điểm chuẩn được đo ở k=1 trong khi lặng lẽ làm giảm hiệu suất trong chế độ mà các mô hình được triển khai ngày càng nhiều. Mối lo ngại rằng RL thu hẹp tính đa dạng của mô hình đã được nêu ra trước đây trong tài liệu nghiên cứu; đóng góp được tuyên bố ở đây là một giải pháp thay thế cụ thể hơn là một chẩn đoán mới.
Biện pháp khắc phục được đề xuất mang lại sự đánh đổi nổi tiếng của riêng nó. Các chiến lược tiến hóa tránh hoàn toàn độ dốc, giúp loại bỏ một số tính không ổn định của việc tinh chỉnh RL, nhưng về mặt lịch sử, chúng phải trả giá cho điều đó bằng hiệu quả mẫu: việc ước tính hướng cập nhật hữu ích từ các nhiễu loạn trọng số ngẫu nhiên thường đòi hỏi nhiều lần chuyển tiếp qua một quần thể, song song tốt nhưng tiêu tốn điện toán. Liệu số học đó có hoạt động ở quy mô của các mô hình ngôn ngữ hiện đại hay không chính xác là câu hỏi mà người đọc muốn được trả lời và phần tóm tắt hoàn toàn không đề cập đến chi phí.
Đối với công chúng và các học viên, ngày nay không có gì thay đổi. Đây là tuyên bố nghiên cứu về phương pháp đào tạo, không phải là sản phẩm, bản phát hành mô hình hay phát hiện an toàn. Ý nghĩa thực tế của nó sẽ đến một cách gián tiếp - thông qua các mô hình được điều chỉnh để khám phá thay vì cam kết hoặc thông qua các nhà cung cấp đưa ra các nút bấm đánh đổi độ chính xác của câu trả lời đầu tiên để lấy chiều rộng. Không có bằng chứng nào trong nguồn cho thấy bất kỳ hệ thống được triển khai nào cũng sử dụng phương pháp này và không có nhà cung cấp nào được mô tả là áp dụng nó.
Cũng cần nêu rõ những giới hạn của những gì có thể được kết luận từ một bản tóm tắt in sẵn. Tuyên bố rằng ES đánh bại RL trên pass@k là báo cáo của tác giả về các thử nghiệm của chính họ, không phải là sự thật được xác lập độc lập. Việc so sánh giữa các phương pháp tối ưu hóa nổi tiếng là nhạy cảm với nỗ lực điều chỉnh, ngân sách tính toán và lựa chọn đường cơ sở và kết quả đúng cho một thang đo mô hình hoặc một nhóm điểm chuẩn thường không khái quát hóa.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
In AI training, what is an "epoch"?
Xem gì tiếp theo
Thông tin chi tiết về khả năng chịu tải có ở dạng PDF đầy đủ chứ không phải bản tóm tắt: mô hình nào đã được đào tạo, điểm chuẩn nào đã được sử dụng, giá trị nào của k và điều quan trọng là liệu ES và RL có được so sánh khi tính toán phù hợp hay không. Cũng đáng xem là liệu mã có được phát hành hay không, liệu kết quả có tái tạo bên ngoài toán học hay không và liệu có phòng thí nghiệm biên giới nào áp dụng phương pháp này hay không.
Điều đầu tiên cần kiểm tra là thiết lập thử nghiệm của toàn bộ bài báo và cụ thể là liệu các lần chạy ES và RL có khớp về mặt tính toán hay không. Một phương pháp không có độ dốc tiêu tốn nhiều điện toán đào tạo hơn đáng kể so với đường cơ sở RL của nó có thể trông đẹp hơn vì những lý do không liên quan đến cơ chế mà các tác giả đề xuất. Người đọc nên tìm kiếm các kích thước mô hình đã được huấn luyện, thuật toán RL được sử dụng để so sánh, số lượng nhiễu loạn trên mỗi thế hệ và các giá trị của k mà tại đó pass@k được đo — các đường cong bao phủ thường giao nhau và một phương pháp thắng ở mức k lớn có thể thua ở k=1.
Thứ hai, hãy chú ý đến phạm vi. Tuyên bố cụ thể của bản tóm tắt về lợi ích xuôi dòng được giới hạn ở "điểm chuẩn toán học tiêu chuẩn", một miền có xác minh tự động rẻ tiền và tối ưu hóa trước nhiều. Cho dù lợi thế về phạm vi bảo hiểm chuyển sang tạo mã, tạo giả thuyết khoa học hay các tác vụ tác nhân có kết thúc mở - trong đó việc xác minh ồn ào hơn và tính chính xác không phải là nhị phân - đều chưa được xác lập bởi tài liệu có sẵn.
Thứ ba, theo dõi các tạo tác và sao chép. Danh sách arXiv không hiển thị mã hoặc dữ liệu liên quan. Việc triển khai đã được phát hành hoặc bản sao chép của một nhóm không liên kết với các tác giả sẽ chuyển điều này từ một tuyên bố thành một kết quả. Nếu không có điều đó, thái độ thích hợp là sự quan tâm hơn là sự tự tin và bất kỳ tín hiệu chấp nhận nào cũng phải đi kèm với những con số riêng.
Thứ tư, câu hỏi của người xác minh giới hạn giá trị của bất kỳ mức tăng bảo hiểm nào. Pass@k cao hơn chỉ chuyển đổi thành đầu ra hữu ích khi có thứ gì đó có thể xác định được ứng viên chính xác trong số nhiều người. Trong toán học và phần mềm, có tồn tại các quân cờ; trong hầu hết các ứng dụng thương mại thì không, và việc chọn câu trả lời đúng từ một nhóm rộng hơn sẽ trở thành vấn đề chưa được giải quyết. Công việc tiếp theo là ghép nối các mô hình do ES đào tạo với các cơ chế lựa chọn sẽ là bước tiếp theo đương nhiên.
Cuối cùng, xem bản xuất bản. Bài viết này là bản in sẵn v1 không có địa điểm hoặc trạng thái đánh giá được nêu rõ. Các sửa đổi, đệ trình tại hội nghị hoặc phê bình công khai từ các nhà nghiên cứu khác đang nghiên cứu về tính đa dạng sau đào tạo của RL đều sẽ làm rõ hơn mức độ nghiêm túc của tuyên bố trọng tâm.