Chuyện gì đã xảy ra
MarkTechPost báo cáo rằng các nhà nghiên cứu từ Meta FAIR, Đại học Oxford và Đại học College London đã giới thiệu Mô hình ưu tiên nghiên cứu AI, hay RPM, để chọn những thử nghiệm mà tác nhân nghiên cứu AI nên chạy. Theo đánh giá AIRS-Bench được báo cáo, RPM đã cải thiện điểm chuẩn hóa trung bình và đạt đến mức cơ sở lựa chọn ngẫu nhiên trong khoảng 15 giờ thay vì 24 giờ.
MarkTechPost báo cáo rằng RPM xếp hạng các thử nghiệm ứng viên chưa được thực hiện thay vì dự đoán điểm tuyệt đối của chúng. Hệ thống được báo cáo sử dụng giàn giáo tìm kiếm cây tiến hóa có tên là AIRA-dojo. Một đặc vụ tạo ra song song 15 trẻ em ứng cử viên, so sánh chúng theo từng cặp trong một giải đấu loại trực tiếp và chỉ xử tử người chiến thắng. Việc so sánh sử dụng các nút ngữ cảnh đã được khám phá trước đó và điểm xác thực của chúng.
Bài viết mô tả hai biến thể. RPM chỉ suy luận sẽ đánh giá kế hoạch, mã và lịch sử tìm kiếm của ứng viên bằng mô hình ngôn ngữ được đào tạo trước cố định. Ngoài ra, RPM tác nhân còn chạy các thử nghiệm thí điểm nhỏ trong môi trường nhân bản chứa một GPU H200, sử dụng Python, bash và công cụ gửi. MarkTechPost báo cáo rằng bộ chọn tác nhân chỉ được sử dụng cho các bước Dự thảo và Cải thiện, trong khi lựa chọn Gỡ lỗi được hoàn nguyên về ngẫu nhiên vì quá trình thử nghiệm đã tiêu tốn ngân sách thời gian của tác nhân.
Trên AIRS-Bench, được MarkTechPost mô tả là chứa 20 tác vụ dạng văn bản và dạng bảng công khai, điểm chuẩn hóa trung bình được báo cáo là 0,684 cho lựa chọn ngẫu nhiên, 0,711 cho RPM chỉ suy luận và 0,729 cho RPM tác nhân. Thiết lập được cho là đã sử dụng Qwen3.6-27B cho cả người vận hành thử nghiệm và RPM, với 10 hạt giống và 24 giờ cho một H200 cho mỗi nhiệm vụ.
MarkTechPost báo cáo rằng cả hai biến thể RPM đều đạt đến đường cơ sở lựa chọn ngẫu nhiên trong khoảng 15 giờ: 14,88 giờ đối với chỉ suy luận và 15,50 giờ đối với lựa chọn tác nhân. Bài báo cũng báo cáo kết quả 94,1% trên WinoGrande và 95,7% trên SVAMP, mô tả chúng là những kết quả tiên tiến mới. Những số liệu và so sánh này là những tuyên bố trong báo cáo được cung cấp, không phải là kết quả được xác nhận độc lập.
Bài báo cho biết giàn giáo AIRA-dojo và AIRS-Bench là nguồn mở và Qwen3.6-27B có sẵn dưới dạng trọng lượng mở. Nó không cung cấp liên kết truy cập trực tiếp, điều khoản cấp phép, dịch vụ lưu trữ, chi tiết hỗ trợ thương mại hoặc giá cả. Vật liệu được cung cấp cũng không chứng minh rằng hệ thống đã sẵn sàng để sử dụng trong sản xuất chung.
Chi tiết nguồn: marktechpost.com ↗
Tại sao nó quan trọng
Nếu kết quả được báo cáo đúng, việc chọn thử nghiệm trước khi thực hiện có thể giúp nghiên cứu được hỗ trợ bởi AI hiệu quả hơn về mặt tính toán. Cách tiếp cận này giải quyết một nút thắt thực tế: các tác nhân nghiên cứu có thể tạo ra nhiều thí nghiệm ứng viên, nhưng việc thử nghiệm từng thí nghiệm rất tốn kém. Bằng chứng vẫn còn giới hạn ở tiêu chuẩn được báo cáo và chưa được xác nhận độc lập trong tài liệu được cung cấp.
Công việc được báo cáo nhắm đến vấn đề phân bổ tài nguyên trong nghiên cứu AI thay vì chỉ đơn thuần là cải thiện điểm chuẩn của mô hình. Một tác nhân có thể tạo ra nhiều ý tưởng hơn khả năng kiểm tra của nhóm cần một cách đáng tin cậy để quyết định thử nghiệm nào xứng đáng được tính toán. Do đó, lớp lựa chọn có thể ảnh hưởng đến thông lượng nghiên cứu, đặc biệt khi quá trình đào tạo hoặc đánh giá mất nhiều giờ hoặc nhiều ngày.
So sánh được báo cáo cho thấy rằng một số lợi ích đến từ việc lựa chọn giữa các ứng cử viên, vì cùng một đường trục Qwen3.6-27B đã được sử dụng cho người vận hành thử nghiệm và RPM. MarkTechPost báo cáo mức tăng tương đối 6,0% từ 0,684 lên 0,711 đối với lựa chọn chỉ suy luận và tăng 6,6% lên 0,729 đối với lựa chọn tác nhân, nhưng bài viết được cung cấp không cung cấp đủ chi tiết về phương pháp luận để đánh giá độ tin cậy thống kê ngoài khoảng tin cậy đã nêu.
Có những giới hạn có ý nghĩa. AIRS-Bench bao gồm 20 nhiệm vụ dạng văn bản và dạng bảng công khai, đồng thời các thử nghiệm đã sử dụng một thiết lập H200 duy nhất, do đó, các phát hiện có thể không được chuyển sang các chương trình nghiên cứu lớn hơn, các lĩnh vực khoa học hoặc phần cứng khác. Báo cáo không cung cấp sự sao chép độc lập, nghiên cứu trường hợp triển khai hoặc bằng chứng nào cho thấy phương pháp này cải thiện những khám phá trong thế giới thực hơn là kết quả chuẩn.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Xem gì tiếp theo
Theo dõi các tạo phẩm giấy, mã và điểm chuẩn cơ bản; nhân rộng các nhiệm vụ bổ sung; và bằng chứng về việc liệu lợi ích có tồn tại với các mô hình, nhà khai thác, phần cứng và lĩnh vực nghiên cứu khác nhau hay không. Quyền truy cập vào các thành phần nguồn mở được báo cáo được mô tả nhưng giá cả, tính sẵn có của máy chủ và hỗ trợ sản xuất không được ghi lại.
Kiểm tra tiếp theo hữu ích nhất là liệu các nhà nghiên cứu có xuất bản bài viết cơ bản, nhật ký thực hiện và đánh giá hay không và liệu các nhóm bên ngoài có tái tạo lại điểm số và tiết kiệm thời gian được báo cáo hay không. Báo cáo được cung cấp chỉ ra các thành phần nguồn mở nhưng không xác minh độc lập tính khả dụng hoặc khả năng sử dụng của chúng.
Các đánh giá trong tương lai nên kiểm tra các mô hình xương sống khác nhau, các phương pháp tạo ứng viên, nhóm nhiệm vụ và tính toán ngân sách. Thiết kế tác nhân được báo cáo cũng sử dụng các thử nghiệm thí điểm ngắn và ngân sách còn lại được phóng đại có chủ ý, những lựa chọn có thể ảnh hưởng đến kết quả và xứng đáng được thử nghiệm theo kế toán tài nguyên thông thường.
Người dùng tiềm năng nên coi các công cụ được báo cáo là các thành phần nghiên cứu chứ không phải là một sản phẩm thương mại được ghi lại. Nguồn không cung cấp giá cả, điều khoản cấp độ dịch vụ, yêu cầu cài đặt hoặc tuyên bố về tính khả dụng chung. Nó cũng không cho biết liệu RPM có thể xử lý an toàn các thử nghiệm có lỗi gây tốn kém hoặc các số liệu xác thực không đáng tin cậy hay không.
Các kết quả WinoGrande và SVAMP được báo cáo đảm bảo xác minh dựa trên các đường cơ sở được trích dẫn trước đó. Bài viết không cung cấp thử nghiệm độc lập, phân tích thống kê chi tiết hoặc đủ thông tin để xác định mức độ khái quát của những lợi ích đó.