Chuyện gì đã xảy ra
Một nghiên cứu điển hình arXiv mới mô tả cách hệ thống nghiên cứu AI giúp các nhà toán học cải thiện các giới hạn đã biết của hằng số Grothendieck, một vấn đề mở có từ năm 1953. Bài báo trình bày cả kết quả toán học và bản ghi chi tiết về nơi hệ thống hoạt động tốt, nơi mọi người phải điều khiển nó và những tuyên bố nào vẫn được xác minh bằng máy chứ không phải do con người xác minh.
Hằng số Grothendieck đo khoảng cách giữa bài toán tối ưu hóa tổ hợp cứng và bài toán nới lỏng bán xác định dễ xử lý hơn. Các tác giả báo cáo một khoảng mới với giới hạn dưới là 6pi/11, khoảng 1,7135 và giới hạn trên khoảng 1,7818. Bài báo toán học đồng hành cung cấp các bằng chứng. Kết quả giới hạn dưới đáng chú ý vì nó không xây dựng một phiên bản cứng; thay vào đó nó tạo ra một trở ngại áp dụng cho các sơ đồ làm tròn có liên quan.
Hệ thống nghiên cứu kết hợp mô hình lý luận với tác nhân mã hóa. Bài báo cho biết quá trình chạy đã sử dụng GPT-5.5-Pro và sau đó là GPT-5.6-Sol để suy luận, Claude Code với Opus và sau đó là Fable 5 để thực thi và nút bốn GPU để tìm kiếm số. Các phiên họp mang tính liên tục thông qua các tệp, bản ghi, nhật ký thử nghiệm và bản tóm tắt ghi lại các tuyên bố dưới dạng đã được chứng minh, hỗ trợ bằng số, phỏng đoán hoặc phỏng đoán thay vì dựa vào một bối cảnh không bị gián đoạn.
Quá trình này bao gồm khoảng 240 phiên nghiên cứu từ ngày 16 tháng 6 đến ngày 24 tháng 7, với 2.091 lệnh gọi mô hình lý luận và ước tính 152 triệu mã thông báo với chi phí API ước tính là 5.400 USD. Khoảng 40 chỉ thị của con người đã chỉ đạo công việc. Khi tìm kiếm ở giới hạn trên không thay đổi, người vận hành nhận ra rằng các lỗi lặp đi lặp lại có thể cho thấy sự tắc nghẽn chung và chuyển hướng hệ thống sang đối số ở giới hạn dưới. Bài viết mô tả sự thay đổi trong hướng nghiên cứu đó là sự can thiệp của con người chứ không phải là một quyết định tự chủ.
Hệ thống đã tạo ra một cơ cấu lại trung tâm và một bằng chứng hoàn chỉnh cho giới hạn dưới 6pi/11, sau đó các tác giả đã sửa đổi và xác minh độc lập. Nó cũng tạo ra các ứng cử viên có số trên và dưới mạnh hơn đã vượt qua giao thức kiểm tra nội bộ, nhưng các tác giả chưa xác minh độc lập các chứng chỉ đó và không nêu chúng dưới dạng định lý. Do đó, bài viết tách kết quả toán học đã được xác minh khỏi các kết quả đầu ra mang tính suy đoán hoặc được thử nghiệm bằng máy của hệ thống.
Chi tiết nguồn: Long-horizon AI mathematics case study on arXiv ↗
Tại sao nó quan trọng
Nghiên cứu này đưa ra bằng chứng cụ thể một cách bất thường về AI được sử dụng trong một chương trình nghiên cứu chứ không phải là một nhiệm vụ chuẩn duy nhất. Phát hiện quan trọng nhất của nó là sự phân công lao động: hệ thống rất mạnh trong việc thực thi kỹ thuật, trong khi các nhà nghiên cứu con người vẫn chịu trách nhiệm thiết lập chương trình làm việc, phán đoán và xác minh cuối cùng.
Nghiên cứu dài hạn là điều khó khăn đối với hệ thống AI vì mục tiêu có thể thay đổi khi các phương pháp tiếp cận thất bại tích lũy. Một cộng tác viên hữu ích phải giữ lại những gì đã thử, phân biệt ngõ cụt với một ý tưởng chưa được giải quyết và quyết định khi nào một câu hỏi mới có giá trị hơn một tối ưu hóa cục bộ khác. Bộ nhớ dựa trên tệp và nhãn xác nhận quyền sở hữu của tác giả là một nỗ lực nhằm làm cho trạng thái nghiên cứu đó có thể nhìn thấy và kiểm tra được thay vì cho phép phản hồi trôi chảy để duy trì tiến độ.
Khám phá ở giới hạn dưới cho thấy tại sao khả năng phán đoán của con người vẫn quan trọng ngay cả khi một tác nhân có thể thực hiện toán học. Các nhà điều hành nhận thấy rằng nhiều nỗ lực xây dựng đều thất bại theo cách tương tự và đưa ra quan điểm mấu chốt: chứng minh chính sự cản trở lặp đi lặp lại. Hệ thống sau đó đã giúp chính thức hóa và chứng nhận lập luận. Trình tự đó gần giống với việc khám phá có giám sát hơn là với một nhà toán học máy móc độc lập và sự khác biệt đóng vai trò quan trọng khi mô tả những gì bằng chứng hỗ trợ.
Xác minh độc lập là cổng phát hành kết quả. Nghiên cứu điển hình cho biết giới hạn dưới đã được các tác giả kiểm tra và bằng chứng đầy đủ xuất hiện trong một bài báo đi kèm. Nó không nói rằng mọi con số được tạo ra trong quá trình chạy đều đúng. Việc tách biệt các tuyên bố ở cấp độ định lý, các ứng cử viên được kiểm tra bằng máy và các giả thuyết sẽ mang đến cho người đọc cách đánh giá sự đóng góp mà không chấp nhận độ tin cậy nội bộ của hệ thống AI làm bằng chứng toán học.
Đối với các tổ chức nghiên cứu, bài học thực tế là mang tính thực tiễn. Hệ thống AI có thể tìm kiếm tài liệu, viết mã, chạy thử nghiệm, bảo tồn các lần thử thất bại và đề xuất các biến đổi, nhưng quy trình làm việc xung quanh cần có nguồn gốc, tính toán có thể lặp lại, các điểm kiểm tra rõ ràng của con người và cách tái tạo lại lý do tại sao nhóm thay đổi hướng đi. Chi phí và tính toán được báo cáo cũng làm rõ rằng khả năng tầm xa không chỉ là vấn đề về trí thông minh của mô hình; nó phụ thuộc vào giàn giáo, thời gian và sự giám sát liên tục.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
What most distinguishes an AI agent from a basic chatbot?
Xem gì tiếp theo
Câu hỏi tiếp theo là liệu mô hình cộng tác này có khái quát hóa ra ngoài một vấn đề và nhóm hay không và liệu các nhà nghiên cứu độc lập có thể tái tạo kết quả đã được xác minh trong khi đo lường chi phí và độ tin cậy của mỗi đóng góp của con người và AI hay không.
Việc sao chép nên kiểm tra các lĩnh vực toán học, loại vấn đề và hệ thống nghiên cứu khác với các thiết kế công cụ và bộ nhớ khác nhau. Vấn đề Grothendieck đã đi kèm với một khuôn khổ đáng kể do con người xây dựng, các ghi chú tích lũy, cơ chế chứng nhận và hướng dẫn ứng viên. Cấu trúc trước đó đã giúp ích cho hoạt động này, vì vậy các nghiên cứu trong tương lai sẽ báo cáo trước bao nhiêu trạng thái nghiên cứu đã được cung cấp và kết quả thay đổi như thế nào khi hệ thống phải tự xác định vấn đề.
Các nhà nghiên cứu cũng nên so sánh việc thực hiện kỹ thuật với đánh giá nghiên cứu bằng cách sử dụng các biện pháp triển vọng. Các số liệu hữu ích có thể bao gồm chất lượng của các hướng đã chọn, thời gian từ bỏ một con đường thất bại, tỷ lệ khiếu nại không được hỗ trợ, số lượng can thiệp của con người và tỷ lệ kết quả đầu ra vượt qua được kiểm tra độc lập. Một nghiên cứu điển hình tinh tế có thể cho thấy điều gì đã xảy ra, nhưng cần có những so sánh có kiểm soát để ước tính thời điểm cộng tác viên AI cải thiện quy trình thay vì chỉ đơn giản thêm một lớp đánh giá khác.
Ranh giới giữa xác minh máy và xác minh con người cần được tiếp tục chú ý. Số học xen kẽ, trợ lý chứng minh, kiểm tra và kiểm tra đối thủ có thể mắc nhiều lỗi, tuy nhiên chứng chỉ vẫn có thể mã hóa sai mục tiêu hoặc phụ thuộc vào các giả định chưa bao giờ bị thách thức. Công việc tiếp theo nên xuất bản các tạo phẩm hoàn chỉnh, chạy lại các giới hạn chưa được xác minh mạnh nhất và hiển thị các kết quả bị lỗi hoặc bị rút lại như các kết quả thành công.
Cuối cùng, các phiên bản mô hình, lời nhắc, chỉ thị chỉ đạo, mã, tính toán và bản ghi phải được bảo tồn khi giấy phép và quyền riêng tư cho phép. Bài báo hiện tại có giá trị một phần vì nó báo cáo những điều kiện đó và mô tả những điểm yếu của hệ thống, bao gồm tính đại diện mong manh của trạng thái nghiên cứu và quyền tự chủ hạn chế trong phán đoán. Cho đến khi các nhóm khác tái tạo lại mô hình, đây là bằng chứng mạnh mẽ về tiến bộ toán học được hỗ trợ bởi AI, chứ không phải bằng chứng cho thấy các hệ thống AI có thể tiến hành nghiên cứu mở một cách độc lập.