Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Nghiên cứu toán học được hỗ trợ bởi AI thắt chặt các giới hạn trên một hằng số lâu dài

Một nghiên cứu điển hình báo cáo rằng hệ thống nghiên cứu AI đã giúp cải thiện giới hạn của hằng số Grothendieck, trong khi các tác giả nhấn mạnh rằng các nhà nghiên cứu con người đã chọn trục xoay chính và chỉ xác minh độc lập kết quả ở cấp độ định lý.

6 min readRead the primary source
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
Long-horizon AI mathematics case study on arXiv
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.11195
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

API (Giao diện lập trình ứng dụng)
Một cách có cấu trúc để một hệ thống phần mềm gửi yêu cầu và nhận phản hồi từ hệ thống khác.
Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
Điểm chuẩn
Một bài kiểm tra hoặc tập dữ liệu được tiêu chuẩn hóa dùng để đo lường và so sánh hiệu suất của mô hình.
Tự kiểm traCâu đố về đại lý AI

Chuyện gì đã xảy ra

Một nghiên cứu điển hình arXiv mới mô tả cách hệ thống nghiên cứu AI giúp các nhà toán học cải thiện các giới hạn đã biết của hằng số Grothendieck, một vấn đề mở có từ năm 1953. Bài báo trình bày cả kết quả toán học và bản ghi chi tiết về nơi hệ thống hoạt động tốt, nơi mọi người phải điều khiển nó và những tuyên bố nào vẫn được xác minh bằng máy chứ không phải do con người xác minh.

Hằng số Grothendieck đo khoảng cách giữa bài toán tối ưu hóa tổ hợp cứng và bài toán nới lỏng bán xác định dễ xử lý hơn. Các tác giả báo cáo một khoảng mới với giới hạn dưới là 6pi/11, khoảng 1,7135 và giới hạn trên khoảng 1,7818. Bài báo toán học đồng hành cung cấp các bằng chứng. Kết quả giới hạn dưới đáng chú ý vì nó không xây dựng một phiên bản cứng; thay vào đó nó tạo ra một trở ngại áp dụng cho các sơ đồ làm tròn có liên quan.

Hệ thống nghiên cứu kết hợp mô hình lý luận với tác nhân mã hóa. Bài báo cho biết quá trình chạy đã sử dụng GPT-5.5-Pro ​​và sau đó là GPT-5.6-Sol để suy luận, Claude Code với Opus và sau đó là Fable 5 để thực thi và nút bốn GPU để tìm kiếm số. Các phiên họp mang tính liên tục thông qua các tệp, bản ghi, nhật ký thử nghiệm và bản tóm tắt ghi lại các tuyên bố dưới dạng đã được chứng minh, hỗ trợ bằng số, phỏng đoán hoặc phỏng đoán thay vì dựa vào một bối cảnh không bị gián đoạn.

Quá trình này bao gồm khoảng 240 phiên nghiên cứu từ ngày 16 tháng 6 đến ngày 24 tháng 7, với 2.091 lệnh gọi mô hình lý luận và ước tính 152 triệu mã thông báo với chi phí API ước tính là 5.400 USD. Khoảng 40 chỉ thị của con người đã chỉ đạo công việc. Khi tìm kiếm ở giới hạn trên không thay đổi, người vận hành nhận ra rằng các lỗi lặp đi lặp lại có thể cho thấy sự tắc nghẽn chung và chuyển hướng hệ thống sang đối số ở giới hạn dưới. Bài viết mô tả sự thay đổi trong hướng nghiên cứu đó là sự can thiệp của con người chứ không phải là một quyết định tự chủ.

Hệ thống đã tạo ra một cơ cấu lại trung tâm và một bằng chứng hoàn chỉnh cho giới hạn dưới 6pi/11, sau đó các tác giả đã sửa đổi và xác minh độc lập. Nó cũng tạo ra các ứng cử viên có số trên và dưới mạnh hơn đã vượt qua giao thức kiểm tra nội bộ, nhưng các tác giả chưa xác minh độc lập các chứng chỉ đó và không nêu chúng dưới dạng định lý. Do đó, bài viết tách kết quả toán học đã được xác minh khỏi các kết quả đầu ra mang tính suy đoán hoặc được thử nghiệm bằng máy của hệ thống.

Chi tiết nguồn: Long-horizon AI mathematics case study on arXiv ↗

Tại sao nó quan trọng

Nghiên cứu này đưa ra bằng chứng cụ thể một cách bất thường về AI được sử dụng trong một chương trình nghiên cứu chứ không phải là một nhiệm vụ chuẩn duy nhất. Phát hiện quan trọng nhất của nó là sự phân công lao động: hệ thống rất mạnh trong việc thực thi kỹ thuật, trong khi các nhà nghiên cứu con người vẫn chịu trách nhiệm thiết lập chương trình làm việc, phán đoán và xác minh cuối cùng.

Nghiên cứu dài hạn là điều khó khăn đối với hệ thống AI vì mục tiêu có thể thay đổi khi các phương pháp tiếp cận thất bại tích lũy. Một cộng tác viên hữu ích phải giữ lại những gì đã thử, phân biệt ngõ cụt với một ý tưởng chưa được giải quyết và quyết định khi nào một câu hỏi mới có giá trị hơn một tối ưu hóa cục bộ khác. Bộ nhớ dựa trên tệp và nhãn xác nhận quyền sở hữu của tác giả là một nỗ lực nhằm làm cho trạng thái nghiên cứu đó có thể nhìn thấy và kiểm tra được thay vì cho phép phản hồi trôi chảy để duy trì tiến độ.

Khám phá ở giới hạn dưới cho thấy tại sao khả năng phán đoán của con người vẫn quan trọng ngay cả khi một tác nhân có thể thực hiện toán học. Các nhà điều hành nhận thấy rằng nhiều nỗ lực xây dựng đều thất bại theo cách tương tự và đưa ra quan điểm mấu chốt: chứng minh chính sự cản trở lặp đi lặp lại. Hệ thống sau đó đã giúp chính thức hóa và chứng nhận lập luận. Trình tự đó gần giống với việc khám phá có giám sát hơn là với một nhà toán học máy móc độc lập và sự khác biệt đóng vai trò quan trọng khi mô tả những gì bằng chứng hỗ trợ.

Xác minh độc lập là cổng phát hành kết quả. Nghiên cứu điển hình cho biết giới hạn dưới đã được các tác giả kiểm tra và bằng chứng đầy đủ xuất hiện trong một bài báo đi kèm. Nó không nói rằng mọi con số được tạo ra trong quá trình chạy đều đúng. Việc tách biệt các tuyên bố ở cấp độ định lý, các ứng cử viên được kiểm tra bằng máy và các giả thuyết sẽ mang đến cho người đọc cách đánh giá sự đóng góp mà không chấp nhận độ tin cậy nội bộ của hệ thống AI làm bằng chứng toán học.

Đối với các tổ chức nghiên cứu, bài học thực tế là mang tính thực tiễn. Hệ thống AI có thể tìm kiếm tài liệu, viết mã, chạy thử nghiệm, bảo tồn các lần thử thất bại và đề xuất các biến đổi, nhưng quy trình làm việc xung quanh cần có nguồn gốc, tính toán có thể lặp lại, các điểm kiểm tra rõ ràng của con người và cách tái tạo lại lý do tại sao nhóm thay đổi hướng đi. Chi phí và tính toán được báo cáo cũng làm rõ rằng khả năng tầm xa không chỉ là vấn đề về trí thông minh của mô hình; nó phụ thuộc vào giàn giáo, thời gian và sự giám sát liên tục.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Xem gì tiếp theo

Câu hỏi tiếp theo là liệu mô hình cộng tác này có khái quát hóa ra ngoài một vấn đề và nhóm hay không và liệu các nhà nghiên cứu độc lập có thể tái tạo kết quả đã được xác minh trong khi đo lường chi phí và độ tin cậy của mỗi đóng góp của con người và AI hay không.

Việc sao chép nên kiểm tra các lĩnh vực toán học, loại vấn đề và hệ thống nghiên cứu khác với các thiết kế công cụ và bộ nhớ khác nhau. Vấn đề Grothendieck đã đi kèm với một khuôn khổ đáng kể do con người xây dựng, các ghi chú tích lũy, cơ chế chứng nhận và hướng dẫn ứng viên. Cấu trúc trước đó đã giúp ích cho hoạt động này, vì vậy các nghiên cứu trong tương lai sẽ báo cáo trước bao nhiêu trạng thái nghiên cứu đã được cung cấp và kết quả thay đổi như thế nào khi hệ thống phải tự xác định vấn đề.

Các nhà nghiên cứu cũng nên so sánh việc thực hiện kỹ thuật với đánh giá nghiên cứu bằng cách sử dụng các biện pháp triển vọng. Các số liệu hữu ích có thể bao gồm chất lượng của các hướng đã chọn, thời gian từ bỏ một con đường thất bại, tỷ lệ khiếu nại không được hỗ trợ, số lượng can thiệp của con người và tỷ lệ kết quả đầu ra vượt qua được kiểm tra độc lập. Một nghiên cứu điển hình tinh tế có thể cho thấy điều gì đã xảy ra, nhưng cần có những so sánh có kiểm soát để ước tính thời điểm cộng tác viên AI cải thiện quy trình thay vì chỉ đơn giản thêm một lớp đánh giá khác.

Ranh giới giữa xác minh máy và xác minh con người cần được tiếp tục chú ý. Số học xen kẽ, trợ lý chứng minh, kiểm tra và kiểm tra đối thủ có thể mắc nhiều lỗi, tuy nhiên chứng chỉ vẫn có thể mã hóa sai mục tiêu hoặc phụ thuộc vào các giả định chưa bao giờ bị thách thức. Công việc tiếp theo nên xuất bản các tạo phẩm hoàn chỉnh, chạy lại các giới hạn chưa được xác minh mạnh nhất và hiển thị các kết quả bị lỗi hoặc bị rút lại như các kết quả thành công.

Cuối cùng, các phiên bản mô hình, lời nhắc, chỉ thị chỉ đạo, mã, tính toán và bản ghi phải được bảo tồn khi giấy phép và quyền riêng tư cho phép. Bài báo hiện tại có giá trị một phần vì nó báo cáo những điều kiện đó và mô tả những điểm yếu của hệ thống, bao gồm tính đại diện mong manh của trạng thái nghiên cứu và quyền tự chủ hạn chế trong phán đoán. Cho đến khi các nhóm khác tái tạo lại mô hình, đây là bằng chứng mạnh mẽ về tiến bộ toán học được hỗ trợ bởi AI, chứ không phải bằng chứng cho thấy các hệ thống AI có thể tiến hành nghiên cứu mở một cách độc lập.

Hướng dẫn và câu hỏi liên quan

Đại lý AIGiải thích về mô hình AIĐào tạo AIĐánh giá LLMKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?