返回新闻
创新AI Understanding 简报

人工智能辅助数学研究收紧了长期常数的界限

一项案例研究报告称,人工智能研究系统有助于提高格罗腾迪克常数的范围,而作者强调,人类研究人员选择了关键枢纽,并仅独立验证了定理级别的结果。

6 min readRead the primary source
主要来源文件来源记录
出版商
Long-horizon AI mathematics case study on arXiv
来源链接
arxiv.orghttps://arxiv.org/abs/2608.11195
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
内存(代理内存)
AI 代理跨步骤或会话使用存储的上下文来提高连续性。
基准测试
用于测量和比较模型性能的标准化测试或数据集。
测试一下自己AI 代理测验

发生了什么

一项新的 arXiv 案例研究描述了人工智能研究系统如何帮助数学家改进格洛腾迪克常数的已知界限,这是一个可追溯至 1953 年的开放问题。本文介绍了数学结果,并详细记录了系统在哪些方面表现良好、在哪些方面必须由人来引导,以及哪些主张仍需机器验证而不是人工验证。

格洛腾迪克常数衡量了困难的组合优化问题和更容易处理的半定松弛问题之间的差距。作者报告了一个新的区间,其下限为 6pi/11,约为 1.7135,上限约为 1.7818。配套的数学论文提供了证明。下界结果值得注意,因为它不构造硬实例;相反,它会产生适用于相关舍入方案的障碍。

该研究系统将推理模型与编码代理相结合。该论文称,该运行使用 GPT-5.5-Pro 和后来的 GPT-5.6-Sol 进行推理,使用 Claude Code 与 Opus 和后来的 Fable 5 进行执行,并使用四 GPU 节点进行数值搜索。会议通过文件、笔录、实验日志和摘要来保持连续性,将主张记录为经过验证的、有数字支持的、推测的或启发式的,而不是依赖于一个不间断的上下文。

该运行涵盖了从 6 月 16 日到 7 月 24 日的大约 240 个研究会议,其中有 2,091 次推理模型调用和估计 1.52 亿个代币,API 成本估计为 5,400 美元。大约 40 条过时的人类指令指导了这项工作。当上限搜索趋于稳定时,操作员认识到重复失败可能表明存在普遍障碍,并将系统重定向到下限参数。该论文将研究方向的改变描述为人为干预,而不是自主决策。

该系统产生了一个中央重构和 6pi/11 下界的完整证明,然后作者对其进行了修改和独立验证。它还生成了通过内部检查协议的更强的数值上限和下限候选,但作者尚未独立验证这些证书,也没有将它们表述为定理。因此,本文将经过验证的数学结果与系统更具推测性或机器测试的输出分开。

来源详情: Long-horizon AI mathematics case study on arXiv ↗

为什么这很重要

该研究提供了关于人工智能在整个研究项目而不是单个基准任务中使用的异常具体的证据。它最重要的发现是分工:系统在技术执行方面很强,而人类研究人员仍然负责议程设置、判断和最终验证。

对于人工智能系统来说,长期研究是困难的,因为随着失败方法的积累,目标可能会发生变化。一个有用的合作者必须保留已经尝试过的东西,区分死胡同和未解决的想法,并决定何时一个新问题比另一个局部优化更有价值。作者基于文件的记忆和声明标签是为了使研究状态可见且可审计,而不是让流畅的响应来代替进展。

下限发现表明,即使智能体可以执行数学运算,人类的判断仍然很重要。操作员注意到许多尝试的构造都以同样的方式失败,并提供了概念支点:证明重复的障碍本身。然后,该系统帮助形式化并证明了这一论点。这个序列更接近于监督探索,而不是独立的机器数学家,并且在描述证据支持的内容时,这种区别很重要。

独立验证是结果的发布门。该案例研究称,作者检查了下限,完整的证明出现在配套论文中。它并没有说运行期间产生的每个数字都是正确的。将定理层面的主张、机器测试的候选者和假设分开,为读者提供了一种评估贡献的方法,而无需接受人工智能系统的内部信心作为数学证明。

对于研究组织来说,实践课程是可操作的。人工智能系统可以搜索文献、编写代码、运行实验、保留失败的尝试并提出转换建议,但周围的工作流程需要出处、可重复的计算、明确的人工检查点以及重建团队改变方向的原因的方法。报告的成本和计算还清楚地表明,长期能力不仅是模型智能的问题,也是模型智能的问题。这取决于脚手架、时间和持续的监督。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

接下来看什么

下一个问题是这种协作模式是否可以推广到一个问题和团队之外,以及独立研究人员是否可以在衡量每个人和人工智能贡献的成本和可靠性的同时重现经过验证的结果。

复制应该测试其他数学领域、问题类型以及具有不同内存和工具设计的研究系统。格洛腾迪克问题已经有了一个实质性的人工构建框架、积累的笔记、认证机制和候选方向。先前的结构有助于运行,因此未来的研究应该报告预先提供了多少研究状态,以及当系统必须定义问题本身时结果如何变化。

研究人员还应该使用前瞻性措施将技术执行与研究判断进行比较。有用的指标可以包括所选方向的质量、放弃失败路径的时间、不受支持的主张的比率、人工干预的数量以及通过独立检查的输出的比例。完善的案例研究可以展示发生的情况,但需要进行受控比较来估计人工智能协作者何时改进流程,而不是简单地添加另一层审查。

机器验证和人工验证之间的界限值得持续关注。区间算术、证明助手、测试和对抗性审计可以发现许多错误,但证书仍然可能编码错误的目标或依赖于从未受到质疑的假设。后续工作应该发布完整的工件,重新运行最强的未经验证的边界,并使失败或撤回的结果与成功的结果一样可见。

最后,应在许可和隐私允许的情况下保留模型版本、提示、指导指令、代码、计算和记录。当前的论文之所以有价值,部分原因在于它报告了这些条件并描述了该系统的弱点,包括脆弱的研究状态代表性和有限的判断自主权。在其他团队重现该模式之前,这是人工智能辅助数学进步的有力证据,而不是人工智能系统可以独立进行开放式研究的证据。

相关指南和测验

人工智能代理人工智能模型解释人工智能培训法学硕士评估测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?