返回新闻
创新AI Understanding 简报

Epoch AI 标志着通过人与人工智能协作解决了 Apéry 式的数学基准问题

Epoch AI 宣布,其 FrontierMath 基准测试的“通过线性递归进行的 Apéry 式非理性证明”问题现已被列为已解决,但仅在新的“人类 + AI”标签下,该标签反映了人类对模型的主动指导。

4 min readRead the linked source
Source-provided image accompanying Epoch AI marks Apéry‑style math benchmark problem solved with human‑plus‑AI collaboration
来源参考来源记录
出版商
startupfortune.com
来源链接
startupfortune.comhttps://startupfortune.com/an-ai-math-benchmark-problem-on-apry-style-proofs-just-got-marked-solved/
来源类型
链接来源——主要来源状态尚未确定。
背景60 秒内了解这一点

从这里开始

关键术语

基准测试
用于测量和比较模型性能的标准化测试或数据集。
人工智能安全
该领域专注于减少人工智能系统中的有害行为、故障和误用风险。
测试一下自己AI 模型解释测验

发生了什么

Epoch AI 的 FrontierMath 基准现在列出了已解决的 Apéry 式非理性证明问题,归功于人类与人工智能的合作,证明了 z(5) 的非理性,而不是经典的 z(3)。该解决方案以精益形式化的预印本形式发布,但该公司指出,该证明并未遵循基准最初要求的 Apéry 风格格式。为了捕捉这种细微差别,Epoch AI 于 9 月 16 日推出了“人类 + 人工智能”标签,适用于人引导模型通过无法自主成功的迭代步骤的情况。

Epoch AI 的 FrontierMath 平台专为抵抗记忆和模式匹配而构建,目前记录了 49 个开放问题,其中 9 个已标记为已解决,其中 4 个是完全自主的,5 个属于新创建的“人类 + AI”类别。在共同努力证明了 z(5) 的非理性之后,阿佩里式问题加入​​了后一组。该解决方案记录在包含精益形式化的预印本中,但作者承认该证明与基准最初寻求的 Apéry 式线性递归结构不匹配。

该公司 9 月 16 日的政策变更引入了“人类 + 人工智能”标签,以捕捉人类迭代引导模型的场景,如果没有这种指导,这一过程可能不会成功。 Epoch AI 自己的页面列出了尽管不匹配但已解决的问题,强调了标签的重要性,以避免对 AI 独立能力的误解。

该公告是继 FrontierMath 最近的其他里程碑之后发布的,例如 GPT-6 Astra 的 Tier 4 接近饱和(据报告准确率为 97.6%)以及“人类 + 人工智能”解决基于批准的委员会选举问题。这些较大的进步凸显了该基准在跟踪自主和辅助人工智能推理方面的作用。

来源详情: startupfortune.com ↗

为什么这很重要

该公告展示了基准设计者如何适应区分真正的自主推理和辅助模型使用,这一区别对于评估数学领域真正的人工智能进展至关重要。通过创建单独的标签,Epoch AI 可以防止夸大人工智能功能,并让研究人员更清楚地了解模型在哪些方面仍需要人类指导。这种透明度会影响投资者、学术同行和竞争对手评估人工智能推理系统成熟度的方式,并可能影响未来旨在惩罚捷径策略的基准设计。

区分自主性能和辅助性能对于对人工智能在没有人类输入的情况下进行原始数学推理的能力设定现实的预期至关重要。夸大人工智能成就可能会导致资金分配不当、过早部署以及基于对人工智能安全性和可靠性不准确评估的政策决策。

新的标签方案为研究人员评估模型功能提供了更精细的指标,鼓励开发无需人工提示即可真正推理的系统。它还为其他基准创建者提供了一个模板,以采用类似的区别,从而促进报告人工智能进展的全行业标准。

对于投资者和企业战略家来说,这一澄清有助于区分能够独立解决复杂问题的模型和仍然严重依赖专家指导的模型,从而影响如何分配资源以进行进一步研究和产品开发的决策。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下来看什么

未来的 FrontierMath 更新将揭示“人类+人工智能”类别是否会扩大,以及有多少剩余的未解决问题在这个标签下从未解决转变为已解决。观察者还应该关注其他人工智能实验室如何报告基准测试结果——它们是否采用类似的标签或声称自主突破——以及社区是否采用“自主”与“辅助”人工智能性能的标准化定义。

随着更多协作解决方案的出现,其他 FrontierMath 问题是否会被重新分类在“人类 + 人工智能”标签下。

如果相互竞争的人工智能实验室开始发布自己的基准测试结果并带有可比较的标签,则可能会形成报告辅助解决方案与自主解决方案的事实上的行业标准。

对于专注于自主数学推理的公司与强调人机交互​​方法的公司来说,此标签对未来融资轮次的影响。

相关指南和测验

人工智能模型解释AI 伦理AI 的未来测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?