发生了什么
Epoch AI 的 FrontierMath 基准现在列出了已解决的 Apéry 式非理性证明问题,归功于人类与人工智能的合作,证明了 z(5) 的非理性,而不是经典的 z(3)。该解决方案以精益形式化的预印本形式发布,但该公司指出,该证明并未遵循基准最初要求的 Apéry 风格格式。为了捕捉这种细微差别,Epoch AI 于 9 月 16 日推出了“人类 + 人工智能”标签,适用于人引导模型通过无法自主成功的迭代步骤的情况。
Epoch AI 的 FrontierMath 平台专为抵抗记忆和模式匹配而构建,目前记录了 49 个开放问题,其中 9 个已标记为已解决,其中 4 个是完全自主的,5 个属于新创建的“人类 + AI”类别。在共同努力证明了 z(5) 的非理性之后,阿佩里式问题加入了后一组。该解决方案记录在包含精益形式化的预印本中,但作者承认该证明与基准最初寻求的 Apéry 式线性递归结构不匹配。
该公司 9 月 16 日的政策变更引入了“人类 + 人工智能”标签,以捕捉人类迭代引导模型的场景,如果没有这种指导,这一过程可能不会成功。 Epoch AI 自己的页面列出了尽管不匹配但已解决的问题,强调了标签的重要性,以避免对 AI 独立能力的误解。
该公告是继 FrontierMath 最近的其他里程碑之后发布的,例如 GPT-6 Astra 的 Tier 4 接近饱和(据报告准确率为 97.6%)以及“人类 + 人工智能”解决基于批准的委员会选举问题。这些较大的进步凸显了该基准在跟踪自主和辅助人工智能推理方面的作用。
为什么这很重要
该公告展示了基准设计者如何适应区分真正的自主推理和辅助模型使用,这一区别对于评估数学领域真正的人工智能进展至关重要。通过创建单独的标签,Epoch AI 可以防止夸大人工智能功能,并让研究人员更清楚地了解模型在哪些方面仍需要人类指导。这种透明度会影响投资者、学术同行和竞争对手评估人工智能推理系统成熟度的方式,并可能影响未来旨在惩罚捷径策略的基准设计。
区分自主性能和辅助性能对于对人工智能在没有人类输入的情况下进行原始数学推理的能力设定现实的预期至关重要。夸大人工智能成就可能会导致资金分配不当、过早部署以及基于对人工智能安全性和可靠性不准确评估的政策决策。
新的标签方案为研究人员评估模型功能提供了更精细的指标,鼓励开发无需人工提示即可真正推理的系统。它还为其他基准创建者提供了一个模板,以采用类似的区别,从而促进报告人工智能进展的全行业标准。
对于投资者和企业战略家来说,这一澄清有助于区分能够独立解决复杂问题的模型和仍然严重依赖专家指导的模型,从而影响如何分配资源以进行进一步研究和产品开发的决策。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
Which component of an AI application is the machine-learning model itself?
接下来看什么
未来的 FrontierMath 更新将揭示“人类+人工智能”类别是否会扩大,以及有多少剩余的未解决问题在这个标签下从未解决转变为已解决。观察者还应该关注其他人工智能实验室如何报告基准测试结果——它们是否采用类似的标签或声称自主突破——以及社区是否采用“自主”与“辅助”人工智能性能的标准化定义。
随着更多协作解决方案的出现,其他 FrontierMath 问题是否会被重新分类在“人类 + 人工智能”标签下。
如果相互竞争的人工智能实验室开始发布自己的基准测试结果并带有可比较的标签,则可能会形成报告辅助解决方案与自主解决方案的事实上的行业标准。
对于专注于自主数学推理的公司与强调人机交互方法的公司来说,此标签对未来融资轮次的影响。