Thinkingbox 基准测试发现人工智能代理难以可靠地完成有状态的业务工作流程
一篇新的 arXiv 论文介绍了 Thinkingbox,这是一个用于在多步骤业务任务上测试 AI 代理的沙箱和基准。最强的测试模型获得了 65.36% 的 pass@1 分数,但只有 25.25% 的 pass^20 分数,凸显了偶尔成功与可靠执行之间的差距。
每日更新1793 经过验证的故事
非营利教育团队用通俗易懂的英语解释了产品发布、政策转变、安全研究和行业动向的经过来源检查的人工智能报道。
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
What happened, why it matters, and what to watch — without the jargon.
当信号很弱时,我们不会发布任何内容,而是填充提要。
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
一篇新的 arXiv 论文介绍了 Thinkingbox,这是一个用于在多步骤业务任务上测试 AI 代理的沙箱和基准。最强的测试模型获得了 65.36% 的 pass@1 分数,但只有 25.25% 的 pass^20 分数,凸显了偶尔成功与可靠执行之间的差距。
arXiv 预印本认为神经网络权重奇异值之间日益不平衡是导致适应性丧失的可能原因,然后建议在持续学习和强化学习中定期修剪这些值。
新的 arXiv 预印本引入了一种诊断方法,用于确定回归模型的特定区域组合何时可以优于固定混合模型。在作者描述的测试中,一个小型标记目标域探针预测了增益,并帮助拒绝了产生超过 30 倍静态损耗的部署。
arXiv 预印本报告了 Llama 3.1 8B 内部跟踪专门设计的数字序列中的一阶差异的证据。该研究为这种行为提供了一种拟议的机制,但从所提供的摘要来看,其范围和稳健性仍不清楚。
MLHC 2026 接受的预印本描述了 PAFIR,这是一种强化学习框架,可从重复的多模式健康测量中选择不断变化的、特定于个人的跌倒风险信号。该论文报告了比基线更好的模式捕捉,但提供的记录没有给出效果大小或跌倒减少的证据。
arXiv 预印本描述了 DCGCNet,这是一个结合了心电图重建和心房颤动分类的模型,报告在七个跨数据集设置中的 AUC 高于 0.98,并且对多种噪声类型具有恢复能力。
新的 arXiv 预印本介绍了 PU-HNO,这是一种三阶段模型,用于根据低保真度模拟和场景信息预测详细的室内无线电地图。作者报告了几种基线方法的改进,但提供的记录没有提供数值结果或实际部署的证据。
arXiv 预印本介绍了 Tianmu-TC,这是一种基于西北太平洋数据训练的生成预测框架,其作者表示,该框架可以在使用较少计算的情况下改进全球海洋盆地的热带气旋预测。
arXiv 预印本描述了一个基于 LLM 的系统,该系统在分配 GPU 资源之前从源代码中预测作业执行时间和能源使用情况。其作者报告称,一个未命名的数据中心的能耗和排队时间较低,但记录缺乏足够的细节来独立评估结果。
A five-author ICML 2026 paper proposes measuring changes in nonlinear input interactions, not just final answers, when small prompt edits destabilize language models.
每周一次有用的简报
获取本周经过验证的人工智能新闻、原始数据、有用的工具、学习精选和新鲜的人工智能工作。