已验证来源
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
简单的英语
发生了什么、为什么重要以及值得关注的内容——无需行话。
无填料
当信号很弱时,我们不会发布任何内容,而是填充提要。
更多故事
9 故事创新
使用 NVIDIA SkillEvaluator 评估 AI 代理技能表现
NVIDIA SkillEvaluator 通过三层评估流程来衡量经过验证的技能对 AI 代理性能的影响。
developer.nvidia.com创新
论文介绍“影子评估”:人工智能代理完成了工程但未能通过两个研究问题
一份由 24 位作者组成的预印本让前沿 AI 代理尝试解决两篇未发表的 NeurIPS 2026 提交的中心研究问题,然后让论文自己的作者对结果进行评分。特工们在六天内独立完成了工程,但在研究中被明确拒绝。arxiv.org产品展示
Warp 开放对“工厂”的早期访问,这是一个用于运行编码代理队列的配置即代码系统
Warp 正在接受 Warp Factory 的早期访问请求,该工厂将一组编码代理定义为一个 YAML 文件中的代码、存储库、模型、权限和人工检查点,由 CLI、API、SDK 和 MCP 驱动。其自动化和成本数据是供应商声称的:没有定价、全面上市日期或独立测试。warp.dev创新
Benchmark 表示,顶级多模态模型在通过钢笔声音和手势读取单词方面得分低于 10%
一篇新的 arXiv 论文介绍了一项测试,其中模型必须从笔划音频和手部动作视频中推断出书面单词,且看不到墨水。作者报告称,人类的有序字母准确率高于 80%,而领先模型的准确率低于 10%——而且为模型提供这两种模式往往会使结果变得更糟。arxiv.org创新
论文称,代理感知缓存管理可将多代理服务中的第一个令牌延迟减少高达 45%
新的 arXiv 预印本描述了 CacheScout,这是一个基于开源 vLLM 服务器构建的层,它根据下一步可能运行的代理来决定在模型的键值缓存中保留哪些内容。作者报告了两位数的延迟和吞吐量增益;摘要中未说明工作负载、模型和硬件。arxiv.org创新
对 OpenAI AI 生成的证明的审核发现了相反的情况,并发布了修复
两位研究人员表示,OpenAI 数学文档第 6 章中的引理证明存在极性错误:以平均成功为标准的测试,而下一步需要较大的条件失败。他们给出了一个反例和一个修正的证明,并警告说这并不是对本章主要定理的验证。arxiv.org创新
复制研究表明 FLOP 仍然会错误预测 AI 运行时间,并且提议的修复方案在较新的硬件上失败
两位研究人员的预印本重现了一项早期研究,即为什么相同的 FLOP 计数并不意味着相同的执行时间。它证实了基本的说法,但报告称 α-FLOPs 校正公式通常会低估较新硬件上的运行时间,这显示了该公式无法捕获的跳跃和振荡。arxiv.org企业
基准论文发现法学硕士查询企业数据的四种方法,得分均低于 26%
新的 arXiv 预印本在综合双语基准上对企业数据库自然语言查询的四种架构进行了比较。没有人正确回答了超过四分之一的案例,而且得分最高的设计并不是最安全或最便宜的。arxiv.org创新
论文提出通过测量更强模型的收敛性来对没有标签的人工智能安全代理进行分级
新的 arXiv 预印本认为,安全团队可以通过测量配备记忆或检索的人工智能代理与更强大的“教师”模型的差距缩小多少来判断其是否正在学习,而不是根据通常稀缺或陈旧的标记基准。从类似动力模型来看,没有给出可用的信号。arxiv.org