已验证来源
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
简单的英语
发生了什么、为什么重要以及值得关注的内容——无需行话。
无填料
当信号很弱时,我们不会发布任何内容,而是填充提要。
更多故事
9 故事创新
Replication Study Says FLOPs Still Mispredict AI Runtime, and the Proposed Fix Fails on Newer Hardware
A preprint by two researchers reproduces an earlier study on why equal FLOP counts do not mean equal execution time. It confirms the underlying claim but reports that the α-FLOPs correction formula generally underestimates runtime on newer hardware, which shows jumps and oscillations the formula does not capture.arxiv.org企业
基准论文发现法学硕士查询企业数据的四种方法,得分均低于 26%
新的 arXiv 预印本在综合双语基准上对企业数据库自然语言查询的四种架构进行了比较。没有人正确回答了超过四分之一的案例,而且得分最高的设计并不是最安全或最便宜的。arxiv.org创新
论文提出通过测量更强模型的收敛性来对没有标签的人工智能安全代理进行分级
新的 arXiv 预印本认为,安全团队可以通过测量配备记忆或检索的人工智能代理与更强大的“教师”模型的差距缩小多少来判断其是否正在学习,而不是根据通常稀缺或陈旧的标记基准。从类似动力模型来看,没有给出可用的信号。arxiv.org创新
新基准测试人工智能助手能否记住一年的手机使用情况
arXiv 上发布的一份由 17 位作者组成的技术报告介绍了 MobileMem,这是一个根据一年规模的移动体验集合构建的设备上长期记忆的基准和框架。摘要描述了设计,但没有报告分数,并且有关基础数据的关键细节仍未公开。arxiv.org创新
论文报告大型语言模型中出现的类脑模块化组织
arXiv 的新预印本称,基于四个认知领域 46 项任务的电路分析,大型语言模型开发了功能专门的内部结构,与不同的人脑网络相一致。摘要页面未说明关键的方法细节。arxiv.org创新
论文发现专家混合模型的后期层可以承受严重的专家掩蔽
一份预印本报告称,在 350 亿参数混合专家模型的最后五层中禁用低量级专家,比在所有层上传播相同的剪切保留了更多可用的代码翻译输出。它涵盖一种模型和一项基准,并且摘要报告没有公开的基准。arxiv.org安全
CoreBreak 缺陷让代理工具在没有调用模型的情况下运行
云安全联盟的一份研究报告描述了 CoreBreak,这是 Amazon Bedrock AgentCore、Google 的代理开发套件和 Vercel 的 AI SDK 工具包中的一种缺陷模式,这些缺陷允许工具在没有模型转动的情况下执行,从而使模型级护栏无法检查。labs.cloudsecurityalliance.org政策
Anthropic 详细说明 Claude 的文本水印如何工作
Anthropic 表示未来的 Claude 模型将嵌入基于 Google DeepMind 的 SynthID-Text 的统计水印,以遵守欧盟人工智能法案。该公司表示,它没有添加任何字符、令牌或用户身份,并且完全重写会失败。
anthropic.com工业
Cursor 表示 SpaceX 收购已正式完成
Cursor 发表了一篇简短的文章,称 SpaceX 已经完成了对人工智能编码工具的收购,完成了据称于 4 月份与 SpaceXAI 建立模型训练合作伙伴关系开始的流程。该帖子承诺使用其所谓的世界上最大的 GPU 群,但没有透露任何条款、时间表或产品变化。
cursor.com