已验证来源
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
简单的英语
发生了什么、为什么重要以及值得关注的内容——无需行话。
无填料
当信号很弱时,我们不会发布任何内容,而是填充提要。
更多故事
9 故事创新
Apple 研究人员报告了稀缺数据训练模型的缩放定律
一项针对 2,000 多次语言模型训练运行的研究表明,稀缺目标数据可以混合重复 15-20 次,最佳速率因规模和计算而异。machinelearning.apple.com创新
Apple 研究人员提出词汇替换以改善多语言模型训练
Apple 研究人员描述了 LINK,这是一种预训练干预措施,可将选定的英语单词替换为目标语言的单词级翻译。该论文报告了八种语言和五种模型大小的改进,包括在达到同等下游性能方面加速了两倍。machinelearning.apple.com政策
立场文件呼吁在人工智能代理做出市场决策之前进行认证
一份立场文件报告了 DeepSeek-R1 代理人在模拟 Bertrand 定价市场中的默契共谋,即使在人类提示反对共谋之后也是如此。它认为观察行为认证应该先于经济市场中推理代理的部署;证据和保障措施仍处于初步阶段。arxiv.org创新
系统回顾描绘了大型语言模型在心理健康领域的日益增长的使用
一项系统综述调查了如何研究大型语言模型用于心理健康分析、风险评估、治疗支持和多模式监测,同时强调尚未解决的伦理和监管挑战。arxiv.org政策
立场文件认为,仅靠模型卡可能无法管理开放重量基础模型
ICML 2026 立场文件分析了 500 个 Hugging Face 模型卡,认为开放权重基础模型需要协调的模型卡、可接受的使用政策和许可证来解决安全和治理差距。arxiv.org创新
拟议的指标将衡量游戏世界的预测难度
一份立场文件提出了过渡复杂性概况,这是一种标准化方法,用于描述游戏环境的动态对于游戏世界建模和强化学习的不可预测性和长期性。arxiv.org创新
FM-Bench 测试 AI 代理能否管理一家足球俱乐部 20 年
一项新的 arXiv 基准测试将 15 个语言模型代理置于 20 年的足球管理模拟中,测试他们在短期选择影响长期结果时是否能够做出一致的决策。arxiv.org创新
FinRCA-Bench 发现金融人工智能诊断在很大程度上取决于证据检索
新的 arXiv 基准报告显示,仅更改检索方法即可将固定模型在财务调节案例上的准确率从 2.05% 提高到 72.44%。研究还发现,正确的根本原因标签通常并不意味着系统返回了足够的证据来进行可审核的诊断。arxiv.org创新
Abra 论文绘制了扩散图像训练中的计算和数据权衡
一项新的 arXiv 研究提出了跨计算预算从 10^19 到 10^22 FLOP 的文本到图像扩散模型的缩放律实验。它的作者报告说,图像模型每个参数需要比语言模型更多的数据才能有效训练。arxiv.org