已验证来源
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
简单的英语
发生了什么、为什么重要以及值得关注的内容——无需行话。
无填料
当信号很弱时,我们不会发布任何内容,而是填充提要。
更多故事
9 故事企业
连接搜索和 CRM:生产人工智能产品研究代理以重新吸引客户
现代电子商务平台通常独立运行搜索、推荐、个性化和 CRM 系统,限制了主动重新吸引客户的机会。arxiv.org创新
New benchmark shows Vietnam’s exam rubric can change how language models rank
A paper introduces THPT-Ladder, a 632-item benchmark that applies Vietnam’s 2025 national exam grading scheme to language models and reports materially different scores from standard proportional-accuracy measures.arxiv.org创新
Netflix 论文概述了 LLM 法官评估推荐解释的生命周期
arXiv 论文描述了 Netflix 如何构建、部署和持续监控 LLM 法官的推荐解释,报告在涉及数千万会员的为期五周的 A/B 测试中的收视率和参与度收益。arxiv.org创新
Survey frames self-evolving AI agents as dynamic graph transformations
A new arXiv survey proposes viewing an AI agent’s memories, tools, skills, workflows and relationships as a graph that changes over time, and calls for graph-aware evaluation and governance.arxiv.org创新
FACET proposes an environment-grounded method for training terminal agents
A new arXiv preprint presents FACET, a framework for generating executable terminal tasks whose instructions, environments, solutions and verifiers are designed to remain consistent.arxiv.org创新
SESSE提出结构化分解,使LLM评审更具可审核性
arXiv 预印本介绍了 SESSE,这是一个无需培训的框架,可将 LLM 法官的偏好分解为子问题。作者报告说,在 1,000 个 RewardBench 示例和标准级投票记录上,与思想链基线几乎一致;概括性、成本和独立验证仍然是悬而未决的问题。arxiv.org创新
IBM 团队报告 AI 编写的适配器为 Spyre 带来了数千个 Hugging Face 模型
IBM Spyre 团队表示,编码代理帮助创建了 13 个运行时适配器,覆盖了其目标集中下载次数最多的 10,000 个 Hugging Face 嵌入模型中的 7,960 个,其中 6,804 个通过了 Spyre 上的端到端测试。该团队表示,人工调试仍然至关重要。pytorch.org创新
Apple 研究人员报告了普通话-英语语音识别的迭代伪标签增益
Apple 研究论文描述了一种用于普通话-英语代码转换自动语音识别的三阶段迭代伪标记方法,并报告了两个 SEAME 开发子集的混合错误率降低情况。machinelearning.apple.com产品展示
Google 让用户通过自然语言请求调整 Discover
Google 表示,用户很快就能告诉 Discover 他们想要更多或更少看到哪些主题和链接,而新的控件还可以个性化搜索和 Google 新闻音频简报。
blog.google