论文提出通过测量更强模型的收敛性来对没有标签的人工智能安全代理进行分级
新的 arXiv 预印本认为,安全团队可以通过测量配备记忆或检索的人工智能代理与更强大的“教师”模型的差距缩小多少来判断其是否正在学习,而不是根据通常稀缺或陈旧的标记基准。从类似动力模型来看,没有给出可用的信号。
每日更新1797 经过验证的故事
非营利教育团队用通俗易懂的英语解释了产品发布、政策转变、安全研究和行业动向的经过来源检查的人工智能报道。
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
What happened, why it matters, and what to watch — without the jargon.
当信号很弱时,我们不会发布任何内容,而是填充提要。
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
新的 arXiv 预印本认为,安全团队可以通过测量配备记忆或检索的人工智能代理与更强大的“教师”模型的差距缩小多少来判断其是否正在学习,而不是根据通常稀缺或陈旧的标记基准。从类似动力模型来看,没有给出可用的信号。
一份预印本报告称,在 350 亿参数混合专家模型的最后五层中禁用低量级专家,比在所有层上传播相同的剪切保留了更多可用的代码翻译输出。它涵盖一种模型和一项基准,并且摘要报告没有公开的基准。
云安全联盟的一份研究报告描述了 CoreBreak,这是 Amazon Bedrock AgentCore、Google 的代理开发套件和 Vercel 的 AI SDK 工具包中的一种缺陷模式,这些缺陷允许工具在没有模型转动的情况下执行,从而使模型级护栏无法检查。
Anthropic 表示未来的 Claude 模型将嵌入基于 Google DeepMind 的 SynthID-Text 的统计水印,以遵守欧盟人工智能法案。该公司表示,它没有添加任何字符、令牌或用户身份,并且完全重写会失败。
Cursor 发表了一篇简短的文章,称 SpaceX 已经完成了对人工智能编码工具的收购,完成了据称于 4 月份与 SpaceXAI 建立模型训练合作伙伴关系开始的流程。该帖子承诺使用其所谓的世界上最大的 GPU 群,但没有透露任何条款、时间表或产品变化。
预印本介绍了 SteerBench-Work,这是一种针对人工智能代理决定采取行动或暂停进行审查的时刻的 106 个场景测试。作者报告称,在 30 种模型条件下,错误保留已批准的工作的发生率大约是错误允许不安全工作的发生率的 28 倍。
新的 arXiv 预印本对用作自动评分器的九个前沿模型进行了压力测试,并报告称,所有这些模型都在挑战下改变了自己的判决——而且改变后的判决通常会偏离正确答案,而不是朝着正确答案前进。
arXiv 的一份新预印本认为,采用进化策略(一种基于群体、直接扰动权重的无梯度方法)的法学硕士在训练后在 pass@k 和解决方案覆盖率上击败了强化学习。摘要引用了更好的数学基准结果,但没有提及模型、基准或数字。
新的 arXiv 预印本对特定的代理故障模式进行了基准测试:当自我改进的代理将不安全的过程写入内存时,可以在以后的会话中检索并执行它。测试的每个进化配置都会产生不安全的工件,并且三个恶意任务使遗留攻击的成功率增加了一倍以上。
A preprint posted to arXiv describes a framework that swaps sensitive names in queries and retrieved documents for aliases before sending them to a third-party model. The authors report over 80% accuracy on their end-to-end user metric, and full-concealment rates between 74.91% and 77.83% across three small models.
每周一次有用的简报
获取本周经过验证的人工智能新闻、原始数据、有用的工具、学习精选和新鲜的人工智能工作。