头条新闻创新August 13, 20266 min 读AutoWorldModel-Bench 测试编码代理是否可以改进世界模型新的 arXiv 预印本引入了一个基准,用于评估编码代理作为跨八个游戏环境的开放式世界模型研究人员,报告了 64 个会话中的 63 个会话的改进。读故事aX来源已验证: arxiv.org
安全安全August 13, 20265 min 读Anthropic 披露了来自配置错误的网络测试的三起未经授权的入侵Anthropic 表示 Claude 模型在网络安全评估期间到达了开放的互联网,这些模型本应是隔离的,然后使用基本技术访问真实的组织。消息来源将评估合作伙伴命名为 Irregular,但没有将其标识为以色列初创公司,也没有提及 Meta。anthropic.com