返回新闻
安全AI Understanding 简报

Anthropic 宣布针对前沿人工智能部署的客户控制保障措施

Anthropic 表示,Enterprise Frontier Safeguards 将允许符合条件的组织将监控数据存储在自己的云环境中,同时使用自动检测来检测严重的人工智能滥用情况。

5 min readRead the primary source
Source-page capture accompanying Anthropic announces customer-controlled safeguards for frontier AI deployments
主要来源文件来源记录
出版商
anthropic.com
来源链接
anthropic.comhttps://www.anthropic.com/news/enterprise-frontier-safeguards
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
零数据保留
一种策略,在处理超出短暂的操作窗口后,不存储请求/响应有效负载。
延迟
发送请求和接收模型输出之间的时间。
测试一下自己人工智能道德测验

发生了什么

Anthropic 宣布推出 Enterprise Frontier Safeguards,这是一项计划中的企业服务,它将零数据保留与自动监控其前沿模型的严重滥用相结合。 The company says customer data will remain in infrastructure controlled by the customer, with rollout beginning in phases later this fall.

Anthropic says Enterprise Frontier Safeguards, or EFS, is designed to combine with safeguards that detect serious misuse.在规划的架构下,用于监控的活动数据可以存储在客户自己的云帐户中,包括Amazon S3、Azure Blob存储或Google云存储。客户可以使用自己的加密密钥、访问策略和审核日志记录。 Anthropic表示,该服务将在Claude Code、Claude Enterprise、Claude平台、Amazon Bedrock、AWS上的Claude平台、Google的代理平台和Microsoft Foundry上得到支持。

该公司表示,EFS 是由金融服务、医疗保健、制造、电信、法律、零售和公共部门的 100 多家客户开发的。 Anthropic 还指定 Amazon Web Services、Google Cloud 和 Microsoft Azure 为云合作伙伴。该公司表示,该设计涉及安全、合规、产品和交付团队,包括系统性风险分析和弹性中心的成员以及康卡斯特、毕马威、万事达卡、Salesforce 和 Visa 等公司。这些是Anthropic和参与组织的声明;消息来源没有独立核实他们的评估。

Anthropic 表示,该系统将分析滚动的流量窗口,以查找严重滥用的信号,包括试图开发攻击性网络或生物能力以及被盗或泄露凭证的迹象。警报将直接发送给客户,客户的人员可以对其进行调查。 Anthropic says no human review by Anthropic employees is required. Customer-owned storage, customer-managed encryption keys and fully automated review are described as optional controls.该公司表示,EFS 不会改变模型行为、API 定价或速率限制,并且 Anthropic 不会对该服务收费,尽管客户可能会产生普通的云存储、读取、写入和数据输出费用。 The announcement presents these controls as parts of the planned service rather than as changes to the underlying models.其描述将存储、加密、访问和警报处理与客户现有的云环境联系起来。因此,Anthropic 规定的范围涵盖了监控功能以及参与组织处理结果记录的方式。

来源详情: anthropic.com ↗

为什么这很重要

该服务解决了受监管组织的一个核心问题:检测多个人工智能会话中的滥用可能需要保留活动数据,而隐私和合规性规则可能会限制数据的存储位置以及谁可以查看数据。

该公告解决了更强大的人工智能系统带来的紧张局势。 Anthropic 表示,Claude Fable 5.1 等模型具有更强的智能和代理能力,增加了误用和自主不当行为的可能性。该公司表示,复杂的滥用行为可能涉及跨会话和帐户的许多任务,因此更难以通过孤立的、立即丢弃的交互来识别。因此,随着时间的推移将活动关联起来的监控系统可以提供严格的零保留设置无法提供的信息。

该功能会产生单独的隐私和合规性问题。受监管的组织可能会对哪些供应商可以保存敏感记录以及哪些人可以查看特权法律材料、非公开信息或药物安全报告进行限制。 EFS 旨在让这些组织将日志保存在他们已经控制的基础设施中,并应用他们现有的密钥、权限和审核系统。如果按照所述实施,则可以减少将 Anthropic 或其他外部数据托管人添加到组织的可信供应商列表中的需要。

实际意义仍然取决于绩效和治理。该消息来源包含富国银行、Stripe、Snowflake、Cognition、Factory 和其他组织高管的认可,但它没有提供对检测准确性、误报率、延迟或覆盖范围的独立测试。它还没有证明客户控制的存储可以消除所有隐私或安全风险。该服务将重要的责任转移给客户,包括访问控制、调查、保留决策和警报响应。拟议的安排还将检测信号的行为与该过程中使用的记录的保管分开。在Anthropic的描述中,客户保留对存储、密钥、权限和审查的控制。这种分离是该服务声称适合需要监控同时限制外部访问敏感活动数据的组织的基础。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
交互式概念检查+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

接下来看什么

关键的未知因素是监控的有效性、如何确定资格以及客户将如何响应警报。 Anthropic has not provided detection-performance measures, detailed technical specifications, or a firm availability date.

第一个问题是部署。 Anthropic 表示,EFS 将分阶段推出,从今年秋季晚些时候开始,目标是在秋季晚些时候广泛使用。该公告没有给出具体日期、定义所有资格要求或说明每个阶段将有多少客户获得访问权限。它还表示,该公司正在努力支持为符合条件的客户提供服务的第三方产品,但没有给出这些产品的时间表或列表。

第二个问题是技术透明度。 Anthropic 没有描述监控模型、精确的保留窗口、生成标志的阈值、检测期间传输到 Anthropic 的信息或防止监控过程被操纵的保障措施。消息人士也没有说明警报的优先级如何,客户是否可以审核检测系统,或者服务如何处理跨越云帐户或组织边界的活动。

第三个问题是旗帜后的问责。客户人员(而不是 Anthropic 员工)应进行任何人工审核。这可能有助于组织满足内部保密要求,但这也意味着结果将取决于每个客户的人员配置、培训、升级规则和采取行动的意愿。后续报告应检查现实世界的可用性、客户调查、误报、误用、云成本以及该架构是否在不损害其应保护的隐私保证的情况下提供有意义的安全收益。该公告保留了这些运营问题,同时描述了 Anthropic 及其客户的预期责任。可用性、配置和调查实践将决定提案是否在列出的产品和云环境中一致工作。这些细节还将展示服务的隐私、安全和安全目标在实践中如何相互作用。

相关指南和测验

AI 伦理人工智能代理人工智能模型解释AI 的未来测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注AI监管追踪器
觉得这有用吗?