发生了什么
Anthropic 宣布了一项 500 万美元的资助计划,用于人工智能对用户福祉影响的独立研究。它表示,受资助者将获得直接资助、使用 Anthropic 模型和技术支持,同时保持完全独立并将其评估作为开源项目发布。
8 月 25 日,Anthropic 宣布了一项 500 万美元的资助计划,重点用于人工智能系统如何影响用户福祉的独立研究。该公司表示,该计划将为构建开源评估的研究人员提供直接资金、模型访问和技术支持。 Anthropic将预期输出描述为全行业开发人员可以使用的基准和评估项目,而不是仅限于Anthropic内部系统的评估。
Anthropic 表示,受资助者将完全独立工作,并将他们的作品作为开源项目发布。该公告没有具体说明资助将如何分配、将选择多少项目、单个奖项的规模,或者在受资助者获得 Anthropic 的模型访问和技术支持时将采取哪些正式保障措施来保护研究独立性。这些细节仍然未知。
该公司围绕人工智能在工作、教育、解决问题和情感支持对话中日益重要的作用提出了需求。该公司表示,对于用户向模特寻求陪伴或在心理健康危机期间使用人工智能等情况,目前还没有明确的行业标准。 Anthropic 还表示,幸福感比许多模型行为更难评估,因为对话的风险可能会随着时间的推移而变化,并且可能取决于之前披露的信息。
例如,Anthropic 表示,有关饮食或运动的反应单独看来可能是合理的,但如果用户有饮食失调的历史,就会变得不合适。它表示,其自己的保障措施旨在识别此类背景并指导 Claude 的应对措施,而其对与 Claude 对话的研究则为保障措施的开发和评估提供信息。这些陈述描述了 Anthropic 的方法和主张;该公告没有提供任何独立结果表明这些保障措施是有效的。
为什么这很重要
该计划针对的是人工智能评估中的一个难题:健康风险可能会在长时间的对话中逐渐出现,并且在很大程度上取决于用户的背景。更好的独立基准可以帮助开发者评估有害的合规性和过度拒绝,尽管 Anthropic 尚未披露赠款规模、接受者数量或如何管理独立性。
该提案解决了评估对话式人工智能的一个核心弱点:单一答案可能无法揭示系统是否安全地处理敏感交互。用户的情况可能会在多个回合中变得更加清晰,并且在一种情况下可以接受的响应在另一种情况下可能是有害的。捕捉这些变化的评估可以为开发人员和研究人员提供更现实的基础来判断情感敏感使用的安全性。
Anthropic 的指南要求进行评估,以明确定义什么算作通过或未通过,以及为什么该标准很重要。它还要求研究人员让临床和主题专家参与设计和验证。这种强调是必然的,因为健康判断可能涉及心理健康、饮食失调、危机应对以及通用语言质量测试可能会错过重要风险的其他领域。
该公司还表示,评估应同时测试预防措施和危害。这意味着不仅要检查模型是否太容易满足有风险的请求,还要检查模型是否在适当的有用响应时过于广泛地拒绝。这种过度遵守与过度拒绝的区别可以使评估为真实用户提供更多信息,但消息来源并未确定最终受资助者将采用哪些阈值或定义。
Anthropic 希望场景类似于实际使用,通常是通过风险升级和环境变化的多轮对话。它还进一步表示,自动评分器应该根据真正的主题专家进行验证。如果严格实施,这些要求可能有助于暴露简短的静态基准提示所忽略的故障。实用价值将取决于所选研究的质量、其开放性以及其他开发人员是否采用最终的测试。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
Why can ethical evaluation not be reduced to one model score?
接下来看什么
申请截止日期为 2026 年 9 月 21 日,受邀提交完整提案的申请人预计将于 10 月 5 日收到通知。关键测试将是最终的评估是否使用临床专业知识、反映现实的多轮对话、根据专家验证自动分级器以及产生超越 Anthropic 自己的模型的方法。
眼前的里程碑是 2026 年 9 月 21 日的申请截止日期。Anthropic 表示,被选中提交完整提案的申请人将于 10 月 5 日之前收到通知。该公告没有提供最终奖项、资助研究的开始或结果发布的日期,因此该项目的近期规模和进度尚无法评估。
选择过程将受到严格审查。重要的悬而未决的问题包括谁将选择受资助者、如何处理利益冲突、研究人员是否可以在未经审查的情况下发表不利的发现、需要什么模型访问以及该计划是否会资助评估 Claude 以外的系统的工作。 Anthropic的独立主张是有意义的,但消息来源并未描述其背后的合同条款。
由此产生的评估结果应评估超过基准分数。留意场景代表长时间对话、临床专家参与设计和验证以及分级人员根据专家判断进行检查的证据。基准测试是否衡量过度遵守和过度拒绝造成的危害,以及它们的方法是否可以被 Anthropic 之外的开发人员复制和使用也很重要。
最后,该计划的更广泛影响将取决于采用情况。 Anthropic 表示,这些项目将是开源的,可供任何开发人员使用,但它没有透露参与研究人员、计划的基准、发布场所或全行业标准化机制。在这些细节和结果出现之前,该公告建立了资金承诺和评估议程,而不是人工智能福祉风险已经解决的证据。