语言人工智能指南

宪法人工智能

宪法人工智能是Anthropic使用一套书面原则(“宪法”)来调整模型的方法,因此人工智能可以批评和修改自己的答案,而不是仅仅依靠人类来标记有害内容。

阅读时间:2分钟最后更新

概述

It aims to make models helpful and harmless with far less human labor.

深入探讨

传统的对齐依赖于人类反馈的强化学习(RLHF),人们对大量模型输出(包括令人不安的输出)进行排名,以教导模型要避免什么。宪法人工智能通过为模型提供一份明确的书面原则清单来减轻这一负担,这些原则来自《联合国人权宣言》和信任与安全最佳实践等来源。训练有两个阶段。首先,监督阶段:模型生成响应,然后针对宪法原则对其进行批评,并将其重写为更好的;这些自我改进的答案用于对其进行微调。其次,强化学习阶段,RLAIF,模型本身根据构成对响应对进行排名,并且人工智能生成的偏好数据训练奖励模型。这些原则是透明且可编辑的,使得指导模型的值可以检查,而不是隐藏在不透明的人类标签中。

技术洞察

这两个阶段通常称为 SL-CAI 和 RL-CAI。在监督学习中,“批评和修改”循环促使模型找到自己的答案违反采样原则的地方并重写它,生成没有人类伤害标签的训练数据。在强化学习阶段,第二个模型会判断两个响应中哪一个更符合宪法,生成人工智能偏好标签 (RLAIF),用于训练标准强化学习中使用的奖励模型。该宪法是注入提示的纯文本指导,因此更改模型的行为可以像编辑原则一样直接。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

宪法人工智能的未来

宪法人工智能指向“可扩展的监督”,随着模型的能力变得强大到人类无法检查每一个输出,人工智能可以帮助监督人工智能。期待更丰富、更细致的宪法、选择原则的公共和参与性投入(Anthropic 已经进行了“集体宪法人工智能”实验),以及将人类反馈与人工智能自我批评相结合的混合方法。书面原则的透明度对于想要查看系统编码的价值观的监管机构和审计人员来说很有吸引力。随着前沿模型的进步,让模型根据明确的规则可靠地批判和改进自己的方法可能会成为安全的核心。

现实世界的实施

训练聊天机器人拒绝帮助制造武器,让其根据避免伤害原则批评自己的草案答案并重写它

用宪法指导下的人工智能生成的偏好数据(RLAIF)取代昂贵的人类红队有毒输出标签

编辑书面原则来调整模型的谨慎程度,然后观察行为变化,而无需重新标记数千个示例

开展集体意见练习,让公众提出塑造模型构成的原则

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Constitutional AI?

宪法人工智能是Anthropic使用一套书面原则(“宪法”)来调整模型的方法,因此人工智能可以批评和修改自己的答案,而不是仅仅依靠人类来标记有害内容。它的目标是用更少的人力使模型变得有用且无害。

宪法人工智能中的“宪法”是什么?

宪法是一套透明的书面原则,取自人权文件等来源,模型用它来评估和改进其答案。

宪法人工智能旨在减少标准 RLHF 的哪些关键问题?

通过让模型对原则进行自我批判,宪法人工智能减少了审查和标记令人不安或有害的输出的人力。

在宪法人工智能的监督阶段,模型对自己的输出做了什么?

该模型运行一个批评和修改循环:它确定其草稿违反抽样原则的地方,然后重写答案,创建自我改进的训练数据。

强化学习阶段的RLAIF代表什么?

RLAIF 是指根据人工智能反馈进行强化学习:模型根据构成对响应进行排名,生成人工智能生成的偏好数据而不是人类标签。

为什么使用书面原则被认为有利于提高透明度?

由于指导值是写出来的,因此可以直接检查、审核和编辑它们,这与分散的人类评级中隐式编码的偏好不同。