技术指南

激活指导和表示工程

激活控制通过在运行时直接在其隐藏激活内添加或减去向量来推动模型的行为,无需重新训练。

阅读时间:2分钟最后更新

概述

它是一个精确、可解释的旋钮,无需微调即可控制语气、诚实度或安全性。

深入探讨

大型语言模型将概念表示为其高维激活空间中的方向。表示工程研究这些方向,激活转向将它们用作控制杆。您通常通过对对比提示上的激活之间的差异进行平均(例如诚实与欺骗性答案)来找到概念的“引导向量”,然后在推理过程中将该向量添加到模型的剩余流中,按比例放大或缩小。沿着“拒绝”方向推动,模型下降更多;向相反的方向推,它会更顺从。因为您在推理时进行干预,所以效果是立即的、可逆的,并且可以通过单个系数进行调整。这使其成为安全研究、调试隐藏行为和轻量级控制的强大工具,尽管转向太猛会降低连贯性,并且为一个提示集找到的向量可能无法泛化。

技术洞察

引导向量通常计算为所选层上成对的正例和负例之间的平均激活差(“均值差”方向)。在推理时,您将系数 * 向量添加到该层的残差流中,从而移动每个后续计算。线性表示假设,即许多特征被编码为近似线性方向,是这项工作得以实现的原因;它连接到稀疏自动编码器,将激活分解为可解释的特征,然后可以进行限制。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

激活指导和表示工程的未来

转向正在成为一个实用的安全和对齐层:检测和抑制有害方向的实时防护,显示数十个可调节行为“滑块”的仪表板,以及与稀疏自动编码器功能库的集成以实现细粒度控制。开放的挑战包括使向量在不同的环境中泛化、防止强力转向时能力损失以及防止误用。期望可解释性研究与部署相结合,以便模型附带可审计、可调整的内部控制。

现实世界的实施

研究人员添加了“诚实”引导向量,以减少模型在事实问题上胡言乱语的倾向。

安全团队加强了推理时的拒绝方向,使模型能够更可靠地拒绝有害请求,而无需重新训练。

通过隔离概念方向并观察放大或抑制它如何改变输出来探索模型的隐藏偏差。

使用单一转向系数即时调整书写语气(正式与休闲),而不是立即进行工程或微调。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Activation Steering and Representation Engineering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

SwiGLU 和门控激活

常见问题

什么是激活指导和表示工程?

激活控制通过在运行时直接在其隐藏激活内添加或减去向量来推动模型的行为,无需重新训练。它是一个精确、可解释的旋钮,无需微调即可控制语气、诚实度或安全性。

激活转向在模型运行的哪个点进行干预?

在推理过程中,转向会在模型的激活中添加或减去向量,因此不需要重新训练,并且效果是立竿见影的。

通常如何计算转向矢量?

典型的方法是均值差:一种行为的平均激活减去另一种行为,以隔离该概念的方向。

哪个假设是激活转向起作用的基础?

转向依赖于被编码为近似线性方向的概念,因此添加向量会移动相关特征。

转向矢量控制的比例系数是多少?

将向量乘以较大的系数会使行为变得更加困难;负系数则以相反的方式推动。

过于激进地操纵模型的已知风险是什么?

大规模干预可能会导致模型的激活偏离正常流形,即使目标行为发生变化,也会损害流畅性和推理能力。