技术指南

人工智能可解释性中的叠加和多义性

人工智能可解释性中的叠加是神经网络将许多特征打包到共享方向的方式,这使得单个神经元看起来具有多语义性并且更难以解释。

阅读时间:2分钟最后更新

深入探讨

现实世界的数据包含比层的维度更有意义的特征,因此网络会压缩它们。在叠加中,该模型将特征表示为激活空间中几乎正交的方向,而不是为每个特征分配一个神经元。这是可行的,因为大多数功能都是稀疏的(很少同时活动),因此偶尔的干扰是可以接受的成本。结果是多语义神经元:Anthropic 的“叠加玩具模型”(2022)显示单个神经元会针对猫脸、汽车前面和某些文本模式等进行放电。重要的是,网络可以执行比神经元更多的计算,但前提是特征足够稀疏,碰撞很少见。

技术洞察

从几何角度来说,如果必须在 m 维中存储 n 个特征,且 n 大于 m,则无法使它们全部正交。该模型将它们排列为许多几乎正交的向量,接受小的干扰。玩具模型揭示了结构化几何形状,例如对映体对和五边形。稀疏性是启用条件:当只有少数特征同时触发时,预期的干扰保持在较低水平,因此表示额外特征的好处超过了噪音。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

人工智能可解释性中叠加和多义性的未来

理解叠加是可解释性的基础:稀疏自动编码器的存在正是为了撤销它。未来的工作旨在预测模型何时以及如何进入叠加,设计减少有害干扰的架构,并量化可以安全打包的特征数量的限制。如果研究人员能够可靠地将叠加“展开”为大规模的单语义特征,那么不安全电路的审核模型就会变得更加容易处理,将一个混乱的黑匣子变成更接近可读代码的东西。

现实世界的实施

Anthropic 的 2022 年“叠加玩具模型”显示随着稀疏性的增加,受控的特征包装

InceptionV1 中的视觉神经元对多个不相关的物体做出反应,这是多语义的典型案例

解释为什么探测单个语言模型神经元会给出跨主题的令人困惑的、混合的结果

激励稀疏自动编码器,其专门用于将叠加激活分解回单个概念

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Superposition and Polysemanticity in AI Interpretability quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

DeepSpeed 和 Megatron 训练堆栈

常见问题

What is Superposition and Polysemanticity in AI Interpretability?

人工智能可解释性中的叠加是神经网络将许多特征打包到共享方向的方式,这使得单个神经元看起来具有多语义性并且更难以解释。

神经网络中的“叠加”指的是什么?

叠加是通过在激活空间中使用近正交、重叠的方向来编码比维度更独特的特征的策略。

尽管存在特征干扰,什么条件才能使叠加正常工作?

由于大多数功能很少同时处于活动状态,因此冲突很少发生,因此干扰成本保持较低。

什么是“多语义”神经元?

多语义神经元会激发多个不相关的特征,这是叠加的可观察结果。

哪篇 Anthropic 论文介绍了 2022 年这一现象的对照研究?

“叠加玩具模型”使用小型可控网络来演示特征何时以及如何组合在一起。

如果一个层必须存储比其尺寸更多的特征,那么在几何上什么是不可避免的?

您无法拟合比维度更多的相互正交向量,因此特征最终会出现尽可能多的几乎正交的方向,并有一些重叠。