机械可解释性
机械可解释性是将神经网络的内部计算逆向工程为人类可理解的算法的努力。
概述
Rather than asking 'which input mattered,' it asks 'what is this network actually computing, circuit by circuit?'
深入探讨
像 SHAP 这样的方法解释输入和输出,而机械可解释性打开了盒子并研究权重和激活本身。研究人员(尤其是 Anthropic、OpenAI 和学术界)将 Transformer 视为要反编译的程序,识别“电路”:实现特定功能的神经元和注意力头的子图。具有里程碑意义的发现包括“归纳头”,即复制模式以实现上下文学习的注意力头,以及发现单个神经元通常是“多语义的”,会触发许多不相关的概念,因为模型包含的特征多于维度(叠加)。现在使用稀疏自动编码器将它们分解为更清晰、单语义的“特征”,例如在金门大桥上激活的方向。
技术洞察
一个核心障碍是叠加:具有 d 个维度的网络可以通过将它们存储为几乎正交的方向来表示远远多于 d 个的特征,因此单个神经元会激发不相关的概念。稀疏自动编码器通过学习一个过完备的字典来解决这个问题,该字典一次仅使用几个活动单元来重建激活,从而呈现可解释的特征。然后,研究人员通过因果干预、消融或“修补”激活来验证电路,以确认某个组件确实执行了假设的计算。
战略影响
成本与预算
多年来,架构决策决定着性能和运营成本。
更清晰的判决
技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。
质量控制
更好的工程选择可以减少生产中的可靠性事故。
机械可解释性的未来
机械可解释性是人工智能安全的核心:了解内部结构可以让我们审核模型是否存在欺骗,检测危险功能,并通过直接编辑特征来引导行为。近期工作重点是将稀疏自动编码器扩展到前沿模型、自动化电路发现以及构建可靠的“特征字典”。我们的理想目标是“神经网络的 MRI”,这是一种在部署之前读取模型推理的方法,尽管忠实地解释数十亿参数的系统仍然是一个重大的开放挑战。
现实世界的实施
Anthropic 从 Claude 中提取了数百万个可解释的特征,并表明放大单个“金门大桥”特征会使模型着迷地提及这座桥,展示了直接的行为转向。
研究人员在变压器中发现了复制并延续重复标记模式的“感应头”,解释了上下文学习背后的关键机制。
激活补丁用于本地化模型存储事实的位置(例如,一个国家的首都),揭示负责的特定层和组件。
安全团队探测内部特征,以检测模型是否代表欺骗或不安全指令等概念,从而实现有针对性的监控或干预。
风险与防护栏
优化一项基准测试可以隐藏更广泛的系统弱点。
基础设施和维护成本常常被低估。
随着系统变得更加复杂,安全性和可观察性差距可能会扩大。
实施路线图
在实施之前定义延迟、质量和成本目标。
在实际负载和数据条件下进行基准测试。
仪器监控错误、漂移和用户影响。
在扩展之前准备回滚和事件响应路径。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mechanistic Interpretability quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Mechanistic Interpretability?
机械可解释性是将神经网络的内部计算逆向工程为人类可理解的算法的努力。它不是问“哪个输入重要”,而是问“这个网络逐条电路实际计算的是什么?”
机械可解释性的中心目标是什么?
机械可解释性旨在理解网络内部实现的实际算法,而不仅仅是输入输出关系。
神经网络中的“叠加”指的是什么?
叠加通过将概念存储为几乎正交的重叠方向,使网络能够编码比其神经元/维度更多的概念,从而产生多语义神经元。
什么是“感应头”?
感应头检测当前标记的先前出现并复制其后的内容,这是实现上下文学习的关键机制。
研究人员如何确认发现的电路确实执行了假设的计算?
激活补丁或消融等因果方法测试更改组件是否实际上改变了相关行为,从而验证其作用。
为什么机械可解释性被认为对人工智能安全很重要?
了解内部功能和电路可以对欺骗或危险功能进行审核,并允许有针对性的干预,支持更安全的部署。