技术指南

训练数据归因的影响函数

影响函数估计每个训练示例对模型预测的影响程度,让您可以将输出追溯到导致该结果的数据。

阅读时间:2分钟最后更新

概述

They matter because they turn an opaque model into something auditable for copyright, debugging, and trust.

深入探讨

影响函数来自稳健的统计数据,并于 2017 年被 Koh 和 Liang 应用于深度学习。核心问题是反事实的:如果删除或增加特定训练示例,模型在测试点上的损失将如何变化?影响函数不是实际进行再训练(这是极其昂贵的),而是使用微积分来近似该变化。他们计算训练点和测试点的损失梯度,然后通过损失的逆 Hessian 矩阵将它们连接起来,从而捕获模型参数空间的曲率。较大的积极影响意味着训练示例推动模型朝着其预测方向发展;较大的负值意味着它会推动它。结果是最负责任的培训示例的排名列表。

技术洞察

精确的公式需要所有参数的损失的逆 Hessian 矩阵,这对于十亿参数的模型来说是很棘手的。从业者使用 LiSSA(随机迭代反演)、克罗内克因子曲率 (EK-FAC) 或随机投影(例如 TRAK)等方法来近似它。 Anthropic 2023 年的工作使用 EK-FAC 将影响函数扩展到大型语言模型,揭示了有影响力的示例通常共享抽象模式而不是精确的表面措辞。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

训练数据归因影响函数的未来

预计基于影响力的归因将成为人工智能问责的基础设施。监管机构和法院在调查受版权保护的文本是否形成输出时需要示例级别的出处,而开发人员将使用它来显示标签错误或有毒的数据。 TRAK 和梯度草图等更便宜的近似方法正在将归因推向实时,将其与遗忘相结合可以让团队在无需完全重新训练的情况下消除文档的影响。

现实世界的实施

追踪哪些受版权保护的书籍对语言模型生成的段落影响最大,以进行法律和许可分析

通过显示错误标记的训练图像来调试错误分类,这些图像将模型推向错误的答案

检测对特定预测产生巨大影响的中毒或异常训练示例

审核信用或招聘模型,以显示哪些历史记录推动了有争议的决策

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Influence Functions for Training Data Attribution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

完全分片数据并行

常见问题

What is Influence Functions for Training Data Attribution?

影响函数估计每个训练示例对模型预测的影响程度,让您可以将输出追溯到导致该结果的数据。它们很重要,因为它们将不透明的模型变成了可审核版权、调试和信任的模型。

影响函数近似什么反事实问题?

影响函数估计扰动训练示例的权重对测试点损失的影响,近似留一法再训练而不这样做。

哪个数学对象使得大型模型的精确影响计算变得困难?

经典的影响力公式需要对所有参数进行 Hessian 矩阵求逆,这对于具有数十亿参数的模型来说是不可行的。

谁在 2017 年的一篇著名论文中将影响函数应用于现代深度学习?

Pang Wei Koh 和 Percy Liang 于 2017 年发表的论文“通过影响函数理解黑盒预测”将该技术引入深度学习。

负面影响值较大说明什么?

负面影响意味着增加训练示例的权重会降低模型对预测的置信度,即它与输出相反。

Anthropic 使用哪种近似将影响函数扩展到大型语言模型?

Anthropic 的 2023 年研究使用 EK-FAC 来近似逆 Hessian,从而能够对大型语言模型进行影响分析。