テクニカルガイド

トレーニングデータの帰属に対する影響関数

影響関数は、各トレーニング サンプルがモデルの予測をどの程度形成したかを推定し、出力をその原因となったデータまで追跡できるようにします。

2分の読書最終更新日

概要

They matter because they turn an opaque model into something auditable for copyright, debugging, and trust.

ディープダイブ

影響関数は堅牢な統計から得られ、2017 年に Koh と Liang によって深層学習に適用されました。中心的な疑問は反事実です。特定のトレーニング サンプルが削除されたり、重み付けが増加した場合、テスト ポイントでのモデルの損失はどのように変化するでしょうか。実際に再トレーニングする (絶望的にコストがかかる) のではなく、影響関数は微積分を使用してその変化を近似します。トレーニング ポイントとテスト ポイントの損失の勾配を計算し、モデルのパラメーター空間の曲率を捉える損失の逆ヘシアンを介してそれらを接続します。大きなプラスの影響は、トレーニング サンプルがモデルを予測に向けて推進したことを意味します。大きな負の値は、それが押し込まれたことを意味します。その結果、最も責任のあるトレーニング例のランク付けされたリストが得られます。

技術的な洞察

正確な式には、すべてのパラメーターにわたる損失の逆ヘシアンが必要ですが、これは 10 億パラメーターのモデルでは困難です。専門家は、LiSSA (確率的反復逆変換)、クロネッカー因子曲率 (EK-FAC)、または TRAK などのランダム投影などの方法を使用してこれを近似します。 Anthropic の 2023 年の研究では、EK-FAC を使用して影響関数を大規模な言語モデルに拡張し、影響力のある例が表面上の正確な表現ではなく抽象的なパターンを共有することが多いことを明らかにしました。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

トレーニング データ アトリビューションのための影響関数の将来

影響力に基づくアトリビューションが AI の説明責任のインフラストラクチャになることが期待されます。著作権で保護されたテキストが出力を形成したかどうかを調査する規制当局や裁判所はサンプルレベルの出所証明を必要とし、開発者はそれを使用して、ラベルが間違っていたり汚染されたデータを表面化するでしょう。 TRAK やグラデーション スケッチのような安価な近似により、アトリビューションのリアルタイム化が進んでおり、それを非学習と組み合わせることで、チームは完全な再トレーニングを行わずにドキュメントの影響を除去できる可能性があります。

現実世界の実装

法的およびライセンス分析のために、言語モデルが生成した文章にどの著作権で保護された書籍が最も影響を与えたかを追跡します。

モデルを間違った答えに導く誤ったラベルの付いたトレーニング画像を明らかにすることによる誤分類のデバッグ

特定の予測に多大な影響を与える、毒されたまたは異常なトレーニング例の検出

信用モデルまたは雇用モデルを監査して、どの過去の記録が争点となった決定を引き起こしたかを明らかにする

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Influence Functions for Training Data Attribution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

完全にシャード化されたデータ並列

よくある質問

What is Influence Functions for Training Data Attribution?

影響関数は、各トレーニング サンプルがモデルの予測をどの程度形成したかを推定し、出力をその原因となったデータまで追跡できるようにします。これらが重要なのは、不透明なモデルを著作権、デバッグ、信頼のために監査可能なものに変えるためです。

影響関数が近似する反事実的な質問は何ですか?

影響関数は、テスト ポイントでの損失に対するトレーニング サンプルの重みの摂動の影響を推定し、それを行わずに Leave-one-out 再トレーニングを近似します。

大規模モデルでは正確な影響計算が困難になる数学的オブジェクトはどれですか?

古典的な影響の公式では、すべてのパラメーターにわたってヘッセ行列を逆変換する必要がありますが、これは数十億のパラメーターを持つモデルでは実行不可能です。

2017 年の有名な論文で影響関数を現代の深層学習に適応させたのは誰ですか?

Pang Wei Koh と Percy Liang の 2017 年の論文「Understanding Black-box Predictions via Influence Functions」は、この技術を深層学習に導入しました。

大きな NEGATIVE 影響値は何を示していますか?

マイナスの影響とは、トレーニング例が予測におけるモデルの信頼性を低下させるであろう重み付けを高くすること、つまり、出力に反対することを意味します。

Anthropic は、インフルエンス関数を大規模な言語モデルに拡張するためにどの近似を使用しましたか?

Anthropic の 2023 年の研究では、EK-FAC を使用して逆ヘッセ行列を近似し、大規模な言語モデルに対する影響分析を可能にしました。