テクニカルガイド

ロジットレンズとチューンドレンズ

ロジット レンズと調整レンズは、最終的な答えを生成する前に、トランスフォーマーの隠れ状態をレイヤーごとに覗いて、モデルが何を「考えている」かを確認する解釈可能性テクニックです。

2分の読書最終更新日

概要

They reveal how a prediction gradually forms as information flows up through the network.

ディープダイブ

トランスフォーマーは、その答えを段階的に構築します。各層は、実行中の「残留ストリーム」に追加され、最後にのみ単語の確率に変換されます。 2020 年に nostalgebraist によって導入されたロジット レンズは、モデルの最終的な非埋め込み (および層ノルム) を中間層に直接適用することでこれをショートカットし、あらゆる深さでネットワークの最良の推測を読み出すことができます。これは、多くの場合、中期から後期の層で答えが結晶化していることを示しています。調整されたレンズ (Belrose とその同僚、2023) は、層ごとに小さなアフィン プローブをトレーニングして隠れ状態を最終的な基礎に変換することでそれを改善し、生のロジット レンズが被るバイアスと不正確さを、特に初期の層や異なるモデル ファミリ間で修正します。

技術的な洞察

どちらの方法も残差ストリーム ビューを利用します。すべての層が共有ベクトルに追加的な更新を書き込み、後で非埋め込み行列が語彙ロジットに投影します。ロジット レンズは、追加のトレーニングを行わずに、中間状態での正確なアンエンベディングを再利用します。代わりに、調整されたレンズはレイヤーごとの線形マップ (学習された「トランスレーター」) を学習するため、各レイヤーの状態が最終レイヤーが期待する形式に変換され、よりスムーズで忠実で複雑度の低い予測が得られます。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

Logit LensとTuned Lensの未来

レンズ技術は、事実、拒否、偏見が深度にわたってどのように現れるかを追跡し、モデルが早い段階で答えを「知っている」時期を特定するための標準になりつつあります。これらをスパース オートエンコーダや因果パッチと組み合わせることで、予測の説明からメカニズムの説明に移行することが期待されます。研究では、中間の読み取り値によって、モデルが最終出力に隠した潜在的な知識や欺瞞が明らかになるかどうかについても調査が行われており、レンズは安全監査や早期警告モニタリングの構成要素の候補となっています。

現実世界の実装

ロジット レンズを使用して、モデルの中間層に首都が現れるなどの事実に基づく答えを観察する

調整されたレンズを適用して、さまざまなモデル ファミリが深度全体の予測にどのように収束するかを比較する

モデルが出力の数層前に内部的に答えを「決定」したことを検出する

有害または偏ったトークン予測が最初に残留ストリームで支配的になるレイヤーを診断する

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Logit Lens and Tuned Lens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ロジットレンズと中間層のデコーディング

よくある質問

What is Logit Lens and Tuned Lens?

ロジット レンズと調整レンズは、最終的な答えを生成する前に、トランスフォーマーの隠れ状態をレイヤーごとに覗いて、モデルが何を「考えている」かを確認する解釈可能性テクニックです。これらは、情報がネットワークを介して流れてくるにつれて、予測がどのように徐々に形成されるかを明らかにします。

ロジットレンズは何をするのですか?

ロジット レンズは、既存の非埋め込みを通じて中間の残差ストリーム状態を投影し、各深さでモデルの予測されたトークンを確認します。

調整されたレンズは、生のロジット レンズに比べてどのような重要な改善点をもたらしますか?

調整されたレンズは層ごとの線形変換器を学習し、バイアスを修正し、生のロジット レンズよりも忠実で低複雑度の読み取り値を提供します。

トランスのどのような構造がこのレンズを可能にしているのでしょうか?

各レイヤーは共有残差ストリームに追加的な更新を書き込むため、そのストリームを早期に投影することで中間予測に近似します。

オリジナルのロジット レンズを導入したのは誰で、おおよそいつですか?

ロジット レンズは、GPT-2 の中間予測を分析する 2020 年のブログ投稿で nostalgebraist によって紹介されました。

ロジットレンズが最終的な答えを「結晶化している」と示すのはどこでしょうか?

読み取り値は通常、計算が蓄積されるにつれて、中間層から後期層にわたる正しいトークン獲得確率を示します。