リニア アテンション カーネルとパフォーマー カーネル
線形アテンションは、Transformers の 2 次ソフトマックス アテンションを、シーケンスの長さに応じて線形にスケールする数学トリックに置き換えます。
概要
Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.
ディープダイブ
標準の Transformer アテンションは、すべてのトークンのペア間のスコアを計算し、シーケンス長の 2 乗 (O(n^2)) に応じて増加する時間とメモリを消費します。線形アテンションは計算を書き換えるので、コストは線形 (O(n)) にのみ増加します。重要なアイデア: ソフトマックスの注目はソフトマックス(QK^T)V ですが、ソフトマックスをカーネル特徴マップ phi に置き換えると、phi(Q)(phi(K)^T V) が得られます。行列の乗算は結合的であるため、最初に phi(K)^T V (小さな d 行 d 列の行列) を計算し、巨大な n 行 n 列のスコア行列を完全に回避します。 2020 年の Google からの Performer は、FAVOR+ (正の直交ランダム特徴による高速注意) を使用してこれを真のソフトマックスの忠実な近似にし、カーネル推定を不偏かつ安定に保つランダムな投影を描画します。
技術的な洞察
Performer の FAVOR+ は、正のランダム特徴を使用してソフトマックス カーネル exp(q.k) を近似します。指数関数でラップされたランダムなガウス投影を通じてクエリとキーをマッピングし、非負の注意重みを保証し、以前の推定量の数値不安定性を回避します。直交ランダム特徴を使用すると、分散が減少します。重要なのは、n 行 n 列のアテンション行列が実現されないため、メモリが 2 次から線形に低下し、数万のトークンのシーケンスが可能になることです。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
リニア アテンション カーネルとパフォーマー カーネルの将来
純粋な線形アテンションは、品質の点でソフトマックスに劣ることが多いため、この分野はハイブリッド、つまり状態空間モデル (Mamba)、ゲートされた線形アテンション、および少数のフルアテンション層と多くの線形層を混合したアーキテクチャに収束しつつあります。コンテキスト ウィンドウが数百万のトークンに近づくにつれて、線形および二次二次メカニズムはコスト面でますます魅力的となり、効率的なストリーミング推論とオンデバイス モデルのためにリカレント スタイルの線形アテンションが再検討されています。
現実世界の実装
完全な二次注意が GPU メモリを使い果たすような長いゲノムまたはタンパク質配列の処理
Performer スタイルのバックボーンを使用した、チャンク化のない非常に長いレポートのドキュメント レベルの要約
シーケンスが数万ステップにわたる効率的な長時間オーディオまたは時系列モデリング
一部のソフトマックス層を線形注意バリアントに置き換えることにより、ロングコンテキスト チャット モデルの推論コストを削減する
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Linear Attention and Performer Kernels quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
RWKV リニア アテンション
よくある質問
What is Linear Attention and Performer Kernels?
線形アテンションは、Transformers の 2 次ソフトマックス アテンションを、シーケンスの長さに応じて線形にスケールする数学トリックに置き換えます。 Performer は、ランダム特徴カーネルを使用してソフトマックスを近似する画期的な手法であり、非常に長いシーケンスを計算的に手頃な価格で実現します。
標準のソフトマックス アテンションがシーケンスの長さに応じてうまく調整できないのはなぜですか?
ソフトマックス アテンションはトークンのすべてのペアを比較し、n 行 n 列のスコア行列を生成するため、コストは O(n^2) に応じて増加します。
線形注意によって n 行 n 列の行列を回避できる数学的性質は何ですか?
行列の乗算は結合的であるため、phi(Q)phi(K)^T の代わりに、最初に小さな d 行 d 列の行列である phi(K)^T V を計算できます。
Performer の FAVOR+ メカニズムは何を近似していますか?
FAVOR+ は、正の直交ランダム特徴を使用して、完全なアテンション行列を形成せずに指数ソフトマックス カーネルを近似します。
Performer が以前の三角関数の特徴ではなく正のランダム特徴を使用するのはなぜですか?
ポジティブな特徴により、カーネル推定値が非負に保たれ、以前の sin/cos 特徴マップを悩ませていた不安定性や負の値が回避されます。
シーケンス長 n におけるパフォーマー スタイルのリニア アテンションのおおよその複雑さはどれくらいですか?
計算の順序を変更し、n 行 n 列の行列を構築しないことにより、コストはシーケンスの長さに比例して増加します。